PdfExtractor
المعلومات العامة
PdfExtractor هي فئة في Aspose.PDF FOSS لـ .NET. الميراث من: IDisposable.
واجهة لاستخراج النص والصور من مستند PDF.
توفر هذه الفئة 29 طريقة للعمل مع PdfExtractor كائنات في برامج .NET. المنهجيات المتاحة تشمل: BindPdf, Close, Dispose, ExtractAttachment, ExtractImage, ExtractText, GetAttachNames, GetAttachment, GetAttachmentInfo, GetNextImage, GetNextPageText, GetText,، و 3 طرق إضافية. جميع الأعضاء العامين يمكن الوصول إليهم من أي تطبيق .NET بعد تثبيت حزمة Aspose.PDF FOSS for .Net. خصائص: EndPage, ExtractImageMode, ExtractTextMode, IsBidi, Password, Resolution,و 2 آخرين.
خصائص
| اسم | النوع | الوصول | وصف |
|---|---|---|---|
StartPage | int | القراءة/ الكتابة | 1-based start page for extraction. |
EndPage | int | القراءة/ الكتابة | 1-based end page for extraction. |
ExtractTextMode | int | القراءة/ الكتابة | وضع استخراج النصوص. |
ExtractImageMode | ExtractImageMode | القراءة/ الكتابة | استراتيجية استخراج الصور. |
Resolution | int | القراءة/ الكتابة | تصميم التصوير لاستخراج الصور (DPI). |
IsBidi | bool | اقرأ | صحيح عندما يحتوي النص الذي تم استخراجه مؤخرًا على خط من اليمين إلى اليسار (العبرية والعربية والسريانية وتانا وغيرها) ، أي:. |
Password | string? | القراءة/ الكتابة | كلمة المرور المستخدمة عند ربط ملفات PDF المشفرة. |
TextSearchOptions | Aspose.Pdf.Text.TextSearchOptions | القراءة/ الكتابة | خيارات البحث النصية المطبقة خلال ExtractText (().). |
الطرق
| التوقيع | وصف |
|---|---|
PdfExtractor() | يدعو PdfExtractor على هذه الحالة PdfExtractor. |
PdfExtractor(document: Document) | |
BindPdf(inputFile: string) | يدعو BindPdf على هذه الحالة PdfExtractor. |
BindPdf(document: Document) | |
BindPdf(inputStream: Stream) | |
ExtractText() | يمر في كل صفحة من المستند المرتبط بـ TextAbsorber ويقوم بتجميع النص المستخرج. |
ExtractText(outputFile: string) | استخراج النص من PDF المرتبطة وحفظه في ملف معين (بايتات UTF-16 LE). |
ExtractText(encoding: Encoding) | استخراج النص من PDF المرتبطة باستخدام التشفير المعطى. |
GetText(outputStream: Stream) | يكتب النص المستخرج كبايتات في outputStream، باستخدام ترميز تم تعيينه بواسطة آخر ExtractText ((تشفير) دعوة (الترموز الافتراضي إلى UTF-16 LE). |
GetText(outputStream: Stream, filterNotAscii: bool) | يكتب النص المستخرج كبايت، وإذا كان ذلك ممكنًا فإن نقطة الشفرات غير ASCII ستسقط أولا. |
GetText(outputFile: string) | يكتب النص المقتطف إلى مسار ملف معين. |
HasNextPageText() | صحيح إذا كان هناك نص صفحة أخرى متاح من خلال GetNextPageText. |
GetNextPageText(outputFile: string) | يكتب نص الصفحة التالية إلى مسار الملف المعطى (بايتات UTF-16 LE). |
GetNextPageText(outputStream: Stream) | يكتب نص الصفحة التالية إلى البث المحدد (بايتات UTF-16 LE). |
ExtractImage() | يدعو ExtractImage على هذه الحالة PdfExtractor. |
ExtractImage(outputDirectory: string) | استخراج كل صورة إلى الدليل المحدد، وتسمية ملفات image_N.jpg لمصادر JPEG و image _ N.png خلاف ذلك. |
HasNextImage() | صحيح بينما GetNextImage(string) لديه صورة متبقية للكتابة. |
GetNextImage(outputStream: Stream) | يدعو GetNextImage على هذه الحالة PdfExtractor. |
GetNextImage(outputFile: string) | |
GetNextImage(outputStream: Stream, format: System.Drawing.Imaging.ImageFormat) | |
GetNextImage(outputFile: string, format: System.Drawing.Imaging.ImageFormat) | |
ExtractAttachment() | حدد كل ملف مدمج في المستند المقيد؛ GetAttachment ((string) التالي يكتب جميعها. |
ExtractAttachment(attachmentFileName: string) | حدد ملف واحد مدمج باسم للاستخراج. |
GetAttachNames() | أسماء كل ملف مدمج في المستند المقيد. |
GetAttachmentInfo() | FileSpecification إدخالات لكل ملف مدمج في المستند المقيد. |
GetAttachment() | أعيد محتوى المرفقات المحددة كـ MemoryStreams (جميع الملفات المملودة عندما لم يتم اختيار أي منها بشكل صريح). |
GetAttachment(outputPath: string) | اكتب المرفقات المختارة (كلّها عندما لم يتم اختيار أي منها بشكل صريح) في دليل outputPath، ملف واحد لكل ملحق يُسمي باسم مقطع الفيل. |
Close() | يطلب الإغلاق على هذه PdfExtractor حالة. |
Dispose() | تدعو إلى التخلص من هذه الحالة PdfExtractor. |