PdfExtractor
סקירה כללית
PdfExtractor הוא שיעור ב Aspose.PDF FOSS עבור .NET. מורשת מ : IDisposable.
פקס כדי לחלץ טקסט ותמונות מתוך מסמך PDF.
שיעור זה מספק 29 שיטות לעבוד עם אובייקטים ב- .NET תוכניות. שיטות זמינות כוללות: BindPdf, Close, Dispose, ExtractAttachment, ExtractImage, ExtractText, GetAttachNames, GetAttachment, GetAttachmentInfo, GetNextImage, GetNextPageText, GetText,3 שיטות נוספות. כל החברים הציבוריים זמינים לכל יישום .NET לאחר התקנת Aspose.PDF FOSS עבור חבילת .Net. רכוש : EndPage, ExtractImageMode, ExtractTextMode, IsBidi, Password, Resolution,ועוד 2 עוד.
נכסים
| שם | סוג | גישה | תיאור |
|---|---|---|---|
StartPage | int | קרא / כתיבה | 1-based start page for extraction. |
EndPage | int | קרא / כתיבה | 1-based end page for extraction. |
ExtractTextMode | int | קרא / כתיבה | שיטת הוצאת טקסט. |
ExtractImageMode | ExtractImageMode | קרא / כתיבה | אסטרטגיית תמונה של חשיפה. |
Resolution | int | קרא / כתיבה | רדיואקטיביות עבור תמונה (DPI). |
IsBidi | bool | קראו | נכון כאשר הטקסט שנלקח לאחרונה מכיל תבנית ימין לימין (הברברית, הערבית, הסורית, תאנה וכו ‘), כלומר. |
Password | string? | קרא / כתיבה | הסיסמה המשמשת בעת חיבור PDFs מוצפנים. |
TextSearchOptions | Aspose.Pdf.Text.TextSearchOptions | קרא / כתיבה | אפשרויות חיפוש טקסט הושלמו במהלך ExtractText(). |
שיטות
| חתימה | תיאור |
|---|---|
PdfExtractor() | צלצול PdfExtractor על האינדקס הזה PdfExtractor. |
PdfExtractor(document: Document) | |
BindPdf(inputFile: string) | צלצול BindPdf על האינדקס הזה PdfExtractor. |
BindPdf(document: Document) | |
BindPdf(inputStream: Stream) | |
ExtractText() | כל דף במסמך המובנה נכנס עם TextAbsorber ומסכם את הטקסט שנלקח. |
ExtractText(outputFile: string) | הוציא את הטקסט מה- PDF המוגבל והחזיק אותו לקובץ מסוים (בייטים UTF-16 LE). |
ExtractText(encoding: Encoding) | הוספת טקסט מה- PDF המורכב באמצעות הקוד שניתן. |
GetText(outputStream: Stream) | כותב את הטקסט המוצא בתור באטים לתוך outputStream, באמצעות הקוד שנקבע על ידי השיחה האחרונה ExtractText(קוד) (התכונות של UTF-16 LE). |
GetText(outputStream: Stream, filterNotAscii: bool) | כותב את הטקסט המוצא בתור באטים, בעזרת נקודות קוד שאינן ASCII תחילה. |
GetText(outputFile: string) | כתיבת הטקסט המוצא לדרך הקובץ. |
HasNextPageText() | נכון אם יש טקסט של דף אחר זמין דרך GetNextPageText. |
GetNextPageText(outputFile: string) | כתיבת הטקסט של הדף הבא לדרך הקובץ שניתנה (בייטים UTF-16 LE). |
GetNextPageText(outputStream: Stream) | כתיבת הטקסט של הדף הבא לתוך הזרם (UTF-16 LE באטים). |
ExtractImage() | צלצול ExtractImage על האינדקס הזה PdfExtractor. |
ExtractImage(outputDirectory: string) | הוציא כל תמונה לתוך התיעוד, שם קבצים image_N.jpg עבור מקורות JPEG ו image-N .png אחרת. |
HasNextImage() | נכון בעוד GetNextImage(string) יש תמונה שנשארת לכתוב. |
GetNextImage(outputStream: Stream) | צלצול GetNextImage על האינדקס הזה PdfExtractor. |
GetNextImage(outputFile: string) | |
GetNextImage(outputStream: Stream, format: System.Drawing.Imaging.ImageFormat) | |
GetNextImage(outputFile: string, format: System.Drawing.Imaging.ImageFormat) | |
ExtractAttachment() | בחר כל קובץ מוטבע במסמך המוגבל; GetAttachment(string) הבא כותב את כולם. |
ExtractAttachment(attachmentFileName: string) | בחר קובץ מוטבע יחיד לפי שם עבור החילוץ. |
GetAttachNames() | שמות של כל קובץ מוטבע במסמך מחובר. |
GetAttachmentInfo() | FileSpecification כניסות עבור כל קובץ מוטבע במסמך מחובר. |
GetAttachment() | החזיר את התוכן של תוספים שנבחרו כ MemoryStreams (כל התוספות כאשר לא נבחרה באופן מפורש). |
GetAttachment(outputPath: string) | כתיבת התוספים שנבחרו (כל כאשר אף אחד מהם לא נבחן באופן מפורש) לתוך תיעוד outputPath, קובץ אחד לכל תוסף שנקרא על שמו של הקובצי. |
Close() | צלצול קרוב על האינדקס הזה PdfExtractor. |
Dispose() | שיחות נוכח על זה PdfExtractor דוגמה. |