PdfExtractor
Общ преглед
PdfExtractor е клас в Aspose.PDF FOSS за .NET. Наследници от: IDisposable.
Фасад за извличане на текст и образи от PDF документ.
Този клас предоставя 29 метода за работа с PdfExtractor обекти в .NET програми. Наличните методи включват: BindPdf, Close, Dispose, ExtractAttachment, ExtractImage, ExtractText, GetAttachNames, GetAttachment, GetAttachmentInfo, GetNextImage, GetNextPageText, GetText, и 3 допълнителни методи. Всички публични членове са достъпни за всяко приложение .NET след инсталиране на пакета Aspose.PDF FOSS for .Net. Свойства: EndPage, ExtractImageMode, ExtractTextMode, IsBidi, Password, Resolution, и още 2 .
Свойства на веществата
| Име на фирмата: | Тип на изпитване | Достъп до информация | Описание на състоянието |
|---|---|---|---|
StartPage | int | Чете/Пише | 1-based start page for extraction. |
EndPage | int | Чете/Пише | 1-based end page for extraction. |
ExtractTextMode | int | Чете/Пише | Режим за извличане на текст. |
ExtractImageMode | ExtractImageMode | Чете/Пише | Стратегия за извличане на снимки. |
Resolution | int | Чете/Пише | Резолюция за извличане на изображения (DPI). |
IsBidi | bool | Прочети. | Вярно, когато най-скоро извлеченият текст съдържа ръкопис от дясно наляво (еврейски, арабски и сирийски език, таана и др.), т.е. |
Password | string? | Чете/Пише | Парола, използвана при свързване на криптирани PDF файлове. |
TextSearchOptions | Aspose.Pdf.Text.TextSearchOptions | Чете/Пише | опции за търсене на текст, прилагани по време на ExtractText(). |
Методи за изчисляване на данните
| Подписът | Описание на състоянието |
|---|---|
PdfExtractor() | Назовава PdfExtractor на този PdfExtractor пример. |
PdfExtractor(document: Document) | |
BindPdf(inputFile: string) | Назовава BindPdf на този PdfExtractor пример. |
BindPdf(document: Document) | |
BindPdf(inputStream: Stream) | |
ExtractText() | Преминава през всяка страница в свързания документ с TextAbsorber и съвпада извлечения текст. |
ExtractText(outputFile: string) | Извадете текст от свързания PDF и го запишете в даден файл (UTF-16 LE байтове). |
ExtractText(encoding: Encoding) | Извличане на текст от свързания PDF с помощта на даденото кодиране. |
GetText(outputStream: Stream) | Записва извлечения текст като байтове в outputStream, използвайки кодирането на последното повикване ExtractText ((Encoding) (по подразбиране UTF-16 LE). |
GetText(outputStream: Stream, filterNotAscii: bool) | Изписва извлечения текст като байтове, като първоначално се поставят кодове без ASCII. |
GetText(outputFile: string) | Написва извлечения текст на даден път за файл. |
HasNextPageText() | Истина, ако има друг текст на страница чрез GetNextPageText. |
GetNextPageText(outputFile: string) | Написва текста на следващата страница в даден път за файл (UTF-16 LE байтове). |
GetNextPageText(outputStream: Stream) | Написва текста на следващата страница в даден поток (UTF-16 LE байтове). |
ExtractImage() | Назовава ExtractImage на този PdfExtractor пример. |
ExtractImage(outputDirectory: string) | Извадете всяко изображение от даден директорий, като наречете файловете image_N.jpg за JPEG източници и image _N .png в противен случай. |
HasNextImage() | True, докато GetNextImage(string) има оставащо изображение за записване. |
GetNextImage(outputStream: Stream) | Назовава GetNextImage на този PdfExtractor пример. |
GetNextImage(outputFile: string) | |
GetNextImage(outputStream: Stream, format: System.Drawing.Imaging.ImageFormat) | |
GetNextImage(outputFile: string, format: System.Drawing.Imaging.ImageFormat) | |
ExtractAttachment() | Изберете всеки вграден файл във връзка с документа; последващ GetAttachment(струнка) пише всички от тях. |
ExtractAttachment(attachmentFileName: string) | Изберете един вграден файл по име за извличане. |
GetAttachNames() | Имена на всеки вграден файл във връзка с документа. |
GetAttachmentInfo() | FileSpecification вписвания за всеки вграден файл във връзка с документа. |
GetAttachment() | Връща съдържанието на избраните приложения като MemoryStreams (всички приставки, когато нито едно от тях не е изрично избрано). |
GetAttachment(outputPath: string) | Запишете избраните приложения (всички, когато никой не е изрично избран) в директорията outputPath. Един файл за всеки приложен файла с името на неговия файлов адрес. |
Close() | Назовава Close на този PdfExtractor случай. |
Dispose() | Назоваване на изхвърляне в този PdfExtractor случай. |