PdfExtractor
Overview
PdfExtractor є класом в Aspose.PDF FOSS для .NET. Наследники від: IDisposable.
Фасад для вилучення тексту та зображень з PDF-документу.
Цей клас надає 29 методів для роботи з об’єктами PdfExtractor в програмах .NET. Доступні методи включають: BindPdf, Close, Dispose, ExtractAttachment, ExtractImage, ExtractText, GetAttachNames, GetAttachment, GetAttachmentInfo, GetNextImage, GetNextPageText, GetText, і 3 додаткові методи. Всі публічні члени доступні будь-якій додаткові .NET після встановлення Aspose.PDF FOSS для пакету .Net. Свойства: EndPage, ExtractImageMode, ExtractTextMode, IsBidi, Password, Resolution, і ще два.
Properties
| Name | Type | Access | Description |
|---|---|---|---|
StartPage | int | Читання/писання | 1-based start page for extraction. |
EndPage | int | Читання/писання | 1-based end page for extraction. |
ExtractTextMode | int | Читання/писання | Режим вилучення тексту. |
ExtractImageMode | ExtractImageMode | Читання/писання | Стратегія вилучення зображень. |
Resolution | int | Читання/писання | Резолюція рендеру для екстракції зображень (DPI). |
IsBidi | bool | Read | Правда, коли останній екстрагований текст містить почерк з правої на ліву сторону (єврейське, арабське, сирійський, таана і т. д.), тобто:. |
Password | string? | Читання/писання | Пароль, який використовується при зв’язку зашифрованих PDF. |
TextSearchOptions | Aspose.Pdf.Text.TextSearchOptions | Читання/писання | Опозиції пошуку тексту, що застосовуються під час ExtractText(). |
Methods
| Signature | Description |
|---|---|
PdfExtractor() | Покликає PdfExtractor на цьому прикладі PdfExtractor. |
PdfExtractor(document: Document) | |
BindPdf(inputFile: string) | Покликає BindPdf на цьому прикладі PdfExtractor. |
BindPdf(document: Document) | |
BindPdf(inputStream: Stream) | |
ExtractText() | Переходить кожну сторінку в зв’язаному документі з TextAbsorber і конкатеює екстрахований текст. |
ExtractText(outputFile: string) | Витягти текст з пов’язаного PDF і зберегти його в даному файлі (байти UTF-16 LE). |
ExtractText(encoding: Encoding) | Витягти текст з пов’язаного PDF за допомогою даного кодування. |
GetText(outputStream: Stream) | Записує екстрагований текст як байти в outputStream, використовуючи кодування, встановлене найостаннім закликом ExtractText ((Encoding) (за замовчуванням UTF-16 LE). |
GetText(outputStream: Stream, filterNotAscii: bool) | Випиває екстрагований текст як байти, можливо, спочатку викидаючи кодові точки не-ASCII. |
GetText(outputFile: string) | Напиває екстрагований текст на дану шлях файлу. |
HasNextPageText() | Правда, якщо текст іншої сторінки доступний через GetNextPageText. |
GetNextPageText(outputFile: string) | Напиває текст наступної сторінки на дану трасу файлу (байти UTF-16 LE). |
GetNextPageText(outputStream: Stream) | Напиває текст наступної сторінки в даний потік (байти UTF-16 LE). |
ExtractImage() | Покликає ExtractImage на цьому прикладі PdfExtractor. |
ExtractImage(outputDirectory: string) | Витягти кожен зображення в дану каталог, назвавши файли image_N.jpg для джерел JPEG і image-N .png інакше. |
HasNextImage() | True, поки GetNextImage(string) має залишне зображення для написання. |
GetNextImage(outputStream: Stream) | Покликає GetNextImage на цьому прикладі PdfExtractor. |
GetNextImage(outputFile: string) | |
GetNextImage(outputStream: Stream, format: System.Drawing.Imaging.ImageFormat) | |
GetNextImage(outputFile: string, format: System.Drawing.Imaging.ImageFormat) | |
ExtractAttachment() | Виберіть кожен вбудований файл у зв’язаному документі; наступна GetAttachment(струнка) записує всі вони. |
ExtractAttachment(attachmentFileName: string) | Виберіть один вбудований файл за назвою для вилучення. |
GetAttachNames() | Називи кожного вбудованого файлу у зв’язаному документі. |
GetAttachmentInfo() | FileSpecification записи для кожного вбудованого файлу у зв’язаному документі. |
GetAttachment() | Повертає зміст обраних додатків як MemoryStreams (всі додатки, якщо жоден з них не був чітко вибраний). |
GetAttachment(outputPath: string) | Напишіть обрані додатки (всі, коли жоден не був чітко вибраний) в каталог outputPath. Один файл на кожен додаток названо за його іменем файлу. |
Close() | Покликання Close на цій інстанції PdfExtractor. |
Dispose() | Покликання Dispose на цьому PdfExtractor інстанції. |