PdfExtractor

Overview

PdfExtractor є класом в Aspose.PDF FOSS для .NET. Наследники від: IDisposable.

Фасад для вилучення тексту та зображень з PDF-документу.

Цей клас надає 29 методів для роботи з об’єктами PdfExtractor в програмах .NET. Доступні методи включають: BindPdf, Close, Dispose, ExtractAttachment, ExtractImage, ExtractText, GetAttachNames, GetAttachment, GetAttachmentInfo, GetNextImage, GetNextPageText, GetText, і 3 додаткові методи. Всі публічні члени доступні будь-якій додаткові .NET після встановлення Aspose.PDF FOSS для пакету .Net. Свойства: EndPage, ExtractImageMode, ExtractTextMode, IsBidi, Password, Resolution, і ще два.

Properties

NameTypeAccessDescription
StartPageintЧитання/писання1-based start page for extraction.
EndPageintЧитання/писання1-based end page for extraction.
ExtractTextModeintЧитання/писанняРежим вилучення тексту.
ExtractImageModeExtractImageModeЧитання/писанняСтратегія вилучення зображень.
ResolutionintЧитання/писанняРезолюція рендеру для екстракції зображень (DPI).
IsBidiboolReadПравда, коли останній екстрагований текст містить почерк з правої на ліву сторону (єврейське, арабське, сирійський, таана і т. д.), тобто:.
Passwordstring?Читання/писанняПароль, який використовується при зв’язку зашифрованих PDF.
TextSearchOptionsAspose.Pdf.Text.TextSearchOptionsЧитання/писанняОпозиції пошуку тексту, що застосовуються під час ExtractText().

Methods

SignatureDescription
PdfExtractor()Покликає PdfExtractor на цьому прикладі PdfExtractor.
PdfExtractor(document: Document)
BindPdf(inputFile: string)Покликає BindPdf на цьому прикладі PdfExtractor.
BindPdf(document: Document)
BindPdf(inputStream: Stream)
ExtractText()Переходить кожну сторінку в зв’язаному документі з TextAbsorber і конкатеює екстрахований текст.
ExtractText(outputFile: string)Витягти текст з пов’язаного PDF і зберегти його в даному файлі (байти UTF-16 LE).
ExtractText(encoding: Encoding)Витягти текст з пов’язаного PDF за допомогою даного кодування.
GetText(outputStream: Stream)Записує екстрагований текст як байти в outputStream, використовуючи кодування, встановлене найостаннім закликом ExtractText ((Encoding) (за замовчуванням UTF-16 LE).
GetText(outputStream: Stream, filterNotAscii: bool)Випиває екстрагований текст як байти, можливо, спочатку викидаючи кодові точки не-ASCII.
GetText(outputFile: string)Напиває екстрагований текст на дану шлях файлу.
HasNextPageText()Правда, якщо текст іншої сторінки доступний через GetNextPageText.
GetNextPageText(outputFile: string)Напиває текст наступної сторінки на дану трасу файлу (байти UTF-16 LE).
GetNextPageText(outputStream: Stream)Напиває текст наступної сторінки в даний потік (байти UTF-16 LE).
ExtractImage()Покликає ExtractImage на цьому прикладі PdfExtractor.
ExtractImage(outputDirectory: string)Витягти кожен зображення в дану каталог, назвавши файли image_N.jpg для джерел JPEG і image-N .png інакше.
HasNextImage()True, поки GetNextImage(string) має залишне зображення для написання.
GetNextImage(outputStream: Stream)Покликає GetNextImage на цьому прикладі PdfExtractor.
GetNextImage(outputFile: string)
GetNextImage(outputStream: Stream, format: System.Drawing.Imaging.ImageFormat)
GetNextImage(outputFile: string, format: System.Drawing.Imaging.ImageFormat)
ExtractAttachment()Виберіть кожен вбудований файл у зв’язаному документі; наступна GetAttachment(струнка) записує всі вони.
ExtractAttachment(attachmentFileName: string)Виберіть один вбудований файл за назвою для вилучення.
GetAttachNames()Називи кожного вбудованого файлу у зв’язаному документі.
GetAttachmentInfo()FileSpecification записи для кожного вбудованого файлу у зв’язаному документі.
GetAttachment()Повертає зміст обраних додатків як MemoryStreams (всі додатки, якщо жоден з них не був чітко вибраний).
GetAttachment(outputPath: string)Напишіть обрані додатки (всі, коли жоден не був чітко вибраний) в каталог outputPath. Один файл на кожен додаток названо за його іменем файлу.
Close()Покликання Close на цій інстанції PdfExtractor.
Dispose()Покликання Dispose на цьому PdfExtractor інстанції.

See Also

 Українська