PdfExtractor

Обзор

PdfExtractor является классом в Aspose.PDF FOSS для .NET. Наследники от: IDisposable.

Фасад для извлечения текста и изображений из PDF-документа.

Этот класс предоставляет 29 методов для работы с объектами PdfExtractor в программах .NET. Доступные методы включают: BindPdf, Close, Dispose, ExtractAttachment, ExtractImage, ExtractText, GetAttachNames, GetAttachment, GetAttachmentInfo, GetNextImage, GetNextPageText, GetText, и 3 дополнительных метода. Все публичные участники доступны для любого приложения .NET после установки пакета Aspose.PDF FOSS for .Net. Свойства: EndPage, ExtractImageMode, ExtractTextMode, IsBidi, Password, Resolution,И еще два.

Свойства

Наименование:Тип:AccessОписание:
StartPageintЧитать/писать1-based start page for extraction.
EndPageintЧитать/писать1-based end page for extraction.
ExtractTextModeintЧитать/писатьРежим извлечения текста.
ExtractImageModeExtractImageModeЧитать/писатьСтратегия извлечения изображений.
ResolutionintЧитать/писатьРезолюция рендеринга для извлечения изображений (DPI).
IsBidiboolЧитайте .Верно, когда последний извлеченный текст содержит с правой на левую строку (еврейский, арабский и сирийский языки), т.е.
Passwordstring?Читать/писатьПароль, используемый при связывании зашифрованных файлов PDF.
TextSearchOptionsAspose.Pdf.Text.TextSearchOptionsЧитать/писатьОпции поиска текста, применяемые во время ExtractText().

Методы

SignatureОписание:
PdfExtractor()Вызывает PdfExtractor на данном примере PdfExtractor.
PdfExtractor(document: Document)
BindPdf(inputFile: string)Вызывает BindPdf на данном примере PdfExtractor.
BindPdf(document: Document)
BindPdf(inputStream: Stream)
ExtractText()Проходит через каждую страницу в связанном документе с TextAbsorber и соединяет извлеченный текст.
ExtractText(outputFile: string)Вытащить текст из связанного PDF-файла и сохранить его в данном файле (байты UTF-16 LE).
ExtractText(encoding: Encoding)Вытащить текст из связанного PDF с помощью указанного кодирования.
GetText(outputStream: Stream)Записывает извлеченный текст в виде байтов в outputStream, используя кодирование, установленное последним вызовом ExtractText ((Encoding) (по умолчанию UTF-16 LE).
GetText(outputStream: Stream, filterNotAscii: bool)Написывает извлеченный текст в виде байтов, первым выпадают кодовые точки не-ASCII.
GetText(outputFile: string)Написывает извлеченный текст на указанную траекторию файла.
HasNextPageText()Верно, если текст другой страницы доступен через GetNextPageText.
GetNextPageText(outputFile: string)Написывает текст следующей страницы на данный путь файла (байты UTF-16 LE).
GetNextPageText(outputStream: Stream)Написывает текст следующей страницы в данный поток (байты UTF-16 LE).
ExtractImage()Вызывает ExtractImage на данном примере PdfExtractor.
ExtractImage(outputDirectory: string)Вытаскивать каждое изображение в данный каталог, называя файлы image_N.jpg для источников JPEG и image-N .png иначе.
HasNextImage()Верно, пока GetNextImage(string) имеет оставшееся изображение для записи.
GetNextImage(outputStream: Stream)Вызывает GetNextImage на данном примере PdfExtractor.
GetNextImage(outputFile: string)
GetNextImage(outputStream: Stream, format: System.Drawing.Imaging.ImageFormat)
GetNextImage(outputFile: string, format: System.Drawing.Imaging.ImageFormat)
ExtractAttachment()Выберите каждый встроенный файл в связанном документе; последующая GetAttachment(струнка) записывает их все.
ExtractAttachment(attachmentFileName: string)Выберите один встроенный файл по имени для извлечения.
GetAttachNames()Имена каждого встроенного файла в связанном документе.
GetAttachmentInfo()FileSpecification - это записи для каждого встроенного файла в связанном документе.
GetAttachment()Возвращение содержимого выбранных приложений как MemoryStreams (все приложения, если ни одно из них не было четко отображено).
GetAttachment(outputPath: string)Напишите выбранные приложения (все, когда ни одно из них не было четко отображено) в каталог outputPath. Один файл на каждый прилагаемый файль назван по его имени.
Close()Вызывает Close в этом случае PdfExtractor .
Dispose()Позывы “Удалить” на данном примере PdfExtractor.

См. также:

 Русский