PdfExtractor

Opinie generală

PdfExtractor este o clasă în Aspose.PDF FOSS pentru .NET. Moștenitorii de la: IDisposable.

Fațadă pentru extragerea textului și a imaginilor dintr-un document PDF.

Această clasă oferă 29 de metode pentru a lucra cu obiecte PdfExtractor în programe .NET. Metodele disponibile includ: BindPdf, Close, Dispose, ExtractAttachment, ExtractImage, ExtractText, GetAttachNames, GetAttachment, GetAttachmentInfo, GetNextImage, GetNextPageText, GetText, și 3 metode suplimentare. Toți membrii publicului sunt accesibili oricărei aplicații .NET după instalarea pachetului Aspose.PDF FOSS for .Net. Proprietăți: EndPage, ExtractImageMode, ExtractTextMode, IsBidi, Password, Resolution, şi încă două.

Proprietăți

Numele de proprietateTipul de vehiculAccesulDescriere:
StartPageintCitire/scriere1-based start page for extraction.
EndPageintCitire/scriere1-based end page for extraction.
ExtractTextModeintCitire/scriereMod de extracţie a textului.
ExtractImageModeExtractImageModeCitire/scriereStrategie de extracţie a imaginii.
ResolutionintCitire/scriereRezoluție de renderizare pentru extracția imaginii (DPI).
IsBidiboolCiteşte.Adevărat atunci când cel mai recent text extras conține o scripție din dreapta la stânga (ebraică, arabă, siriecă, thaana etc.), adică:.
Passwordstring?Citire/scriereParola utilizată la legarea PDF-urilor criptate.
TextSearchOptionsAspose.Pdf.Text.TextSearchOptionsCitire/scriereOpțiunile de căutare text aplicate în timpul ExtractText().

Metode de evaluare

SemnăturaDescriere:
PdfExtractor()Chema PdfExtractor pe această instanță PdfExtractor.
PdfExtractor(document: Document)
BindPdf(inputFile: string)Chema BindPdf pe această instanță PdfExtractor.
BindPdf(document: Document)
BindPdf(inputStream: Stream)
ExtractText()Merge prin fiecare pagină din documentul legat cu TextAbsorber și concatenă textul extragit.
ExtractText(outputFile: string)Extrageți textul din PDF-ul legat și salvați-l în fișierul dat (byte UTF-16 LE).
ExtractText(encoding: Encoding)Extrageți textul din PDF-ul legat folosind codificarea dată.
GetText(outputStream: Stream)Scrie textul extragit ca bați în outputStream, folosind codificarea setată de cel mai recent ExtractText ((Codificare) apel (default la UTF-16 LE).
GetText(outputStream: Stream, filterNotAscii: bool)Scrie textul extragit ca bați, lăsând mai întâi punctele de cod non-ASCII.
GetText(outputFile: string)Scrie textul extragit în calea datelor.
HasNextPageText()Adevărat dacă există textul unei alte pagini disponibil prin GetNextPageText.
GetNextPageText(outputFile: string)Scrie textul paginii următoare în calea de fișier dată (byte UTF-16 LE).
GetNextPageText(outputStream: Stream)Scrie textul paginii următoare în fluxul dat (byte UTF-16 LE).
ExtractImage()Chema ExtractImage pe această instanță PdfExtractor.
ExtractImage(outputDirectory: string)Extrageți fiecare imagine din directorul dat, numind fișierele image_N.jpg pentru sursele JPEG și image _N .png altfel.
HasNextImage()E adevărat în timp ce GetNextImage(string) are o imagine rămasă de scris.
GetNextImage(outputStream: Stream)Chema GetNextImage pe această instanță PdfExtractor.
GetNextImage(outputFile: string)
GetNextImage(outputStream: Stream, format: System.Drawing.Imaging.ImageFormat)
GetNextImage(outputFile: string, format: System.Drawing.Imaging.ImageFormat)
ExtractAttachment()Selectați fiecare fișier încorporat din documentul legat; un GetAttachment ((string) ulterior le scrie pe toate.
ExtractAttachment(attachmentFileName: string)Selectați un singur fișier încorporat prin nume pentru extracție.
GetAttachNames()Numele fiecărui fișier încorporat din documentul legat.
GetAttachmentInfo()FileSpecification pentru fiecare fișier încorporat din documentul legat.
GetAttachment()Întoarce conținutul atașamentelor selectate ca MemoryStreams (toți ataşamentele când niciunul nu a fost selecționat în mod explicit).
GetAttachment(outputPath: string)Scrieți atașamentele selectate (toate atunci când niciuna nu a fost selecționată în mod explicit) în directoriul outputPath, un fișier pentru fiecare ataşament numit după numele său de fişier.
Close()Se cheamă închis pe această PdfExtractor instanță.
Dispose()Apeluri Dispose pe această instanță PdfExtractor.

Vezi și:

 Română