PdfExtractor
Opinie generală
PdfExtractor este o clasă în Aspose.PDF FOSS pentru .NET. Moștenitorii de la: IDisposable.
Fațadă pentru extragerea textului și a imaginilor dintr-un document PDF.
Această clasă oferă 29 de metode pentru a lucra cu obiecte PdfExtractor în programe .NET. Metodele disponibile includ: BindPdf, Close, Dispose, ExtractAttachment, ExtractImage, ExtractText, GetAttachNames, GetAttachment, GetAttachmentInfo, GetNextImage, GetNextPageText, GetText, și 3 metode suplimentare. Toți membrii publicului sunt accesibili oricărei aplicații .NET după instalarea pachetului Aspose.PDF FOSS for .Net. Proprietăți: EndPage, ExtractImageMode, ExtractTextMode, IsBidi, Password, Resolution, şi încă două.
Proprietăți
| Numele de proprietate | Tipul de vehicul | Accesul | Descriere: |
|---|---|---|---|
StartPage | int | Citire/scriere | 1-based start page for extraction. |
EndPage | int | Citire/scriere | 1-based end page for extraction. |
ExtractTextMode | int | Citire/scriere | Mod de extracţie a textului. |
ExtractImageMode | ExtractImageMode | Citire/scriere | Strategie de extracţie a imaginii. |
Resolution | int | Citire/scriere | Rezoluție de renderizare pentru extracția imaginii (DPI). |
IsBidi | bool | Citeşte. | Adevărat atunci când cel mai recent text extras conține o scripție din dreapta la stânga (ebraică, arabă, siriecă, thaana etc.), adică:. |
Password | string? | Citire/scriere | Parola utilizată la legarea PDF-urilor criptate. |
TextSearchOptions | Aspose.Pdf.Text.TextSearchOptions | Citire/scriere | Opțiunile de căutare text aplicate în timpul ExtractText(). |
Metode de evaluare
| Semnătura | Descriere: |
|---|---|
PdfExtractor() | Chema PdfExtractor pe această instanță PdfExtractor. |
PdfExtractor(document: Document) | |
BindPdf(inputFile: string) | Chema BindPdf pe această instanță PdfExtractor. |
BindPdf(document: Document) | |
BindPdf(inputStream: Stream) | |
ExtractText() | Merge prin fiecare pagină din documentul legat cu TextAbsorber și concatenă textul extragit. |
ExtractText(outputFile: string) | Extrageți textul din PDF-ul legat și salvați-l în fișierul dat (byte UTF-16 LE). |
ExtractText(encoding: Encoding) | Extrageți textul din PDF-ul legat folosind codificarea dată. |
GetText(outputStream: Stream) | Scrie textul extragit ca bați în outputStream, folosind codificarea setată de cel mai recent ExtractText ((Codificare) apel (default la UTF-16 LE). |
GetText(outputStream: Stream, filterNotAscii: bool) | Scrie textul extragit ca bați, lăsând mai întâi punctele de cod non-ASCII. |
GetText(outputFile: string) | Scrie textul extragit în calea datelor. |
HasNextPageText() | Adevărat dacă există textul unei alte pagini disponibil prin GetNextPageText. |
GetNextPageText(outputFile: string) | Scrie textul paginii următoare în calea de fișier dată (byte UTF-16 LE). |
GetNextPageText(outputStream: Stream) | Scrie textul paginii următoare în fluxul dat (byte UTF-16 LE). |
ExtractImage() | Chema ExtractImage pe această instanță PdfExtractor. |
ExtractImage(outputDirectory: string) | Extrageți fiecare imagine din directorul dat, numind fișierele image_N.jpg pentru sursele JPEG și image _N .png altfel. |
HasNextImage() | E adevărat în timp ce GetNextImage(string) are o imagine rămasă de scris. |
GetNextImage(outputStream: Stream) | Chema GetNextImage pe această instanță PdfExtractor. |
GetNextImage(outputFile: string) | |
GetNextImage(outputStream: Stream, format: System.Drawing.Imaging.ImageFormat) | |
GetNextImage(outputFile: string, format: System.Drawing.Imaging.ImageFormat) | |
ExtractAttachment() | Selectați fiecare fișier încorporat din documentul legat; un GetAttachment ((string) ulterior le scrie pe toate. |
ExtractAttachment(attachmentFileName: string) | Selectați un singur fișier încorporat prin nume pentru extracție. |
GetAttachNames() | Numele fiecărui fișier încorporat din documentul legat. |
GetAttachmentInfo() | FileSpecification pentru fiecare fișier încorporat din documentul legat. |
GetAttachment() | Întoarce conținutul atașamentelor selectate ca MemoryStreams (toți ataşamentele când niciunul nu a fost selecționat în mod explicit). |
GetAttachment(outputPath: string) | Scrieți atașamentele selectate (toate atunci când niciuna nu a fost selecționată în mod explicit) în directoriul outputPath, un fișier pentru fiecare ataşament numit după numele său de fişier. |
Close() | Se cheamă închis pe această PdfExtractor instanță. |
Dispose() | Apeluri Dispose pe această instanță PdfExtractor. |