PdfExtractor
Översikt
PdfExtractor är en klass i Aspose.PDF FOSS för .NET. ärvt från: IDisposable.
Facade för att extrahera text och bilder från ett PDF-dokument.
Denna klass innehåller 29 metoder för att arbeta med PdfExtractor objekt i .NET-program. Tillgängliga metoder inkluderar: BindPdf, Close, Dispose, ExtractAttachment, ExtractImage, ExtractText, GetAttachNames, GetAttachment, GetAttachmentInfo, GetNextImage, GetNextPageText, GetText,och tre ytterligare metoder. Alla offentliga medlemmar är tillgängliga för alla .NET-applikationer efter att ha installerat Aspose.PDF FOSS för .Net-paketet. och egenskaper: EndPage, ExtractImageMode, ExtractTextMode, IsBidi, Password, Resolution,Och 2 mer.
ägodelar
| Namn | Typ av | Access | Beskrivning |
|---|---|---|---|
StartPage | int | Läs/ Skriv | 1-based start page for extraction. |
EndPage | int | Läs/ Skriv | 1-based end page for extraction. |
ExtractTextMode | int | Läs/ Skriv | Text Extraction Mode. |
ExtractImageMode | ExtractImageMode | Läs/ Skriv | Bildutvinning strategi. |
Resolution | int | Läs/ Skriv | Rendering för bildutvinning (DPI). |
IsBidi | bool | Läsning | Sanningen är när den senaste texten innehåller en höger till vänster skriptkörning (hebreu, arabiska, syriska och thaanska etc.), dvs. |
Password | string? | Läs/ Skriv | Password som används vid bindning av en krypterad PDF. |
TextSearchOptions | Aspose.Pdf.Text.TextSearchOptions | Läs/ Skriv | Text-sökalternativ som tillämpas under ExtractText(). |
Metoder
| Signature | Beskrivning |
|---|---|
PdfExtractor() | Kalla PdfExtractor på detta PdfExtractor instans. |
PdfExtractor(document: Document) | Kalla PdfExtractor(dokument) på detta PdfExtractor instans. |
BindPdf(inputFile: string) | Kalla BindPdf(inputFile) på detta PdfExtractor instans. |
BindPdf(document: Document) | Kalla BindPdf(dokument) på detta PdfExtractor instans. |
BindPdf(inputStream: Stream) | Kalla BindPdf(inputStream) på detta PdfExtractor instans. |
ExtractText() | Gå varje sida i det länkade dokumentet med TextAbsorber och sammanfattar den extraherade texten. |
ExtractText(outputFile: string) | Extract text från den begränsade PDF-filen och spara det till den angivna filen (UTF-16 LE byter). |
ExtractText(encoding: Encoding) | Extract text från den bunden PDF med hjälp av den angivna kodningen. |
GetText(outputStream: Stream) | Skriv ut den extraherade texten som byter i outputStream, med hjälp av kodningen som ställts in av det senaste ExtractText(Encoding) samtalet (default till UTF-16 LE). |
GetText(outputStream: Stream, filterNotAscii: bool) | Skriv ut den extraherade texten som byter, alternativt droppa icke-ASCII kodpunkter först. |
GetText(outputFile: string) | Skriv ut den extraherade texten till den angivna filvägen. |
HasNextPageText() | Sanningen är om det finns en annan sida text tillgänglig via GetNextPageText. |
GetNextPageText(outputFile: string) | Skriv text på nästa sida till den angivna filvägen (UTF-16 LE byter). |
GetNextPageText(outputStream: Stream) | Skriv text på nästa sida till den angivna strömmen (UTF-16 LE byter). |
ExtractImage() | Kalla ExtractImage på detta PdfExtractor instans. |
ExtractImage(outputDirectory: string) | Extract varje bild till den angivna katalogen, namngiv filer image_N.jpg för JPEG källor och image-N-png annars. |
HasNextImage() | Sanningen medan GetNextImage(string) har en återstående bild att skriva. |
GetNextImage(outputStream: Stream) | Kalla GetNextImage(outputStream) på detta PdfExtractor instans. |
GetNextImage(outputFile: string) | Kalla GetNextImage(outputFile) på detta PdfExtractor instans. |
GetNextImage(outputStream: Stream, format: System.Drawing.Imaging.ImageFormat) | Kalla GetNextImage(outputStream, format) på detta PdfExtractor instans. |
GetNextImage(outputFile: string, format: System.Drawing.Imaging.ImageFormat) | Kalla GetNextImage(outputFile, format) på detta PdfExtractor instans. |
ExtractAttachment() | Välj varje inbyggd fil i det länkade dokumentet; en efterföljande GetAttachment(string) skriver alla av dem. |
ExtractAttachment(attachmentFileName: string) | Välj en enda inbyggd fil efter namn för extraction. |
GetAttachNames() | Namn på varje inbyggd fil i det bunden dokumentet. |
GetAttachmentInfo() | FileSpecification anger för varje inbyggd fil i det bunden dokumentet. |
GetAttachment() | Returnerar innehållet i de valda bifogarna som MemoryStreams (alla bifoga när ingen uttryckligen har valt). |
GetAttachment(outputPath: string) | Skriv de valda bifogarna (alla när ingen uttryckligen har valt) i outputPath-direktivet, en fil per bifoga som heter efter dess filnamn. |
Close() | Kall Nära på denna PdfExtractor instans. |
Dispose() | Rösta på denna instans PdfExtractor. |