PdfExtractor
Översikt
PdfExtractor är en klass i Aspose.PDF FOSS för Java. ärvt från: Closeable.
Facade för att extrahera text och bilder från PDF-dokument.
Denna klass ger 41 metoder för att arbeta med PdfExtractor objekt i Java-program. Tillgängliga metoder inkluderar: PdfExtractor, bindPdf, close, extractAttachment, extractImage, extractText, getAttachNames, getAttachment, getEndPage, getExtractImageMode, getExtractTextMode, getImageCount,18 och ytterligare metoder. Alla offentliga medlemmar är tillgängliga för alla Java-applikationer efter att ha installerat Aspose.PDF FOSS för Java paket. och egenskaper: attachNames, bidi, endPage, extractImageMode, extractTextMode, imageCount,Och 5 fler.
ägodelar
| Namn | Typ av | Access | Beskrivning |
|---|---|---|---|
password | String | Läsning | Återställer lösenordet som tillämpas när du öppnar krypterade PDF-filer i följande {@link #bindPdf(String)} eller { @link_bind PdfInputStream) } samtal. |
startPage | int | Läsning | Återgå till startsidan. |
endPage | int | Läsning | Återgå till slutsidan. |
extractTextMode | int | Läsning | Återställer nuvarande textutvinningsläge. |
resolution | Resolution | Läsning | Återställer den konfigurerade extractionlösningen. |
extractImageMode | ExtractImageMode | Läsning | Återställer bildutvinningsläge. |
textAsString | String | Läsning | Returnerar den extraherade texten som en sträng. |
textSearchOptions | TextSearchOptions | Läsning | Returnerar text sökalternativ associerade med extraktorn. |
bidi | boolean | Läsning | Återkommer om den aktuella extraktionen innehåller bidi text. |
attachNames | List<String> | Läsning | Återställer de aktuellt förberedda tilläggsnamn. |
imageCount | int | Läsning | Återställer antalet uttagna bilder. |
Metoder
| Signature | Beskrivning |
|---|---|
PdfExtractor() | Skapa en ny instans PdfExtractor. |
PdfExtractor(document: Document) | Skapar en ny PdfExtractor kopplad till ett befintligt dokument. |
PdfExtractor(stream: InputStream) | Skapar en ny PdfExtractor kopplad till ett PDF-ström. |
bindPdf(inputFile: String) | Bind en PDF-fil till denna extractor. |
bindPdf(stream: InputStream) | Binder en PDF från ett input stream. |
getPassword() → String | Återställer lösenordet som tillämpas när du öppnar krypterade PDF-filer i följande {@link #bindPdf(String)} eller { @link_bind PdfInputStream) } samtal. |
setPassword(password: String) | Ställ in lösenordet som används av följande {@code bindPdf} samtal för att öppna krypterade PDF-filer. |
bindPdf(document: Document) | Bind en befintlig dokument till denna extrakt. |
setStartPage(page: int) | Ställer in startsidan för extraktion (1-baserad). |
getStartPage() → int | Återgå till startsidan. |
setEndPage(page: int) | Ställer in den sista sidan för extraktion (1-baserad). |
getEndPage() → int | Återgå till slutsidan. |
setExtractTextMode(mode: int) | Ställer in textutvinningsläget. |
getExtractTextMode() → int | Återställer nuvarande textutvinningsläge. |
setResolution(resolution: Resolution) | Ställer in bildextraktionsupplösning för API paritet. |
getResolution() → Resolution | Återställer den konfigurerade extractionlösningen. |
setExtractImageMode(extractImageMode: ExtractImageMode) | Ställer in bildextraktionsläget. |
getExtractImageMode() → ExtractImageMode | Återställer bildutvinningsläge. |
extractText() | Extraherar text från sidområdet. |
extractText(encoding: Charset) | Extraherar text från sidområdet med hjälp av den begärda utgångskodningen. |
getText(outputPath: String) | Skriva extraherad text till en fil. |
getText(stream: OutputStream) | Skriver extraherad text till en utgångsström. |
getTextAsString() → String | Returnerar den extraherade texten som en sträng. |
getTextSearchOptions() → TextSearchOptions | Returnerar text sökalternativ associerade med extraktorn. |
setTextSearchOptions(textSearchOptions: TextSearchOptions) | Ange text sökalternativ som används av efterföljande uttagssamtal. |
hasNextPageText() → boolean | Återkommer om text som extraheras från sida till sida förblir tillgänglig. |
getNextPageText(outputPath: String) | Skriv nästa sida text till en fil. |
getNextPageText(stream: OutputStream) | Skriv nästa sida text till en ström. |
isBidi() → boolean | Återkommer om den aktuella extraktionen innehåller bidi text. |
extractAttachment() | Förbereder tilläggsutvinning för alla inbyggda filer. |
extractAttachment(name: String) | Förbereder extraktion för en specifik filnyckel eller filnamn. |
getAttachNames() → List<String> | Återställer de aktuellt förberedda tilläggsnamn. |
getAttachment(outputPath: String) | Skriv den förberedda bifogningen(er) till den angivna filen eller katalogen. |
extractImage() | Ta ut bilder från sidan. |
hasNextImage() → boolean | Återställer om det finns fler extraherade bilder att återställa. |
getNextImage(outputPath: String) | Spara nästa extraherad bild till en fil. |
getNextImage(outputPath: String, format: ImageFormat) | Spara nästa extraherad bild till en fil med det begärda utgångsformatet. |
getNextImage(stream: OutputStream) | Spara nästa extraherad bild till en utgångsström. |
getNextImage(stream: OutputStream, format: ImageFormat) | Spara nästa extraherad bild till en ström med det begärda utgångsformatet. |
getImageCount() → int | Återställer antalet uttagna bilder. |
close() | Stäng den här extraktorn och släpp binddokumentet. |