PdfExtractor
Revisión
PdfExtractor Es una clase en Aspose.PDF FOSS para .NET. Heredados de: IDisposable.
Facade para extraer texto y imágenes de un documento PDF.
Esta clase proporciona 29 métodos para trabajar con los objetos de PdfExtractor en programas .NET. Los métodos disponibles incluyen: BindPdf, Close, Dispose, ExtractAttachment, ExtractImage, ExtractText, GetAttachNames, GetAttachment, GetAttachmentInfo, GetNextImage, GetNextPageText, GetText,y tres métodos adicionales. Todos los miembros públicos están accesibles a cualquier aplicación .NET después de instalar el Aspose.PDF FOSS para el paquete .Net. Propiedades : EndPage, ExtractImageMode, ExtractTextMode, IsBidi, Password, Resolution,Y dos más.
Propiedades
| Nombre | Tipo | Acceso | Descripción |
|---|---|---|---|
StartPage | int | Leer / escribir | 1-based start page for extraction. |
EndPage | int | Leer / escribir | 1-based end page for extraction. |
ExtractTextMode | int | Leer / escribir | Modo de extracción del texto. |
ExtractImageMode | ExtractImageMode | Leer / escribir | Estrategia de extracción de imágenes. |
Resolution | int | Leer / escribir | Resolución de rendimiento para extracción del imagen (DPI). |
IsBidi | bool | Leer | Es cierto cuando el texto más recientemente extraído contiene un script de derecha a izquierda (hiberno, árabe, sirio, taana, etc.), es decir. |
Password | string? | Leer / escribir | La contraseña utilizada para vincular los PDFs encriptados. |
TextSearchOptions | Aspose.Pdf.Text.TextSearchOptions | Leer / escribir | Las opciones de búsqueda de texto aplicadas durante ExtractText(). |
Metodología
| firma | Descripción |
|---|---|
PdfExtractor() | Póngase en el instante PdfExtractor. |
PdfExtractor(document: Document) | |
BindPdf(inputFile: string) | Póngase en el instante BindPdf. |
BindPdf(document: Document) | |
BindPdf(inputStream: Stream) | |
ExtractText() | Caminar cada página en el documento vinculado con TextAbsorber y concatenar el texto extraído. |
ExtractText(outputFile: string) | Extrae el texto del PDF vinculado y lo almacena en el archivo dado (UTF-16 LE bytes). |
ExtractText(encoding: Encoding) | Extraer texto del PDF vinculado utilizando el codificación dado. |
GetText(outputStream: Stream) | Escribe el texto extraído como bajetas en la salida de streaming, utilizando el codificación establecido por la llamada más reciente ExtractText(Encoding) (defaultos a UTF-16 LE). |
GetText(outputStream: Stream, filterNotAscii: bool) | Escribe el texto extraído como bajetas, opcionalmente perdiendo los puntos de código no ASCII primero. |
GetText(outputFile: string) | Escribe el texto extraído en la ruta de archivo dada. |
HasNextPageText() | Es cierto si hay texto de otra página disponible a través de GetNextPageText. |
GetNextPageText(outputFile: string) | Escribe el texto de la siguiente página en el camino del archivo dado (UTF-16 LE bytes). |
GetNextPageText(outputStream: Stream) | Escribe el texto de la siguiente página en el flujo dado (UTF-16 LE bytes). |
ExtractImage() | Póngase en el instante ExtractImage. |
ExtractImage(outputDirectory: string) | Extraer cada imagen a la dirección dada, nombrando los archivos image_N.jpg para fuentes JPEG y image-N .png de otra manera. |
HasNextImage() | Real mientras GetNextImage(string) tiene una imagen que queda para escribir. |
GetNextImage(outputStream: Stream) | Póngase en el instante GetNextImage. |
GetNextImage(outputFile: string) | |
GetNextImage(outputStream: Stream, format: System.Drawing.Imaging.ImageFormat) | |
GetNextImage(outputFile: string, format: System.Drawing.Imaging.ImageFormat) | |
ExtractAttachment() | Seleccione cada archivo incorporado en el documento vinculado; un siguiente GetAttachment(string) escribe todos ellos. |
ExtractAttachment(attachmentFileName: string) | Seleccione un solo archivo incorporado por nombre para extracción. |
GetAttachNames() | Nombres de cada archivo incorporado en el documento vinculado. |
GetAttachmentInfo() | FileSpecification entradas para cada archivo incorporado en el documento vinculado. |
GetAttachment() | Retorna el contenido de los anexos seleccionados como MemoryStreams (todos los adjuntos cuando no se selecciona explícitamente). |
GetAttachment(outputPath: string) | Escribe los anexos seleccionados (todos cuando no se selecciona explícitamente) en el directorio de salidaPath, un archivo por anEXo nombrado después de su nombre de archivos. |
Close() | Chamó Cerca en esta instancia PdfExtractor. |
Dispose() | En esta instancia se puede encontrar el nombre de la [Platz]. |