PdfExtractor

Revisión

PdfExtractor Es una clase en Aspose.PDF FOSS para .NET. Heredados de: IDisposable.

Facade para extraer texto y imágenes de un documento PDF.

Esta clase proporciona 29 métodos para trabajar con los objetos de PdfExtractor en programas .NET. Los métodos disponibles incluyen: BindPdf, Close, Dispose, ExtractAttachment, ExtractImage, ExtractText, GetAttachNames, GetAttachment, GetAttachmentInfo, GetNextImage, GetNextPageText, GetText,y tres métodos adicionales. Todos los miembros públicos están accesibles a cualquier aplicación .NET después de instalar el Aspose.PDF FOSS para el paquete .Net. Propiedades : EndPage, ExtractImageMode, ExtractTextMode, IsBidi, Password, Resolution,Y dos más.

Propiedades

NombreTipoAccesoDescripción
StartPageintLeer / escribir1-based start page for extraction.
EndPageintLeer / escribir1-based end page for extraction.
ExtractTextModeintLeer / escribirModo de extracción del texto.
ExtractImageModeExtractImageModeLeer / escribirEstrategia de extracción de imágenes.
ResolutionintLeer / escribirResolución de rendimiento para extracción del imagen (DPI).
IsBidiboolLeerEs cierto cuando el texto más recientemente extraído contiene un script de derecha a izquierda (hiberno, árabe, sirio, taana, etc.), es decir.
Passwordstring?Leer / escribirLa contraseña utilizada para vincular los PDFs encriptados.
TextSearchOptionsAspose.Pdf.Text.TextSearchOptionsLeer / escribirLas opciones de búsqueda de texto aplicadas durante ExtractText().

Metodología

firmaDescripción
PdfExtractor()Póngase en el instante PdfExtractor.
PdfExtractor(document: Document)
BindPdf(inputFile: string)Póngase en el instante BindPdf.
BindPdf(document: Document)
BindPdf(inputStream: Stream)
ExtractText()Caminar cada página en el documento vinculado con TextAbsorber y concatenar el texto extraído.
ExtractText(outputFile: string)Extrae el texto del PDF vinculado y lo almacena en el archivo dado (UTF-16 LE bytes).
ExtractText(encoding: Encoding)Extraer texto del PDF vinculado utilizando el codificación dado.
GetText(outputStream: Stream)Escribe el texto extraído como bajetas en la salida de streaming, utilizando el codificación establecido por la llamada más reciente ExtractText(Encoding) (defaultos a UTF-16 LE).
GetText(outputStream: Stream, filterNotAscii: bool)Escribe el texto extraído como bajetas, opcionalmente perdiendo los puntos de código no ASCII primero.
GetText(outputFile: string)Escribe el texto extraído en la ruta de archivo dada.
HasNextPageText()Es cierto si hay texto de otra página disponible a través de GetNextPageText.
GetNextPageText(outputFile: string)Escribe el texto de la siguiente página en el camino del archivo dado (UTF-16 LE bytes).
GetNextPageText(outputStream: Stream)Escribe el texto de la siguiente página en el flujo dado (UTF-16 LE bytes).
ExtractImage()Póngase en el instante ExtractImage.
ExtractImage(outputDirectory: string)Extraer cada imagen a la dirección dada, nombrando los archivos image_N.jpg para fuentes JPEG y image-N .png de otra manera.
HasNextImage()Real mientras GetNextImage(string) tiene una imagen que queda para escribir.
GetNextImage(outputStream: Stream)Póngase en el instante GetNextImage.
GetNextImage(outputFile: string)
GetNextImage(outputStream: Stream, format: System.Drawing.Imaging.ImageFormat)
GetNextImage(outputFile: string, format: System.Drawing.Imaging.ImageFormat)
ExtractAttachment()Seleccione cada archivo incorporado en el documento vinculado; un siguiente GetAttachment(string) escribe todos ellos.
ExtractAttachment(attachmentFileName: string)Seleccione un solo archivo incorporado por nombre para extracción.
GetAttachNames()Nombres de cada archivo incorporado en el documento vinculado.
GetAttachmentInfo()FileSpecification entradas para cada archivo incorporado en el documento vinculado.
GetAttachment()Retorna el contenido de los anexos seleccionados como MemoryStreams (todos los adjuntos cuando no se selecciona explícitamente).
GetAttachment(outputPath: string)Escribe los anexos seleccionados (todos cuando no se selecciona explícitamente) en el directorio de salidaPath, un archivo por anEXo nombrado después de su nombre de archivos.
Close()Chamó Cerca en esta instancia PdfExtractor.
Dispose()En esta instancia se puede encontrar el nombre de la [Platz].

Ver también

 Español