Ir al contenido

Plugins de extracción de texto integrados

Nombre Tipos MIME Descripción
AudioTextExtractor audio/mpeg
audio/x-ogg
Lee las etiquetas ID3/de audio embebidas en el propio fichero (título, artista, álbum, etc.) usando la librería entagged; no analiza el contenido de audio en sí.
AutoCadLinkListTextExtractor image/vnd.dxf
image/vnd.dwg
Extrae las entidades TEXT (etiquetas/anotaciones) embebidas en un dibujo de AutoCAD, usando la herramienta externa CADViewer LinkList (parámetro de configuración cadviewer.linklist).
AzureTextExtractor image/tiff
image/gif
image/jpeg
image/png
OCR mediante la API Read de Azure Cognitive Services (basado en la nube, requiere configuración de endpoint/clave de Azure). Una alternativa en la nube a TesseractTextExtractor para los mismos tipos de imagen.
EPUBTextExtractor application/epub+zip Extrae el texto plano de los capítulos de un libro electrónico EPUB usando epublib.
ExifTextExtractor image/jpeg Extrae las etiquetas EXIF/metadatos (modelo de cámara, fecha, GPS, etc.) de un JPEG usando la librería metadata-extractor. No es OCR: no lee ningún texto visible en la propia imagen.
HTMLTextExtractor text/html Elimina el marcado HTML y devuelve el texto visible de la página, usando Jsoup.
ImageOpenAITextExtractor image/tiff
image/gif
image/jpeg
image/png
Envía la imagen al modelo de visión de OpenAI configurado y devuelve su respuesta como Markdown. Una alternativa basada en IA a TesseractTextExtractor/AzureTextExtractor para los mismos tipos de imagen.
LibreOfficeTextExtractor application/vnd.oasis.opendocument.text
application/vnd.oasis.opendocument.text-web
application/vnd.oasis.opendocument.text-template
application/vnd.oasis.opendocument.presentation
application/vnd.oasis.opendocument.presentation-template
application/vnd.oasis.opendocument.spreadsheet
application/vnd.oasis.opendocument.spreadsheet-template
application/vnd.oasis.opendocument.graphics
application/vnd.oasis.opendocument.graphics-template
application/vnd.oasis.opendocument.database
application/vnd.oasis.opendocument.chart
application/vnd.oasis.opendocument.text-master
application/vnd.sun.xml.writer
application/vnd.sun.xml.calc
application/vnd.sun.xml.impress
application/vnd.sun.xml.draw
application/vnd.sun.xml.writer.global
application/vnd.sun.xml.calc.template
application/vnd.sun.xml.impress.template
application/vnd.sun.xml.draw.template
application/vnd.sun.xml.writer.template
Lee el propio content.xml del documento directamente mediante parsing SAX — los ficheros OpenDocument y los antiguos de OpenOffice.org son archivos ZIP de XML — sin invocar LibreOffice en sí.
MarkdownTextExtractor text/markdown Devuelve el código fuente Markdown en bruto como texto plano (sin renderizar).
MsExcelTextExtractor application/vnd.ms-excel
application/msexcel
application/excel
Extrae el texto de las celdas de un libro Excel antiguo (.xls) usando Apache POI (HSSF).
MsOffice2007TextExtractor application/vnd.openxmlformats-officedocument.wordprocessingml.document
application/vnd.openxmlformats-officedocument.wordprocessingml.template
application/vnd.openxmlformats-officedocument.presentationml.presentation
application/vnd.openxmlformats-officedocument.presentationml.template
application/vnd.openxmlformats-officedocument.presentationml.slideshow
application/vnd.openxmlformats-officedocument.spreadsheetml.sheet
application/vnd.openxmlformats-officedocument.spreadsheetml.template
application/vnd.ms-excel.sheet.macroEnabled.12
application/vnd.ms-excel.template.macroEnabled.12
Extrae texto de documentos modernos (2007+) de Word/PowerPoint/Excel, incluyendo libros con macros habilitadas, usando el soporte OOXML de Apache POI.
MsOfficeOcrTextExtractor application/msword
application/vnd.openxmlformats-officedocument.wordprocessingml.document
application/vnd.openxmlformats-officedocument.wordprocessingml.template
application/vnd.ms-powerpoint
application/vnd.openxmlformats-officedocument.presentationml.presentation
application/vnd.openxmlformats-officedocument.presentationml.template
application/vnd.openxmlformats-officedocument.presentationml.slideshow
application/vnd.ms-excel
application/vnd.openxmlformats-officedocument.spreadsheetml.sheet
application/vnd.openxmlformats-officedocument.spreadsheetml.template
application/vnd.ms-excel.sheet.macroEnabled.12
application/vnd.ms-excel.template.macroEnabled.12
Convierte el documento a PDF y hace OCR con Tesseract sobre cada página renderizada, ignorando cualquier texto nativo — útil para documentos de Office escaneados o con muchas imágenes, a costa de la velocidad. Cubre los mismos tipos MIME de Word/PowerPoint/Excel (antiguos y 2007+) que MsWordTextExtractor, MsOffice2007TextExtractor, MsExcelTextExtractor y MsPowerPointTextExtractor combinados.
MsOutlookTextExtractor application/vnd.ms-outlook Extrae el asunto, cuerpo y nombres de adjuntos de un mensaje de Outlook (.msg) usando Apache POI (HSMF).
MsPowerPointTextExtractor application/vnd.ms-powerpoint
application/mspowerpoint
application/powerpoint
Extrae el texto de las diapositivas de una presentación PowerPoint antigua (.ppt) usando Apache POI (HSLF).
MsVisioTextExtractor application/vnd.ms-visio.drawing Convierte el dibujo de Visio a PDF mediante LibreOffice, y delega en el extractor de texto de PDF que esté actualmente registrado y activo para extraer su texto.
MsWordTextExtractor application/vnd.ms-word
application/msword
Extrae texto de un documento Word antiguo (.doc) usando Apache POI (HWPF).
NativeMsExcelTextExtractor application/vnd.ms-excel
application/msexcel
application/excel
Alternativa a MsExcelTextExtractor que usa la herramienta de línea de comandos externa catdoc xls2csv (parámetro de configuración system.catdoc.xls2csv) en lugar de Apache POI.
PdfLayerTextExtractor application/pdf Extrae solo la propia capa de texto del PDF (PDFBox); sin recurso a OCR, por lo que un PDF escaneado o solo con imágenes no devuelve texto. El más ligero y rápido de los extractores de PDF.
PdfNewTextExtractor application/pdf Mismo enfoque que PdfTextExtractor — capa de texto más recurso a OCR (Tesseract, sobre las imágenes embebidas del PDF) cuando no hay capa de texto o system.pdf.force.ocr está establecido — reescrito sobre la API de carga más reciente de PDFBox, con un paso de extracción de imágenes más simple, solo en Java.
PdfOcrTextExtractor application/pdf Siempre hace OCR con Tesseract sobre cada página renderizada, ignorando cualquier capa de texto existente.
PdfOpenAITextExtractor application/pdf Siempre envía cada página renderizada al modelo de visión de OpenAI configurado y devuelve Markdown, ignorando cualquier capa de texto existente.
PdfRenderTextExtractor application/pdf Capa de texto más recurso a OCR como PdfTextExtractor/PdfNewTextExtractor, pero renderiza cada página completa como una imagen a 300 DPI para el OCR en lugar de extraer solo los objetos de imagen embebidos — cubre más casos escaneados/de maquetación compleja, a costa de ser más lento.
PdfTextExtractor application/pdf Capa de texto (PDFBox) más recurso a OCR (Tesseract, sobre las imágenes embebidas del PDF) cuando no hay capa de texto o system.pdf.force.ocr está establecido; puede usar la herramienta externa pdfimages (system.pdfimages) en lugar de la extracción de imágenes basada en Java.
PlainTextExtractor text/plain
text/csv
Devuelve el contenido de texto en bruto, decodificado con la codificación indicada (o UTF-8).
PngTextExtractor image/png
image/apng
image/mng
Lee los propios chunks de metadatos tEXt embebidos en el fichero (formato de chunk binario PNG/APNG/MNG). No es OCR: no lee ningún texto visible dibujado en la imagen.
RTFTextExtractor application/rtf
text/rtf
Extrae texto plano de un documento RTF usando RTFEditorKit de Java Swing.
SourceCodeTextExtractor text/x-java
text/x-python
text/css
text/x-sql
application/x-php
application/javascript
application/x-shellscript
Devuelve el código fuente en bruto como texto plano.
TesseractTextExtractor image/tiff
image/gif
image/jpeg
image/png
OCR local mediante Tesseract (parámetro de configuración system.ocr); opcionalmente reintenta con ángulos de rotación adicionales (system.ocr.rotate) para mejorar los resultados en escaneos rotados.
XMLTextExtractor text/xml
application/xml
application/vnd.scribus
Extrae el contenido de texto y los valores de atributo de un documento XML mediante parsing SAX; también gestiona ficheros de proyecto Scribus, que se basan en XML.