Plugins de extracción de texto integrados
| Nombre | Tipos MIME | Descripción |
|---|---|---|
| AudioTextExtractor | audio/mpeg audio/x-ogg |
Lee las etiquetas ID3/de audio embebidas en el propio fichero (título, artista, álbum, etc.) usando la librería entagged; no analiza el contenido de audio en sí. |
| AutoCadLinkListTextExtractor | image/vnd.dxf image/vnd.dwg |
Extrae las entidades TEXT (etiquetas/anotaciones) embebidas en un dibujo de AutoCAD, usando la herramienta externa CADViewer LinkList (parámetro de configuración cadviewer.linklist). |
| AzureTextExtractor | image/tiff image/gif image/jpeg image/png |
OCR mediante la API Read de Azure Cognitive Services (basado en la nube, requiere configuración de endpoint/clave de Azure). Una alternativa en la nube a TesseractTextExtractor para los mismos tipos de imagen. |
| EPUBTextExtractor | application/epub+zip | Extrae el texto plano de los capítulos de un libro electrónico EPUB usando epublib. |
| ExifTextExtractor | image/jpeg | Extrae las etiquetas EXIF/metadatos (modelo de cámara, fecha, GPS, etc.) de un JPEG usando la librería metadata-extractor. No es OCR: no lee ningún texto visible en la propia imagen. |
| HTMLTextExtractor | text/html | Elimina el marcado HTML y devuelve el texto visible de la página, usando Jsoup. |
| ImageOpenAITextExtractor | image/tiff image/gif image/jpeg image/png |
Envía la imagen al modelo de visión de OpenAI configurado y devuelve su respuesta como Markdown. Una alternativa basada en IA a TesseractTextExtractor/AzureTextExtractor para los mismos tipos de imagen. |
| LibreOfficeTextExtractor | application/vnd.oasis.opendocument.text application/vnd.oasis.opendocument.text-web application/vnd.oasis.opendocument.text-template application/vnd.oasis.opendocument.presentation application/vnd.oasis.opendocument.presentation-template application/vnd.oasis.opendocument.spreadsheet application/vnd.oasis.opendocument.spreadsheet-template application/vnd.oasis.opendocument.graphics application/vnd.oasis.opendocument.graphics-template application/vnd.oasis.opendocument.database application/vnd.oasis.opendocument.chart application/vnd.oasis.opendocument.text-master application/vnd.sun.xml.writer application/vnd.sun.xml.calc application/vnd.sun.xml.impress application/vnd.sun.xml.draw application/vnd.sun.xml.writer.global application/vnd.sun.xml.calc.template application/vnd.sun.xml.impress.template application/vnd.sun.xml.draw.template application/vnd.sun.xml.writer.template |
Lee el propio content.xml del documento directamente mediante parsing SAX — los ficheros OpenDocument y los antiguos de OpenOffice.org son archivos ZIP de XML — sin invocar LibreOffice en sí. |
| MarkdownTextExtractor | text/markdown | Devuelve el código fuente Markdown en bruto como texto plano (sin renderizar). |
| MsExcelTextExtractor | application/vnd.ms-excel application/msexcel application/excel |
Extrae el texto de las celdas de un libro Excel antiguo (.xls) usando Apache POI (HSSF). |
| MsOffice2007TextExtractor | application/vnd.openxmlformats-officedocument.wordprocessingml.document application/vnd.openxmlformats-officedocument.wordprocessingml.template application/vnd.openxmlformats-officedocument.presentationml.presentation application/vnd.openxmlformats-officedocument.presentationml.template application/vnd.openxmlformats-officedocument.presentationml.slideshow application/vnd.openxmlformats-officedocument.spreadsheetml.sheet application/vnd.openxmlformats-officedocument.spreadsheetml.template application/vnd.ms-excel.sheet.macroEnabled.12 application/vnd.ms-excel.template.macroEnabled.12 |
Extrae texto de documentos modernos (2007+) de Word/PowerPoint/Excel, incluyendo libros con macros habilitadas, usando el soporte OOXML de Apache POI. |
| MsOfficeOcrTextExtractor | application/msword application/vnd.openxmlformats-officedocument.wordprocessingml.document application/vnd.openxmlformats-officedocument.wordprocessingml.template application/vnd.ms-powerpoint application/vnd.openxmlformats-officedocument.presentationml.presentation application/vnd.openxmlformats-officedocument.presentationml.template application/vnd.openxmlformats-officedocument.presentationml.slideshow application/vnd.ms-excel application/vnd.openxmlformats-officedocument.spreadsheetml.sheet application/vnd.openxmlformats-officedocument.spreadsheetml.template application/vnd.ms-excel.sheet.macroEnabled.12 application/vnd.ms-excel.template.macroEnabled.12 |
Convierte el documento a PDF y hace OCR con Tesseract sobre cada página renderizada, ignorando cualquier texto nativo — útil para documentos de Office escaneados o con muchas imágenes, a costa de la velocidad. Cubre los mismos tipos MIME de Word/PowerPoint/Excel (antiguos y 2007+) que MsWordTextExtractor, MsOffice2007TextExtractor, MsExcelTextExtractor y MsPowerPointTextExtractor combinados. |
| MsOutlookTextExtractor | application/vnd.ms-outlook | Extrae el asunto, cuerpo y nombres de adjuntos de un mensaje de Outlook (.msg) usando Apache POI (HSMF). |
| MsPowerPointTextExtractor | application/vnd.ms-powerpoint application/mspowerpoint application/powerpoint |
Extrae el texto de las diapositivas de una presentación PowerPoint antigua (.ppt) usando Apache POI (HSLF). |
| MsVisioTextExtractor | application/vnd.ms-visio.drawing | Convierte el dibujo de Visio a PDF mediante LibreOffice, y delega en el extractor de texto de PDF que esté actualmente registrado y activo para extraer su texto. |
| MsWordTextExtractor | application/vnd.ms-word application/msword |
Extrae texto de un documento Word antiguo (.doc) usando Apache POI (HWPF). |
| NativeMsExcelTextExtractor | application/vnd.ms-excel application/msexcel application/excel |
Alternativa a MsExcelTextExtractor que usa la herramienta de línea de comandos externa catdoc xls2csv (parámetro de configuración system.catdoc.xls2csv) en lugar de Apache POI. |
| PdfLayerTextExtractor | application/pdf | Extrae solo la propia capa de texto del PDF (PDFBox); sin recurso a OCR, por lo que un PDF escaneado o solo con imágenes no devuelve texto. El más ligero y rápido de los extractores de PDF. |
| PdfNewTextExtractor | application/pdf | Mismo enfoque que PdfTextExtractor — capa de texto más recurso a OCR (Tesseract, sobre las imágenes embebidas del PDF) cuando no hay capa de texto o system.pdf.force.ocr está establecido — reescrito sobre la API de carga más reciente de PDFBox, con un paso de extracción de imágenes más simple, solo en Java. |
| PdfOcrTextExtractor | application/pdf | Siempre hace OCR con Tesseract sobre cada página renderizada, ignorando cualquier capa de texto existente. |
| PdfOpenAITextExtractor | application/pdf | Siempre envía cada página renderizada al modelo de visión de OpenAI configurado y devuelve Markdown, ignorando cualquier capa de texto existente. |
| PdfRenderTextExtractor | application/pdf | Capa de texto más recurso a OCR como PdfTextExtractor/PdfNewTextExtractor, pero renderiza cada página completa como una imagen a 300 DPI para el OCR en lugar de extraer solo los objetos de imagen embebidos — cubre más casos escaneados/de maquetación compleja, a costa de ser más lento. |
| PdfTextExtractor | application/pdf | Capa de texto (PDFBox) más recurso a OCR (Tesseract, sobre las imágenes embebidas del PDF) cuando no hay capa de texto o system.pdf.force.ocr está establecido; puede usar la herramienta externa pdfimages (system.pdfimages) en lugar de la extracción de imágenes basada en Java. |
| PlainTextExtractor | text/plain text/csv |
Devuelve el contenido de texto en bruto, decodificado con la codificación indicada (o UTF-8). |
| PngTextExtractor | image/png image/apng image/mng |
Lee los propios chunks de metadatos tEXt embebidos en el fichero (formato de chunk binario PNG/APNG/MNG). No es OCR: no lee ningún texto visible dibujado en la imagen. |
| RTFTextExtractor | application/rtf text/rtf |
Extrae texto plano de un documento RTF usando RTFEditorKit de Java Swing. |
| SourceCodeTextExtractor | text/x-java text/x-python text/css text/x-sql application/x-php application/javascript application/x-shellscript |
Devuelve el código fuente en bruto como texto plano. |
| TesseractTextExtractor | image/tiff image/gif image/jpeg image/png |
OCR local mediante Tesseract (parámetro de configuración system.ocr); opcionalmente reintenta con ángulos de rotación adicionales (system.ocr.rotate) para mejorar los resultados en escaneos rotados. |
| XMLTextExtractor | text/xml application/xml application/vnd.scribus |
Extrae el contenido de texto y los valores de atributo de un documento XML mediante parsing SAX; también gestiona ficheros de proyecto Scribus, que se basan en XML. |