Ir al contenido

Configuring OCR engine

OpenKM puede trabajar con varios motores OCR, como Tesseract.

Tesseract es un motor OCR de código abierto adoptado por Google. Funciona muy bien. OCR puede leer documentos TIFF de forma nativa y tiene una alta tasa de reconocimiento con imágenes de resolución 300 dpi convertidas a lineart (color de 1 bit).

Los formatos de imagen soportados son:

  • TIFF
  • PNG
  • JPG
  • GIF
SO Descripción
Ubuntu y Debian bash<br>$ apt install tesseract-ocr<br>
El idioma instalado por defecto es el inglés, así que dependiendo de su configuración regional puede que quiera instalar otro fichero de idioma.
Por ejemplo, para instalar el paquete de idioma español:
bash<br>$ apt install tesseract-ocr-spa<br>
Puede comprobar los idiomas instalados así:
bash<br>$ tesseract --list-langs<br>
Más información en:
- https://github.com/tesseract-ocr/tesseract
- https://tesseract-ocr.github.io/tessdoc/Installation.html
Red Hat y CentOS En CentOS, puede instalar Tesseract desde el repositorio EPEL:
bash<br>$ yum install epel-release<br>$ yum install tesseract<br>
El idioma instalado por defecto es el inglés, así que dependiendo de su configuración regional puede que quiera instalar otro fichero de idioma.
Por ejemplo, para instalar el paquete de idioma español:
bash<br>$ yum install tesseract-langpack-spa<br>
Puede comprobar los idiomas instalados así:
bash<br>$ tesseract --list-langs<br>
En Red Hat, recomendamos contactar con el soporte de Red Hat para más información.
Más información en:
- https://tesseract-ocr.github.io/tessdoc/Installation.html
Windows Descargue desde https://tesseract-ocr.github.io/tessdoc/Installation.html y siga el asistente de instalación.

Desde la línea de comandos, ejecute (donde image.jpg debe ser un fichero de imagen existente):

Ventana de terminal
$ tesseract image.jpg text

Vaya a Administration > Configuration parameters y edite el parámetro llamado system.ocr:

SO
Linux /usr/bin/tesseract ${fileIn} ${fileOut}
o
/usr/bin/tesseract ${fileIn} ${fileOut} -l esp
El parámetro -l esp indica que debe usarse el soporte de idioma español al ejecutar OCR.
Para ver todas las opciones de Tesseract, ejecute:
bash<br>$ tesseract<br>
Windows c:\Tesseract-ocr-3.0.2\tesseract.exe ${fileIn} ${fileOut}
o
c:\Tesseract-ocr-3.0.2\tesseract.exe ${fileIn} ${fileOut} -l spa
El parámetro -l esp indica que debe usarse el soporte de idioma español al ejecutar OCR.
Para ver todas las opciones de Tesseract, ejecute:
bash<br>c:\Tesseract-ocr-3.0.2> tesseract.exe<br>
  • El parámetro ${fileIn} se sustituirá internamente por el documento de imagen a procesar.
  • El parámetro ${fileOut} se sustituirá internamente por un fichero de texto temporal.
  • Puede establecer otros parámetros adicionales, como el parámetro -l spa del ejemplo.

También puede usar un diccionario de OpenOffice.org para mejorar el proceso de OCR. Puede encontrar estos diccionarios específicos de idioma en OpenOffice.org Dictionary Repository.

Vaya a Administration > Configuration parameters y edite el parámetro llamado system.openoffice.dictionary:

SO
Linux /home/openkm/dictionary/en-GB.zip
Windows c:\tomcat-8.5.69\dictionary\en-GB.zip

Hay un parámetro de configuración que fuerza el OCR en documentos rotados.

Vaya a Administration > Configuration parameters y edite el parámetro llamado system.ocr.rotate:

Propiedad Descripción
system.ocr.rotate El parámetro es una colección de grados separados por el carácter “;”.
90;180;270;