Ir al contenido

OCR templates

OCR Templates permite crear plantillas de OCR zonal que permiten reconocer y extraer texto estructurado a partir de imágenes escaneadas.

Entendiendo las fases de ejecución de una plantilla OCR:

Recognise Data extraction Save data

Hay dos tipos de campo en las plantillas OCR:

  • Campos Validation Control.
  • Campos Data Capture.

Los tipos MIME permitidos para la fase de reconocimiento son:

  • PNG
  • JPG
  • GIF
  • BMP
  • PDF

Descripción de los campos Validation Control

Sección titulada «Descripción de los campos Validation Control»

Los campos Validation Control se usan solo en la fase de reconocimiento para ayudar a identificar el documento comprobando el patrón de una sección del documento.

Cada campo Validation Control se compone de:

Campo Descripción Obligatorio
Name Nombre del campo. true.
Order Orden de evaluación true.
Type Lista de OCR Validation Controls. Cada validador es una condición que debe cumplirse. true.
Value Un valor. *
Pattern Un patrón de expresión regular Java. *
Rotation Indica la rotación de imagen que debe aplicarse.
Rotaciones de imagen disponibles:
- -270
- -180
- -90
- 0
- 90
- 180
- 270
true.
Custom Establece comandos para procesar las imágenes para el OCR. Pueden establecerse varios comandos, uno por línea.
Por ejemplo, para resaltar el color rojo.
/usr/bin/convert ${fileIn} -matte ( +clone -fuzz 50% -transparent red ) -compose DstOut -composite -negate ${fileOut}
false.
OCR Línea de comando de OCR.
Cuando está presente, se ejecutará en lugar del parámetro de configuración system.ocr.
Más información en Configuration parameters.
Por ejemplo, para forzar la captura de dígitos.
/usr/bin/tesseract ${fileIn} ${fileOut} digits
false.
Empty value allowed Cuando está marcado, indica que un valor de texto OCR vacío también es válido en el proceso de identificación del documento. false
* Estos parámetros se usan en el Validation Control. Pueden ser obligatorios o no según qué Validation Control se use.

Los campos Data Capture se usan para recuperar datos en la fase de extracción de datos, pero también pueden usarse en la fase de reconocimiento para ayudar a identificar un documento comprobando el patrón de una sección del documento.

Cada campo Data Capture se compone de:

Campo Descripción Obligatorio
Name Nombre del campo. true.
Order Orden de evaluación true.
Type Lista de OCR Data Capture. true.
Property Campo de metadatos donde se almacenarán los datos capturados. true.
Pattern Un patrón de expresión regular Java. *
Rotation Indica la rotación de imagen que debe aplicarse.
Rotaciones de imagen disponibles:
- -270
- -180
- -90
- 0
- 90
- 180
- 270
true.
Custom Establece comandos para procesar las imágenes para el OCR. Pueden establecerse varios comandos, uno por línea.
Por ejemplo, para resaltar el color rojo.
/usr/bin/convert ${fileIn} -matte ( +clone -fuzz 50% -transparent red ) -compose DstOut -composite -negate ${fileOut}
false.
OCR Línea de comando de OCR.
Cuando está presente, se ejecutará en lugar del parámetro de configuración system.ocr.
Más información en Configuration parameters.
Por ejemplo, para forzar la captura de dígitos.
/usr/bin/tesseract ${fileIn} ${fileOut} digits
false.
Use to recognise Cuando se establece en true, indica que el campo también se usará en la fase de reconocimiento. false.
* Este parámetro se usa en el Data Capture. Puede ser obligatorio o no según qué Data Capture se use.

Entendiendo OCR Validation Control y OCR Data Capture

Sección titulada «Entendiendo OCR Validation Control y OCR Data Capture»

La aplicación proporciona una lista completa de los OCR Validation Control y OCR Data Capture disponibles desde la vista Plugins. La arquitectura de plugins de la aplicación ayuda a los administradores a añadir nuevas funcionalidades a la aplicación existente.

Por defecto, la aplicación incluye plugins integrados:

También puede crear sus propios plugins:

  • Arriba a la derecha, haga clic en el icono New OCR template.
  • Rellene los campos.
    • Campo de metadatos (valores de metadatos estáticos, normalmente usados para identificar el tipo de documento).
  • Elija el fichero (tipo MIME permitido).
  • Haga clic en el botón Create.

  • Añada campos Validation Control según sea necesario.
    • Validation Controls
      • Haga clic en Fields.
        • Para crear un nuevo Validation Control:
          • Haga clic en el icono New Validation Control Field.
          • Rellene los campos.
          • Elija el área con el ratón en la imagen de la izquierda.
          • Haga clic en el botón Create.
        • Para editar un Validation Control:
          • Haga clic en el icono Edit a Validation Control.
          • Modifique los campos.
          • Haga clic en el botón Edit.
        • Para eliminar un Validation Control:
          • Haga clic en el icono Delete a Validation Control.
          • Haga clic en el botón Delete.

  • Añada campos Data Capture según sea necesario.
    • Data Capture
      • Haga clic en Fields.
      • Para crear un nuevo Data Capture
        • Haga clic en el icono New Data Capture Field.
        • Rellene los campos.
        • Elija el área con el ratón en la imagen de la izquierda.
        • Haga clic en el botón Create.
      • Para editar un Data Capture:
        • Haga clic en el icono Edit a Data Capture.
        • Modifique los campos.
        • Haga clic en el botón Edit.
      • Para eliminar un Data Capture:
        • Haga clic en el icono Delete a Data Capture.
        • Haga clic en el botón Delete.

  • Haga clic en el icono Edit OCR template.
  • Modifique los campos.
  • Haga clic en el botón Edit.

Haga clic en Fields.

  • Haga clic en el icono Edit a Validation Control.
  • Modifique los campos.
  • Haga clic en el botón Edit.

Haga clic en Fields.

  • Haga clic en el icono Edit a Data Capture.
  • Modifique los campos.
  • Haga clic en el botón Edit.

Haga clic en Fields.

  • Haga clic en el icono Delete a Validation Control.
  • Haga clic en el botón Delete.

Haga clic en Fields.

  • Haga clic en el icono Delete a Data Capture.
  • Haga clic en el botón Delete.
  • Haga clic en el icono Check y se comprobará la plantilla OCR.

  • Arriba a la derecha, haga clic en el icono Recognise.
  • Elija el fichero a reconocer (tipo MIME permitido).
  • Elija el nivel de reconocimiento.
  • Haga clic en el botón Recognise.

  • Haga clic en el icono Delete OCR template.
  • Haga clic en el botón Delete.
Funcionalidad Descripción
Profile General tab Cuando OCR data capture está habilitado desde la pestaña Profile General, el proceso de OCR Data Capture se ejecutará automáticamente para cada documento recién subido.
Si hay presente una definición de automatización, estos parámetros no tienen efecto.
Con la funcionalidad de automatización se cubren todos estos casos y más.
Automation Validaciones:
- Is OCRDataCaptureFile
Más información sobre los built-in Automation Validator plugins.
Acciones:
- OCR DataCapture
- Add OCRDataCaptureToWizard
Más información sobre los built-in Automation Action plugins.