Parámetros de configuración de rendimiento
Cola de extracción de texto
Sección titulada «Cola de extracción de texto»Hay varios parámetros de configuración para adaptar la extracción de texto de documentos a sus necesidades. La extracción de texto es uno de los procesos que puede usar muchos recursos de hardware (memoria y CPU). Una política de extracción de texto agresiva puede reducir el rendimiento de la aplicación y afectar a la percepción que el usuario final tiene de la interfaz.
Cuando se suben documentos, se añaden automáticamente a la cola de extracción de texto. Puede ver la cola de extracción de texto en Administration > Statistics > Text extraction queue.
Hay una tarea crontab llamada “Text extractor worker” en Administration > Crontab que controla el ciclo de indexación.
| Field / Property | Type | Description |
|---|---|---|
| text.extraction.batch | Boolean | Indica el número de documentos a procesar en cada ciclo de indexación. Cuando el parámetro “text.extraction.concurrent” está habilitado, es buena práctica establecerlo como un múltiplo del valor de “text.extraction.threads”. 20 |
| text.extraction.concurrent | Boolean | Habilita o deshabilita la funcionalidad de hilos concurrentes de extracción de texto. True |
| text.extraction.threads | Integer | Número de hilos concurrentes usados para la funcionalidad de extracción de texto. Este número debería ser menor o igual al número de núcleos de hardware. 2 |
Hay una tarea crontab llamada “Mail extractor worker” en Administration > Crontab, que controla el ciclo de indexación.
| Field / Property | Type | Description |
|---|---|---|
| mail.extraction.batch | Boolean | Indica el número de correos a procesar en cada ciclo de indexación. Cuando el parámetro “mail.extraction.concurrent” está habilitado, es buena práctica establecerlo como un múltiplo del valor de “mail.extraction.threads”. 20 |
| mail.extraction.concurrent | Boolean | Habilita o deshabilita la funcionalidad de hilos concurrentes de extracción de correo. True |
| mail.extraction.threads | Integer | Número de hilos concurrentes usados para la funcionalidad de extracción de correo. Este número debería ser menor o igual al número de núcleos de hardware. 2 |
Descargar ficheros y carpetas como fichero ZIP
Sección titulada «Descargar ficheros y carpetas como fichero ZIP»No es buena práctica descargar grandes volúmenes de ficheros como ficheros ZIP. En la mayoría de los casos, considere usar la herramienta de exportación de la aplicación en Administration > Utilities > Repository export.
Descargar ficheros y carpetas como fichero ZIP puede tardar mucho tiempo y consumir muchos recursos de hardware. Primero, la aplicación preparará una carpeta temporal en el servidor que se usará para crear el fichero ZIP, que después se enviará a la interfaz de usuario. Para evitar bloquear la interfaz de usuario mientras se espera a que termine el proceso, hay dos parámetros que notificarán al usuario cuando se hayan superado ciertos límites (número de ficheros o tamaño), y el proceso pasará a ejecutarse en segundo plano.
| Field / Property | Type | Description |
|---|---|---|
| download.zip.live.max.files | Integer | Establece el número máximo de ficheros permitidos para descargar en modo directo. 100 |
| download.zip.live.max.file.size | String | Establece el tamaño máximo total de los ficheros permitidos para descargar en modo directo. |
Para más información sobre estos parámetros, lea User interface configuration parameters.
Comprobador antivirus
Sección titulada «Comprobador antivirus»Hay varios parámetros de configuración para adaptar el comprobador antivirus a sus necesidades. El comprobador antivirus es uno de los procesos que puede usar muchos recursos de hardware (memoria y CPU). Una política de comprobación antivirus agresiva puede reducir el rendimiento de la aplicación y afectar a la percepción que el usuario final tiene de la interfaz. El comprobador antivirus puede funcionar en modo directo (como parte del proceso de subida: el antivirus comprueba el documento y, si se detecta un virus, se lanza inmediatamente un aviso de error y el documento no se incorpora al repositorio) o en modo segundo plano.
| Field / Property | Type | Description |
|---|---|---|
| system.antivir | String | Establece la ruta del antivirus. |
| background.antivirus.check | Boolean | Habilita o deshabilita el comprobador antivirus en segundo plano. Por defecto está establecido a false. Hay una tarea crontab (Administration > Crontab) llamada Antivirus Checker Worker que controla el comprobador antivirus en segundo plano. Cuando la comprobación en segundo plano está deshabilitada, el antivirus se procesa durante la subida del documento. Esto puede añadir tiempo extra al proceso de subida (en algunos casos, el antivirus puede tardar más de 3 segundos en comprobar un documento). Cuando realiza una importación masiva de ficheros, el tiempo total para completar la operación puede multiplicarse por 3 o más con esta opción deshabilitada, porque la comprobación antivirus se ejecuta como parte del proceso de subida. Nuestra sugerencia es dejarlo habilitado. true |
| background.antivirus.check.threads | Integer | Número de hilos concurrentes usados para el antivirus. Este número debería ser menor o igual al número de núcleos de hardware. 2 |
| background.antivirus.check.batch | Integer | Indica el número de documentos a procesar en cada ciclo de indexación. Cuando el parámetro “background.antivirus.check” está habilitado, es buena práctica establecerlo como un múltiplo del valor de “background.antivirus.check.threads”. 20 |
Para más información, lea Antivirus configuration parameters.
Reindexar todo el repositorio Lucene
Sección titulada «Reindexar todo el repositorio Lucene»La aplicación puede usar dos formas distintas de reconstruir los índices Lucene: secuencial o paralela. Por defecto, la reindexación secuencial está habilitada, pero puede seleccionar el modo con el parámetro de configuración “hibernate.indexer.rebuild”.
| Field / Property | Type | Description |
|---|---|---|
| hibernate.indexer.rebuild | String | Por defecto está establecido a “flush”. Los valores posibles son “mass”, “flush” y “delayed”. Vea la tabla de abajo para el detalle de cada valor. |
Puede usar el parámetro de configuración “hibernate.indexer.batch.size.load.objects” para indicar a Hibernate cuántos objetos debe manejar a la vez. Para evitar problemas de OutOfMemory, el repositorio necesita reindexarse por lotes. Si el valor de esta propiedad es demasiado bajo, el rendimiento será pobre, pero si es demasiado alto, puede tener problemas de OutOfMemory.
| Mode | Description |
|---|---|
| Mass Indexer | Este modo reindexa el repositorio en paralelo, usando varios hilos. Puede ser más rápido, pero también es más problemático en términos de recursos. El repositorio estará en modo solo lectura hasta que termine. Tiene varias propiedades de configuración para ajustar su rendimiento: - hibernate.indexer.batch.size.load.objects: tamaño del lote usado para cargar las entidades. 30 - hibernate.indexer.threads.load.objects: número de hilos usados para cargar las entidades. 4 |
| Flush to Indexes | Este modo reconstruye el índice secuencialmente por lotes. Consume menos recursos, pero puede ser más lento. El repositorio estará en modo solo lectura hasta que termine. Tiene varias propiedades de configuración para ajustar su rendimiento: - hibernate.indexer.batch.size.load.objects: tamaño del lote usado para cargar las entidades. 30 |
| Delayed Indexer | Hay una tarea cron llamada “Lucene Delayed Indexer” que procesa en segundo plano la cola de nodos a indexar. Esta cola se rellena cuando va a Administration > Tools > Rebuild indexes y elige “Lucene indexes”. Cuando el indexador diferido está habilitado, los nodos se incluyen en la cola de lotes para procesarse con este proceso en segundo plano. Este modo reconstruye el índice secuencialmente por lotes. Consume menos recursos y puede ser más lento, pero tiene más control porque puede elegir qué nodos necesitan reindexarse, y el repositorio no estará en modo solo lectura mientras trabaja. Tiene varias propiedades de configuración para ajustar su rendimiento: - hibernate.indexer.delayed.max.objects: cuántos nodos se procesarán en un lote. 1000 - hibernate.indexer.batch.size.load.objects: número de nodos a leer de la base de datos a la vez. 4 |
Tiempo de espera de ejecución
Sección titulada «Tiempo de espera de ejecución»La aplicación ejecuta programas externos para procesar documentos; por ejemplo, extrae texto con un motor OCR, analiza documentos con software antivirus y transforma documentos a otros formatos, entre otras acciones. A veces estos procesos pueden tardar mucho tiempo o, por algún motivo, no terminar correctamente, y el proceso sigue ejecutándose en el sistema operativo consumiendo recursos. Para evitarlo, el parámetro “system.execution.timeout” establece el tiempo máximo de ejecución permitido para las aplicaciones externas.
| Field / Property | Type | Description |
|---|---|---|
| system.execution.timeout | Integer | Establece el tiempo máximo de ejecución permitido para las aplicaciones externas. Las unidades son minutos. Por defecto, la configuración está establecida a 5 minutos. 5 |
Acciones del log de actividad
Sección titulada «Acciones del log de actividad»OpenKM puede registrar mucha información relacionada con la actividad del usuario, pero a veces estas acciones no necesitan registrarse y pueden llenar su tabla de log de actividad.
Hay una propiedad de configuración llamada “activity.log.actions” donde puede establecer qué acciones registrar. Por defecto, está establecida a las acciones más comunes o interesantes. Puede usar expresiones regulares para definir estas acciones. Lea Java Regex Tutorial para más información sobre expresiones regulares de Java.
| Field / Property | Type | Description |
|---|---|---|
| activity.log.actions | List | LOGIN LOGOUT CREATE_.* DELETE_.* PURGE_.* MOVE_.* COPY_.* CHECKOUT_DOCUMENT CHECKIN_DOCUMENT GET_DOCUMENT_CONTENT.* MISC_TEXT_EXTRACTION_FAILURE |
Actividad del dashboard
Sección titulada «Actividad del dashboard»El dashboard de OpenKM muestra una vista global de la actividad de la aplicación. Para proporcionarla, la aplicación necesita procesar una gran cantidad de información, lo que puede reducir el rendimiento general (por ejemplo, para obtener los documentos subidos más recientemente, OpenKM puede ejecutar consultas de base de datos lentas). Por ello, sugerimos que los repositorios muy grandes deshabiliten la actividad del dashboard.
| Field / Property | Type | Description |
|---|---|---|
| dashboard.user.activity | Boolean | Establézcalo a false para deshabilitar la funcionalidad. |
El motor de búsqueda Lucene puede deshabilitarse o configurarse de varias formas. Dependiendo de la configuración, el comportamiento de la aplicación y el rendimiento general pueden cambiar.
| Field / Property | Type | Description |
|---|---|---|
| spring.jpa.properties.hibernate.search.enabled | String | Habilita o deshabilita el motor de búsqueda Lucene. Valores permitidos: - true - false true |
| spring.jpa.properties.hibernate.search.automatic_indexing.synchronization.strategy | String | Establece el modo de ejecución del worker de Lucene. Por defecto está establecido a “write-sync”, lo que significa que la modificación de una entidad no se completará hasta que el índice Lucene se haya actualizado correctamente. En el caso de “async”, las modificaciones de entidades serán más rápidas porque la parte de Lucene se añade a una cola y se procesa en un hilo en segundo plano. Valores permitidos: - sync - async sync |
Otras propiedades de configuración
Sección titulada «Otras propiedades de configuración»| Field / Property | Type | Description |
|---|---|---|
| background.parent.node.purge | Boolean | Realiza la purga de nodos como tarea en segundo plano, de forma que el usuario pueda seguir trabajando sin esperar a que termine el proceso. |