En esta página

Carga incremental de datos

Process Intelligence Process Intelligence Disponible con una licencia de Process Intelligence o superior. Solo las licencias de este plan o de uno superior pueden utilizar esta función. Comparar planes Disponible con una licencia de Process Intelligence o superior

¿Qué es la carga incremental de datos?

La carga incremental de datos, también llamada carga delta, permite anexar nuevas filas a una tabla de datos existente sin reemplazar los datos originales. Resulta útil cuando los datos del registro de eventos crecen con el tiempo y desea mantener actualizados sus análisis de Process Mining sin volver a cargar todo el conjunto de datos.

Entre los escenarios habituales se incluyen:

  • Exportaciones diarias o semanales de datos: anexe nuevas transacciones, pedidos o casos a medida que estén disponibles.
  • Supervisión continua del proceso: mantenga sus Dashboards actualizados añadiendo datos recientes con regularidad.
  • Registros de eventos en crecimiento: añada progresivamente nuevos eventos de sistemas ERP, herramientas CRM u otras fuentes.
Área de carga Reemplazar datos de la tabla de datos de ProcessMind

info

Los archivos Delta deben tener la misma estructura de columnas (nombres y orden de las columnas) que la carga original. Las columnas adicionales del archivo Delta se ignoran. Las columnas que falten producirán valores nulos.

Requisitos

  • La tabla de datos debe tener ya una carga inicial con datos cargados.
  • El archivo delta debe estar en el mismo formato que la carga original:
    • Los archivos CSV requieren archivos delta CSV
    • Los archivos Parquet requieren archivos delta Parquet
    • Los archivos ORC requieren archivos delta ORC
    • Los archivos JSONL requieren archivos delta JSONL
  • Los archivos Excel (XLSX/XLS/XLSB) y XES no son compatibles con las cargas delta: conviértalos primero a CSV.
  • Los nombres de las columnas del archivo delta deben coincidir con los de la carga original.
  • Los archivos delta pueden comprimirse con gzip (.gz), siempre que el formato interno coincida con el formato de la carga original.

info

Para consultar información sobre todos los formatos de archivo compatibles, visite la página Formatos de datos compatibles.

Carga de datos incremental

Mediante la API

Utilice la API de ProcessMind para cargar archivos delta mediante programación. Consulte la página Referencia de la API: datos para obtener información completa sobre los endpoints.

El flujo de trabajo es el siguiente:

  1. Obtenga una URL de carga prefirmada para el delta:

    GET /v1/tenant/{tenantId}/datatables/{dataTableId}/uploads/presignedurl
        ?delta=true&filename=delta.csv&filesize=1024&filelastmodified=1704067200000
  2. Cargue el archivo delta mediante la URL prefirmada:

    curl -X PUT --upload-file "delta.csv" \
        -H "Content-Type: text/csv" \
        "{PreSignedUploadUrl}"

Cuando finaliza la carga, ProcessMind procesa automáticamente el delta y lo combina con los datos originales. Puede consultar periódicamente GET /datatables/{dataTableId} hasta que hasDataLoaded sea true para saber cuándo termina el procesamiento.

Mediante la interfaz de usuario

La carga incremental de datos también puede iniciarse desde la pestaña General del conjunto de datos en la aplicación ProcessMind:

  1. Active el interruptor Anexar para cambiar el área de carga de Reemplazar datos a Anexar datos.
  2. Arrastre el archivo nuevo al área Anexar datos o haga clic para buscarlo y seleccionarlo.

ProcessMind carga el archivo como un delta y lo procesa junto con los datos existentes. Las cargas delta son explícitas: nunca se detectan automáticamente a partir de una carga normal, que reemplaza los datos.

Visualización de las partes de la carga

Después de una o más cargas incrementales, el historial de cargas de la tabla de datos incluye una uploadPartsmatriz que registra cada archivo:

{
	"uploadHistory": {
		"uploadParts": [
			{
				"key": "datatable/123/2.csv",
				"fileName": "orders-january.csv",
				"fileSize": 524288,
				"uploadedAt": "2024-01-15T10:00:00Z"
			},
			{
				"key": "datatable/123/3.csv",
				"fileName": "orders-february.csv",
				"fileSize": 419430,
				"uploadedAt": "2024-02-15T10:00:00Z"
			}
		]
	}
}

Prácticas recomendadas

  • Utilice nombres de columnas coherentes en todos los archivos para evitar problemas de alineación de datos.
  • Cargue los archivos en orden cronológico cuando sea posible, para que el historial de cargas refleje la cronología de los datos.
  • Mantenga un tamaño razonable para los archivos delta: cargue los datos en lotes moderados; un número muy elevado de archivos pequeños puede ralentizar el procesamiento.
  • Supervise el número de filas después de cada delta para verificar que los datos se hayan cargado correctamente.

warning

Las cargas incrementales anexan datos: no actualizan ni reemplazan las filas existentes. Si necesita corregir datos de una carga anterior, vuelva a cargar el conjunto de datos completo.

Comportamiento ante diferencias de esquema

ProcessMind no impone un esquema estricto entre las partes de una carga. Esto significa lo siguiente:

  • Las columnas adicionales de los archivos delta se ignoran durante el procesamiento: solo se utilizan las columnas que existen en el esquema de la carga original.
  • Las columnas que faltan generan valores nulos o vacíos para esos campos en las filas delta.
  • Los nombres de columna diferentes se tratan como columnas completamente distintas: las filas delta tendrán valores nulos en las columnas esperadas.

Para obtener los mejores resultados, asegúrese de que todos los archivos delta tengan la misma estructura de columnas que la carga original.

info

En los formatos CSV y JSONL, todos los valores se leen internamente como cadenas, por lo que no se produce ningún error de incompatibilidad de tipos. En los formatos Parquet y ORC, los tipos de datos de las columnas se conservan según el esquema del archivo. En todos los casos, si una columna espera datos numéricos y carga valores incompatibles, los análisis posteriores o las simulaciones pueden producir resultados inesperados.