En esta página

Formatos de datos compatibles con los registros de eventos

Process Intelligence Process Intelligence Disponible con una licencia de Process Intelligence o superior. Solo las licencias de este plan o de uno superior pueden utilizar esta función. Comparar planes Disponible con una licencia de Process Intelligence o superior

Compatibilidad de archivos para la carga de datos

ProcessMind admite muchos formatos de archivo para cargar registros de eventos. Todos pueden cargarse tanto mediante la interfaz de la aplicación como mediante la API.

Formatos basados en texto

  • .csv: valores separados por comas. Es un formato común y ligero; la mayoría de los sistemas, como Excel y los ERP, pueden exportarlo. Los delimitadores se detectan automáticamente.
  • .tsv: valores separados por tabulaciones. Es similar a CSV, pero utiliza tabulaciones en lugar de comas; resulta útil cuando los datos contienen comas.
  • .txt: archivos de texto sin formato. Pueden utilizarse si tienen una estructura coherente y delimitada.
  • .xes: formato estándar para registros de eventos utilizado por las herramientas de Process Mining. Es ideal para realizar un seguimiento detallado de actividades con marcas de tiempo e ID de caso.

Formatos de Excel

  • .xls: formato de hoja de cálculo de Excel (versión antigua). Es compatible, pero puede cargarse más lentamente que los formatos recientes.
  • .xlsx: formato moderno de Excel. Se utiliza ampliamente y es totalmente compatible; suele preferirse para datos estructurados.
  • .xlsb: libro binario de Excel. Se carga más rápido y gestiona mejor los conjuntos de datos grandes que .xlsx, pero no es compatible con tantos sistemas.

Formatos de datos binarios/columnares

  • .parquet: formato Apache Parquet. Formato de almacenamiento columnar optimizado para cargas de trabajo analíticas. Excelente para conjuntos de datos grandes, significativamente más rápido que CSV para grandes volúmenes de datos. Admite cargas incrementales (delta).
  • .orc: formato Optimized Row Columnar (ORC). Otro formato columnar eficiente, habitual en los ecosistemas Hadoop/Spark. Admite cargas incrementales (delta).
  • .jsonl / .ndjson: formato JSON Lines. Cada línea es un objeto JSON independiente. Ideal para exportar datos en streaming desde API y sistemas de registro. Admite cargas incrementales (delta).

Archivos comprimidos

  • .gz: archivos comprimidos con Gzip. Cualquiera de los formatos anteriores puede comprimirse con Gzip (por ejemplo, data.csv.gz, data.parquet.gz). ProcessMind detecta automáticamente el formato interno y lo descomprime cuando es necesario. La compresión Gzip puede reducir los tiempos de carga de los archivos grandes.

Consejo de rendimiento: utilice el formato Parquet para conjuntos de datos grandes

Para conjuntos de datos con millones de filas, considere utilizar el formato Parquet. Los archivos Parquet son columnares, están comprimidos e incluyen información de esquema integrada. Esto permite cargas y consultas más rápidas, además de detectar automáticamente las columnas sin analizar una fila de encabezado. Parquet también admite cargas incrementales (delta) para conjuntos de datos que crecen continuamente.

Requisitos generales de estructura de archivos

Para realizar Process Mining correctamente en ProcessMind, los archivos que cargue, ya sean de Excel, de texto o XML, deben cumplir determinadas pautas estructurales. Así, la aplicación puede interpretar los datos correctamente y realizar un análisis preciso.

1. Fila de encabezado (Excel o archivos de texto)

  • El archivo debe comenzar con una fila de encabezado situada en la primera línea (por ejemplo, celda A1 en archivos de Excel o línea 1 en archivos CSV, TSV o TXT). El encabezado define los nombres de las columnas y debe indicar claramente el tipo de datos de cada columna (por ejemplo, «ID del caso», «Actividad», «Marca de tiempo»).
  • En los formatos CSV, TSV y TXT, los delimitadores y las comillas se detectan automáticamente, lo que facilita la carga de los datos sin tener que especificar estos ajustes manualmente.
  • En los formatos Parquet y ORC, los nombres de las columnas y los tipos de datos se leen directamente del esquema integrado en el archivo: no se necesita una fila de encabezado.
  • En los formatos JSONL/NDJSON, los nombres de las columnas se obtienen de las claves JSON de la primera línea del archivo.

2. Conjunto mínimo de atributos

Para admitir la estructura de un registro de eventos de Process Mining, el archivo debe contener, como mínimo, los siguientes atributos (columnas). No es necesario que coincidan con los nombres de las columnas (ID del caso, Actividad, etc.), pero sí deben contener la información indicada.

  • ID del caso: esta columna identifica de forma única cada instancia del proceso (o caso). Todas las filas correspondientes a la misma instancia del proceso deben tener el mismo ID del caso.
  • Actividad: esta columna debe describir la actividad o el evento específico que se registra (por ejemplo, «Pedido creado», «Pago procesado»).
  • Marca de tiempo: cada actividad debe asociarse a una marca de tiempo que indique la hora o fecha exacta en que ocurrió el evento.
  • Nota: el formato de la marca de tiempo se detectará automáticamente en la medida de lo posible. Los formatos habituales, como yyyy-MM-dd HH:mm:ss, MM/dd/yyyy, entre otros, se reconocen automáticamente.
  • Atributos opcionales: puede incluir columnas adicionales para mejorar el análisis, como las siguientes:
  • Recurso: identifica quién realizó la actividad (por ejemplo, una persona usuaria o un departamento).
  • Coste: cualquier coste asociado a la actividad.
  • Otros datos personalizados: puede incluir campos personalizados relevantes para su proceso específico, siempre que estén presentes las columnas obligatorias.

Las columnas exactas dependen del proceso que esté analizando. Nuestras guías de mejora de procesos describen el esquema que necesita cada proceso: los campos obligatorios, las actividades que debe capturar y una plantilla de datos que puede completar.

3. Formato de los datos

  • Asegúrese de que los datos tengan un formato coherente en todas las columnas:
  • Las marcas de tiempo deben utilizar un formato estándar y reconocible (por ejemplo, yyyy-MM-dd HH:mm:ss), aunque ProcessMind intentará detectar automáticamente el formato de fecha si es diferente.
  • Evite dejar filas en blanco entre las entradas de datos, ya que esto puede interrumpir el proceso de importación.
  • Asegúrese de que los datos numéricos (por ejemplo, costes y duraciones) estén formateados como números en Excel o tengan el formato correcto en archivos de texto (CSV, TSV y TXT).
  • En los formatos CSV, TSV y TXT, ProcessMind detectará automáticamente los delimitadores (comas, tabulaciones, puntos y comas, etc.) y gestionará automáticamente el texto entre comillas.

4. Selección de hojas (solo para archivos de Excel)

  • ProcessMind procesa automáticamente los datos de la primera hoja del archivo de Excel (XLS, XLSX o XLSB), independientemente de su nombre. Asegúrese de colocar los datos necesarios del registro de eventos en la primera hoja, ya que las hojas adicionales no se tendrán en cuenta durante la importación.

5. Formato XES

El formato .xes (eXtensible Event Stream) es un tipo de archivo estándar utilizado para los registros de eventos de Process Mining. Captura información detallada sobre las instancias del proceso, como los ID de caso, las actividades, las marcas de tiempo y otros atributos relevantes.

Cuenta con un amplio respaldo en las herramientas de Process Mining y es ideal para reconstruir con precisión el comportamiento de los procesos reales.

Para consultar las especificaciones técnicas y todos los detalles, visite el sitio web oficial del estándar XES.

6. Formatos Parquet, ORC y JSONL

Parquet y ORC son formatos binarios columnares muy utilizados en las canalizaciones de ingeniería de datos (Apache Spark, AWS Glue, Databricks, etc.). Incluyen información de esquema integrada, por lo que ProcessMind detecta automáticamente los nombres de las columnas y los tipos de datos sin configuración manual.

Los archivos JSONL (JSON Lines, también conocido como NDJSON) contienen un objeto JSON por línea. Cada objeto representa un evento individual. Las claves JSON se convierten en los nombres de las columnas. Este formato es habitual al exportar datos desde API, sistemas de registro o plataformas de streaming.

Los tres formatos:

7. Consejos

Consejo de rendimiento: utilice el formato XLSB para procesar los datos más rápido

Aunque ProcessMind puede cargar y procesar todos los formatos de Excel compatibles, utilice el formato XLSB para los archivos de Excel. El formato XLSB almacena el archivo de Excel en formato binario, lo que ofrece importantes ventajas de rendimiento, especialmente con conjuntos de datos grandes. Esto se traduce en tiempos de carga más cortos y un procesamiento más rápido que con los formatos XLS o XLSX.

Para conjuntos de datos grandes: utilice Parquet u ORC

Para conjuntos de datos con millones de filas o canalizaciones de datos automatizadas, utilice el formato Parquet o ORC en lugar de Excel o CSV. Estos formatos columnares ofrecen la mejor compresión y rendimiento de consulta. Admiten la carga incremental de conjuntos de datos que crecen continuamente.