Limpieza y preparación de datos para Process Mining
Process Mining eficaz comienza con datos de buena calidad, y la mayor parte del trabajo se reduce a los mismos problemas: eventos que nunca se registraron, identificadores que no coinciden entre sistemas, formatos incompatibles y extracciones demasiado grandes o sensibles para tratarlas sin cuidado. Esta página aborda esos problemas y los pasos para resolverlos. Para realizar el mismo trabajo dentro de ProcessMind, consulte Configuración de su conjunto de datos y Calidad de los datos.
¿Por qué son importantes la limpieza y la preparación de datos?
Process Mining se basa en registros de eventos: conjuntos de datos que contienen la secuencia detallada de actividades de un proceso empresarial. Si esos conjuntos están incompletos, son incoherentes o contienen errores, la información obtenida no será fiable. Los datos limpios y correctamente estructurados permiten que la herramienta mapee los flujos de trabajo, detecte cuellos de botella y destaque áreas de mejora.
Pasos clave para limpiar y preparar los datos
1. Recopile datos de todos los sistemas implicados
Los datos suelen proceder de varios sistemas: un ERP para pedidos y facturas, un CRM para los pasos relacionados con clientes y una mesa de servicio para los tickets. Recopílelos todos antes de empezar la limpieza, porque un paso que reside en un sistema omitido no podrá recuperarse después.
- Consolide las fuentes de datos: enumere los sistemas que registran parte del proceso y extraiga los datos de cada uno. Por ejemplo, un proceso de pedido a cobro abarca un sistema de ventas (por ejemplo, Salesforce) y un sistema financiero (por ejemplo, SAP).
- Rompa los silos: acuerde con las personas responsables del proceso qué sistemas cuentan y quién puede exportar sus datos. Los datos ausentes suelen proceder de un sistema no incluido, no de una consulta defectuosa. Las herramientas de integración (por ejemplo, Apache NiFi, Talend, Informatica o Power BI) pueden combinar varias fuentes en un solo archivo.
- Planifique lo que no puede extraer: si un paso ocurre fuera de los sistemas (una aprobación telefónica o una firma en papel), registre al menos su resultado en un sistema digital o modele el paso para que la vista del proceso siga siendo completa. Dónde obtener datos explica cómo obtenerlos sistema por sistema.
2. Elimine los duplicados
Los registros duplicados distorsionan el análisis al inflar los recuentos de actividades y hacer que un evento parezca varios. Identifíquelos mediante el mismo ID de caso, actividad y marca de tiempo, y después elimínelos o combínelos en una sola fila.
3. Gestione los datos ausentes
Las marcas de tiempo, actividades o ID de caso ausentes rompen la secuencia de eventos y generan modelos de proceso incompletos.
- Identifique los valores ausentes: busque marcas de tiempo en blanco, nombres de actividad vacíos e ID de caso nulos.
- Rellene las lagunas: cuando sea posible, utilice otras fuentes o sus conocimientos del dominio. Si falta una marca de tiempo, las horas de los eventos cercanos pueden ayudar a acotarla.
- Modele en lugar de inventar: para los pasos que nunca se registraron, añádalos mediante modelado de procesos en lugar de inventar marcas de tiempo, de modo que el proceso extraído y el proceso documentado coincidan.
- Impute o elimine: para las lagunas críticas, utilice una técnica de imputación (por ejemplo, sustitución por la media o un modelo de regresión); si un caso no puede recuperarse, elimínelo y anote el motivo.
4. Normalice formatos, identificadores y nombres
- Marcas de tiempo: utilice un único formato en todas partes (por ejemplo,
YYYY-MM-DD HH:MM:SS). Si la extracción mezcla zonas horarias, convierta todo a UTC. Consulte la lista de formatos de fecha compatibles - ID de caso: el mismo proceso suele tener identificadores diferentes en distintos sistemas: un número de pedido en el CRM y un número de factura en finanzas. Cree una correspondencia entre ellos, en la extracción o en una tabla de consulta, para que cada evento quede asociado a un único caso, y asigne a cada instancia del proceso un ID único. En ProcessMind, compruebe que la columna de ID de caso esté asignada de la misma forma en todos los conjuntos de datos que combine; consulte atributos del conjunto de datos.
- Nombres de actividad: los sistemas pueden etiquetar el mismo paso de forma diferente. Elija una única denominación para cada paso (“Aprobar pedido” y “Aprobación del pedido” son la misma actividad).
- Valores y tipos: mantenga los números como números (costes, duraciones, importes) y utilice una unidad por columna.
5. Elimine los eventos irrelevantes
No todos los eventos registrados pertenecen al proceso que está analizando; los inicios de sesión, los reintentos técnicos y las tareas administrativas llenan el mapa sin aportar información útil.
- Filtre lo que no corresponda: utilice sus conocimientos del dominio para decidir qué eventos describen el proceso y excluya el resto.
- Elija el nivel de granularidad adecuado: los eventos demasiado generales (“pedido gestionado”) ocultan las variaciones que busca, mientras que los eventos demasiado detallados saturan el mapa con información técnica. Agrupe los eventos de bajo nivel en la actividad empresarial a la que pertenecen y deje que las personas expertas en el proceso decidan dónde establecer el límite.
6. Gestione los valores atípicos y el ruido
Los valores atípicos ofrecen una imagen inexacta del funcionamiento habitual del proceso: una tarea que tardó mucho más de lo normal debido a un evento poco frecuente puede dominar los promedios.
- Identifíquelos: marque las duraciones que se sitúen muy fuera del intervalo normal de ese paso.
- Decida si debe conservarlos: una excepción real, un fallo poco frecuente pero crítico, suele ser información valiosa que conviene conservar; un error de datos no lo es. Elimine solo lo que sea incorrecto, no lo que resulte incómodo.
7. Compruebe el orden de los eventos
Si los eventos están desordenados, la herramienta traza el flujo incorrecto.
- Valide la secuencia: los eventos de cada caso deben seguir el orden de las marcas de tiempo. Un evento “Pedido aprobado” anterior a “Pedido creado” en el mismo caso indica que es necesario comprobar las marcas de tiempo.
- Ordene por marca de tiempo: ordene los eventos de cada caso por la columna de marca de tiempo antes de cargarlos.
8. Gestione los conjuntos de datos grandes
Las extracciones grandes tardan en prepararse y cargarse, por lo que debe planificar el tamaño en lugar de luchar contra él.
- Muestree para explorar y cargue para analizar: una muestra representativa basta para comprobar si los eventos extraídos tienen sentido; cargue la extracción completa cuando el análisis lo requiera.
- Cargue de forma incremental: en lugar de reemplazarlo todo, añada nuevos periodos mediante cargas incrementales (delta).
- Prefiera formatos columnares: los archivos Parquet y ORC son más pequeños y se cargan más rápido que CSV o Excel para grandes volúmenes; consulte Formatos de datos compatibles.
9. Proteja los datos sensibles
Los registros de eventos contienen nombres, direcciones, números de cliente e ID de usuario, por lo que debe tratar la extracción como datos personales.
- Anonimice o enmascare: elimine o enmascare lo que el análisis no necesite y conserve los ID de usuario solo cuando el análisis de recursos sea relevante.
- Limite el acceso: entregue la extracción al menor número posible de personas, según la necesidad de saber, y utilice el control de acceso basado en roles para los conjuntos de datos que cargue.
- Siga las normas que le correspondan: límites de conservación, cifrado en tránsito y en reposo, y normativas como el RGPD para los datos de clientes.
10. Cree el registro de eventos
Cuando los datos estén limpios, sean coherentes y estén ordenados, cree el registro de eventos, el conjunto de datos principal para Process Mining. Todo registro necesita:
- ID de caso: un identificador único para cada instancia del proceso.
- Actividad: el nombre del paso que ocurrió.
- Marca de tiempo: cuándo ocurrió, lo que determina el orden de los eventos.
Las columnas opcionales aportan más contexto: el recurso (persona o equipo), el departamento, el coste o cualquier atributo personalizado por el que quiera segmentar el proceso. La lista completa de requisitos aparece en Formatos de datos compatibles.
11. Valide el conjunto de datos
Antes de confiar en los resultados, compruebe que el conjunto de datos representa el proceso que cree que representa.
- Compruebe algunos casos: recorra de principio a fin varias instancias del proceso y confirme que las secuencias de eventos tienen sentido.
- Ejecute un análisis de prueba: extraiga el proceso una vez y busque incoherencias evidentes: actividades que nunca ocurren, un evento de inicio o fin extraño y casos que deberían haberse cerrado.
- Confirme los datos con las personas responsables del proceso: las personas expertas del negocio pueden decirle en pocos minutos si los datos reflejan cómo se realiza realmente el trabajo.
Limpieza de datos dentro de ProcessMind
Gran parte de la preparación anterior puede realizarse dentro de ProcessMind después de cargar los datos:
- Asigne y configure las columnas: establezca los nombres mostrados, los tipos de datos y los formatos de marca de tiempo en los atributos del conjunto de datos, en lugar de modificar el archivo de origen.
- Compruebe la calidad: el Dashboard de Calidad de los datos señala valores ausentes e incoherencias para que pueda corregirlos antes del análisis, y las Recomendaciones de datos de IA sugieren asignaciones y correcciones.
- Oculte o filtre los datos irrelevantes: oculte columnas en los atributos del conjunto de datos y utilice filtros para excluir los eventos que no necesite.
- Vuelva a cargar en lugar de cargar de nuevo: sustituya los datos en el mismo lugar o utilice cargas incrementales (delta) para conjuntos de datos que crecen continuamente.
Para limpiar los datos fuera de ProcessMind, puede utilizar herramientas de propósito general (Python/Pandas, Excel o Google Sheets), herramientas ETL u OpenRefine antes de cargarlos. Para consultar la guía más amplia sobre nombres, formatos, cargas incrementales y archivado, consulte ETL para Process Mining.
Temas relacionados
- Dónde obtener datos: extraiga una fila por paso de sus sistemas
- Formatos de datos compatibles: tipos de archivo y requisitos de estructura
- Calidad de los datos: qué comprueba la insignia de calidad
- Solución de problemas de datos: correcciones para cada síntoma
- ETL para Process Mining: la guía completa de preparación de datos