Limpeza e preparação de dados para Process Mining
Um Process Mining eficaz começa com dados de boa qualidade, e a maior parte do trabalho se resume aos mesmos problemas: eventos que nunca foram registrados, identificadores que não coincidem entre sistemas, formatos divergentes e extrações grandes demais ou sensíveis demais para serem tratadas sem cuidado. Esta página aborda esses problemas e as etapas para corrigi-los. Para fazer o mesmo trabalho dentro do ProcessMind, consulte Configurando seu conjunto de dados e Qualidade dos dados.
Por que a limpeza e a preparação de dados são importantes?
O Process Mining depende de registros de eventos: conjuntos de dados que contêm a sequência detalhada de atividades em um processo de negócio. Se esses conjuntos de dados estiverem incompletos, inconsistentes ou contiverem erros, os insights obtidos não serão confiáveis. Dados limpos e estruturados corretamente garantem que a ferramenta consiga mapear fluxos de trabalho, detectar gargalos e destacar áreas de melhoria.
Principais etapas da limpeza e preparação de dados
1. Colete dados de todos os sistemas envolvidos
Os dados geralmente vêm de vários sistemas: um ERP para pedidos e faturas, um CRM para etapas relacionadas aos clientes e uma central de serviços para tickets. Colete dados de todos eles antes de começar a limpeza, porque uma etapa que está em um sistema deixado de fora não poderá ser recuperada depois.
- Consolide as fontes de dados: liste os sistemas que registram parte do processo e extraia dados de cada um. Um processo de pedido ao recebimento, por exemplo, abrange um sistema de vendas (como o Salesforce) e um sistema financeiro (como o SAP).
- Rompa os silos: combine com os responsáveis pelo processo quais sistemas devem ser considerados e quem pode exportar dados deles. Dados ausentes geralmente vêm de um sistema não informado, não de uma consulta com problema. Ferramentas de integração, como Apache NiFi, Talend, Informatica ou Power BI, podem combinar várias fontes em um único arquivo.
- Planeje o que você não consegue extrair: se uma etapa acontece fora dos sistemas, como uma aprovação por telefone ou uma assinatura em papel, registre pelo menos o resultado em um sistema digital ou modele a etapa para manter completa a visão do processo. Onde obter dados explica como obter dados sistema por sistema.
2. Remova duplicidades
Registros duplicados distorcem a análise ao inflar as contagens de atividades e fazer um evento parecer vários. Identifique-os pelo mesmo ID de caso, atividade e timestamp e depois remova-os ou combine-os em uma única linha.
3. Trate os dados ausentes
Timestamps, atividades ou IDs de caso ausentes quebram a sequência de eventos e produzem modelos de processo incompletos.
- Identifique valores ausentes: procure timestamps em branco, nomes de atividades vazios e IDs de caso nulos.
- Preencha as lacunas: quando possível, use outras fontes ou conhecimento do domínio. Se um timestamp estiver ausente, os horários dos eventos próximos podem ajudar a estimá-lo.
- Modele em vez de inventar: para etapas que nunca foram registradas, adicione-as por meio da modelagem de processos, em vez de fabricar timestamps. Assim, o processo minerado e o processo documentado ficam alinhados.
- Impute ou remova: para lacunas críticas, use uma técnica de imputação, como substituição pela média ou um modelo de regressão. Se um caso não puder ser recuperado, remova-o e registre o motivo.
4. Normalize formatos, IDs e nomes
- Timestamps: use um único formato em todos os lugares (por exemplo,
YYYY-MM-DD HH:MM:SS). Se a extração misturar fusos horários, converta tudo para UTC. Veja a lista de formatos de data compatíveis - IDs de caso: o mesmo processo geralmente usa identificadores diferentes em sistemas distintos, como um número de pedido no CRM e um número de fatura no financeiro. Crie um mapeamento entre eles, na extração ou em uma tabela de consulta, para que cada evento seja associado a um único caso, e atribua um ID exclusivo a cada instância do processo. No ProcessMind, verifique se a coluna de ID de caso está mapeada da mesma forma em todos os conjuntos de dados combinados; consulte atributos do conjunto de dados.
- Nomes de atividades: os sistemas podem nomear a mesma etapa de formas diferentes. Defina uma única nomenclatura para cada etapa (“Aprovar pedido” e “Aprovação do pedido” representam a mesma atividade).
- Valores e tipos: mantenha os números como números, como custos, durações e valores, e use uma única unidade por coluna.
5. Remova eventos irrelevantes
Nem todo evento registrado pertence ao processo que você está analisando. Logins no sistema, novas tentativas técnicas e tarefas administrativas deixam o mapa mais confuso sem acrescentar insight.
- Filtre o que não pertence ao processo: use o conhecimento do domínio para decidir quais eventos descrevem o processo e exclua os demais.
- Escolha o nível de granularidade adequado: eventos muito abrangentes, como “pedido tratado”, ocultam as variações que você procura, enquanto eventos detalhados demais sobrecarregam o mapa com informações técnicas. Agrupe eventos de baixo nível na atividade de negócio à qual pertencem, deixando que os especialistas do processo definam esse limite.
6. Trate outliers e ruídos
Outliers dão uma visão imprecisa de como o processo normalmente funciona: uma tarefa que levou tempo demais por causa de um evento raro pode dominar as médias.
- Identifique-os: sinalize durações muito fora do intervalo normal daquela etapa.
- Decida se deve mantê-los: uma exceção real, como uma falha rara, mas crítica, geralmente é um insight que vale a pena manter; um erro de dados, não. Remova apenas o que está errado, não o que é inconveniente.
7. Verifique a ordem dos eventos
Se os eventos estiverem fora de ordem, a ferramenta rastreará o fluxo errado.
- Valide a sequência: os eventos de cada caso devem seguir os timestamps. Um evento “Pedido aprovado” antes de “Pedido criado” no mesmo caso indica que os timestamps precisam ser verificados.
- Ordene por timestamp: ordene os eventos de cada caso pela coluna de timestamp antes de carregar os dados.
8. Trate conjuntos de dados grandes
Extrações grandes demoram para ser preparadas e carregadas, portanto planeje o trabalho considerando o volume, em vez de tentar contorná-lo.
- Use uma amostra para explorar e carregue tudo para analisar: uma amostra representativa basta para verificar se os eventos extraídos fazem sentido; carregue a extração completa quando a análise exigir.
- Carregue de forma incremental: em vez de substituir tudo, acrescente novos períodos com carregamentos incrementais (delta).
- Prefira formatos colunares: arquivos Parquet e ORC são menores e carregam mais rápido do que CSV ou Excel em grandes volumes; consulte Formatos de dados compatíveis.
9. Proteja dados sensíveis
Os registros de eventos contêm nomes, endereços, números de clientes e IDs de usuários. Por isso, trate a extração como dado pessoal.
- Anonimize ou mascare: remova ou mascare o que a análise não precisa e mantenha os IDs de usuários apenas quando a análise de recursos for relevante.
- Limite o acesso: compartilhe a extração com o menor número possível de pessoas, conforme a necessidade de conhecimento, e use o controle de acesso baseado em funções para os conjuntos de dados carregados.
- Siga as regras aplicáveis: limites de retenção, criptografia em trânsito e em repouso e regulamentações como a LGPD para dados de clientes.
10. Crie o registro de eventos
Quando os dados estiverem limpos, consistentes e ordenados, crie o registro de eventos, o principal conjunto de dados para Process Mining. Todo registro precisa de:
- ID de caso: um identificador exclusivo para cada instância do processo.
- Atividade: o nome da etapa que ocorreu.
- Registro de data e hora: quando a etapa ocorreu, definindo a ordem dos eventos.
Colunas opcionais acrescentam contexto: o recurso, como uma pessoa ou um time, o departamento, o custo ou qualquer atributo personalizado pelo qual você queira segmentar o processo. O conjunto completo de requisitos está listado em Formatos de dados compatíveis.
11. Valide o conjunto de dados
Antes de confiar nos resultados, verifique se o conjunto de dados representa o processo que você imagina.
- Verifique alguns casos: percorra algumas instâncias do processo de ponta a ponta e confirme se as sequências de eventos fazem sentido.
- Execute uma análise de teste: faça a mineração do processo uma vez e procure problemas óbvios, como atividades que nunca acontecem, um evento de início ou fim incorreto e casos que deveriam ter sido encerrados.
- Confirme com os responsáveis pelo processo: especialistas de negócio conseguem dizer em poucos minutos se os dados refletem como o trabalho realmente acontece.
Limpando dados dentro do ProcessMind
Grande parte da preparação acima pode ser feita dentro do ProcessMind depois do carregamento:
- Mapeie e configure as colunas: defina nomes de exibição, tipos de dados e formatos de timestamp em atributos do conjunto de dados, em vez de retrabalhar o arquivo de origem.
- Verifique a qualidade: o Dashboard de Qualidade dos dados sinaliza valores ausentes e inconsistências para que você possa corrigi-los antes da análise, e as Recomendações de dados da IA sugerem mapeamentos e correções.
- Oculte ou filtre dados irrelevantes: oculte colunas em atributos do conjunto de dados e use filtros para excluir eventos desnecessários.
- Recarregue em vez de carregar novamente: substitua os dados no mesmo local ou use carregamentos incrementais (delta) para conjuntos de dados que crescem continuamente.
Para limpar dados fora do ProcessMind, ferramentas de uso geral, como Python/Pandas, Excel, Google Sheets, ferramentas de ETL e OpenRefine, funcionam antes do carregamento. Para o guia mais amplo, que inclui nomenclatura, formatos, carregamento incremental e arquivamento, consulte ETL para Process Mining.
Tópicos relacionados
- Onde obter dados - extraia uma linha por etapa dos seus sistemas
- Formatos de dados compatíveis - tipos de arquivo e requisitos de estrutura
- Qualidade dos dados - o que o selo de qualidade verifica
- Solucionando problemas de dados - correções para cada sintoma
- ETL para Process Mining - o guia completo de preparação de dados