Melhoria de processos Lean: um guia orientado por dados
Aprenda sobre o processo DMAIC, o processo Six Sigma e as ferramentas de melhoria de processos Lean para gerar resultados de negócio mensuráveis.
A performance do Process Mining depende de três fatores: quanto de dados você envia, como os estrutura e como o sistema os processa. Este guia aborda os três pontos com benchmarks reais e formas práticas de melhorar os resultados.
Publicamos todos os nossos números. Compare-os com qualquer ferramenta de Process Mining do mercado.
Principais conclusões
Quando você envia dados para o ProcessMind, três coisas acontecem. Veja exatamente onde o tempo é gasto:
Upload (domina o tempo total). Seu arquivo percorre a internet até nossa infraestrutura em nuvem. Esse é o gargalo para arquivos grandes. A física prevalece: um CSV com 50 milhões de eventos (11 GB) leva 2 minutos em uma conexão de 1 Gbps, 18 minutos a 100 Mbps ou mais de 3 horas a 10 Mbps. Os mesmos dados em Parquet ocupam apenas 1,7 GB, reduzindo esses tempos para 19 segundos, 3 minutos e 28 minutos. Esse é o principal motivo para usar formatos colunares, como Parquet ou ORC, ou conjuntos de dados menores.
Pré-processamento (custo único, de ~30 s a 2,5 min). Depois do upload, transformamos seus dados em armazenamento colunar otimizado: eventos indexados, transições de atividades pré-calculadas, variantes de processo identificadas e estatísticas resumidas calculadas. Isso leva 30 segundos para conjuntos de dados pequenos e até 2,5 minutos para 100 milhões de eventos. Você paga esse custo uma vez por upload e se beneficia dele depois.
Alterações no modelo (recálculo parcial, 6–52 s). Quando você modifica o modelo do processo adicionando ou removendo atividades ou alterando mapeamentos, apenas os cálculos dependentes do modelo são atualizados. Isso leva 6 segundos para conjuntos de dados pequenos e até 52 segundos para 100 milhões de eventos, muito mais rápido que o pré-processamento completo. Alterações nos filtros são instantâneas.
Performance do Dashboard: sempre rápida
Dashboards são rápidos. Depois que o pré-processamento termina, as interações com o Dashboard respondem em menos de 2,5 segundos para conjuntos de dados de até 10 milhões de eventos. Mesmo com 50 milhões de eventos, a maioria das consultas retorna em 2–5 segundos. Apenas os fluxos de processo em conjuntos com mais de 100 milhões de eventos se aproximam de 7 segundos. Veja os tempos de resposta detalhados abaixo.
Investimos bastante no pré-processamento para que a análise, na qual você passa horas, pareça instantânea.
Depois que seus dados são carregados, várias características determinam a velocidade das consultas. Entendê-las ajuda você a criar exportações melhores e definir expectativas realistas.
A quantidade de atividades importa. Modelos de processo com 10–20 atividades distintas são ideais. Acima de 50 atividades, o fluxo do processo demora mais para ser calculado e fica mais difícil de entender. Nós e conexões em excesso criam ruído visual. Se sua exportação contiver muitas atividades, considere agrupar etapas relacionadas.
A diversidade de variantes afeta o cálculo. Um processo em que 80% dos casos seguem 5 variantes é mais rápido de analisar do que outro em que cada caso percorre um caminho único. Uma variação elevada não é necessariamente ruim e muitas vezes indica problemas reais, mas espere tempos de consulta um pouco maiores.
Mais colunas significam mais dados para examinar. Cada atributo incluído é indexado e consultado. As colunas principais, CaseId, Activity e Timestamp, são sempre necessárias. Colunas adicionais ajudam na filtragem e na categorização, mas cada uma acrescenta sobrecarga.
Casos longos demoram mais. Um caso com 50 eventos exige mais processamento do que um com 5. Se seu processo tiver casos com centenas de eventos, as consultas serão proporcionalmente mais lentas. Isso é inerente ao Process Mining, não específico de uma ferramenta.
Entender o que esperar ajuda você a se planejar. Esses benchmarks foram executados em uma infraestrutura AWS de produção, com latência de rede real, e calculados como médias de várias execuções de teste. Testamos mais de 50 tipos de consulta por tamanho de conjunto de dados.
A tabela abaixo mostra expectativas realistas para cada tamanho de conjunto de dados. O tempo de upload predomina nos arquivos maiores, especialmente em conexões mais lentas. Ele é o maior fator individual no seu tempo total de espera.
| Conjunto de dados | Eventos reais | Tamanho do arquivo | Upload (1 Gbps) | Upload (100 Mbps) | Upload (50 Mbps) | Upload (10 Mbps) | Pré-processamento |
|---|---|---|---|---|---|---|---|
| 100K | 125.260 | 22 MB | < 1s | 2s | 4s | 22s | 35s |
| 500K | 626.300 | 110 MB | 1s | 11s | 22s | 2 min | 45s |
| 1M | 1.253.424 | 221 MB | 3s | 22s | 44s | 4 min | 55s |
| 2M | 2.506.848 | 443 MB | 5s | 44s | 1,5 min | 7 min | 1 min |
| 5M | 4.996.877 | 1,1 GB | 13s | 2 min | 4 min | 18 min | 1,5 min |
| 10M | 12.511.867 | 2,2 GB | 25s | 4 min | 7 min | 37 min | 1,5 min |
| 20M | 25.023.734 | 4,4 GB | 50s | 7 min | 15 min | 1,2 h | 2 min |
| 50M | 62.559.335 | 11,1 GB | 2 min | 18 min | 37 min | 3 h | 2 min |
| 100M | 125.118.670 | 22,3 GB | 4 min | 37 min | 1,2 h | 6 h | 2,5 min |
Os tamanhos dos arquivos consideram um CSV não compactado com um esquema típico de Event Log (CaseId, Activity, Timestamp e mais 5–8 atributos de negócio). Seus arquivos podem ser maiores ou menores, dependendo da quantidade e do conteúdo das colunas.
Os tempos de upload a 1 Gbps foram medidos com throughput efetivo de 88 MB/s até a AWS eu-central-1. As demais velocidades foram extrapoladas usando throughputs práticos: 50 Mbps → ~5 MB/s, 100 Mbps → ~10 MB/s, 10 Mbps → ~1 MB/s. O throughput real depende da sua rede, da distância até o data center e da carga atual.
O principal insight: o tempo de pré-processamento se mantém entre 1 e 2,5 minutos, independentemente da escala. O tempo de upload cresce linearmente com o tamanho do arquivo. Reduzir o tamanho do arquivo é a otimização de maior impacto que você pode fazer.
O formato do arquivo que você envia tem grande impacto na velocidade do upload e no tempo de pré-processamento. O ProcessMind oferece suporte a CSV, Parquet, ORC, Excel e XES. Para conjuntos de dados grandes, Parquet e ORC superam o CSV com ampla vantagem tanto no tamanho do arquivo quanto na velocidade de processamento.
| Conjunto de dados | CSV | Parquet | ORC | CSV.GZ |
|---|---|---|---|---|
| 1M eventos | 221 MB | 34 MB | 39 MB | 20 MB |
| 5M eventos | 1,1 GB | 151 MB | 197 MB | 107 MB |
| 10M eventos | 2,2 GB | 301 MB | 395 MB | 215 MB |
| 20M eventos | 4,4 GB | 603 MB | 791 MB | 430 MB |
| 50M eventos | 11,1 GB | 1,7 GB | 1,9 GB | 1,1 GB |
| 100M eventos | 22,3 GB | 3,4 GB | 3,7 GB | 2,2 GB |
Os arquivos Parquet são 85% menores que os CSV. Os arquivos ORC são 82% menores. Ambos são formatos colunares com compactação integrada, então nenhuma etapa extra é necessária. Sua ferramenta de ETL ou plataforma de dados, como Spark, Databricks, dbt ou BigQuery, provavelmente já oferece suporte à exportação para Parquet ou ORC.
O tamanho do arquivo é apenas metade da história. Depois do upload, seus dados passam por ingestão e processamento analítico dependentes do formato, incluindo indexação de eventos e cálculos de transições e variantes. A etapa analítica predomina e é igual para todos os formatos. CSV.GZ é o único formato que acrescenta um tempo significativo, porque arquivos gzip não podem ser divididos para descompactação em paralelo.
| Conjunto de dados | Parquet | ORC | CSV | CSV.GZ |
|---|---|---|---|---|
| 1M eventos | 55s | 55s | 55s | 55s |
| 5M eventos | 1,5 min | 1,5 min | 1,5 min | 1,5 min |
| 10M eventos | 1,5 min | 1,5 min | 1,5 min | 2 min |
| 20M eventos | 2 min | 2 min | 2 min | 2,5 min |
| 50M eventos | 2 min | 2 min | 2 min | 3 min |
| 100M eventos | 2,5 min | 2,5 min | 2,5 min | 4,5 min |
O tempo de pré-processamento é praticamente idêntico para Parquet, ORC e CSV porque o processamento analítico predomina independentemente do formato de entrada. Já o pré-processamento de CSV.GZ piora significativamente em escala, passando de cerca de um minuto para 1 milhão de eventos a mais de 4 minutos para 100 milhões. Arquivos compactados com gzip não podem ser divididos e processados em paralelo, então a descompactação acrescenta uma etapa cada vez maior antes do início da análise.
Considere o tempo de upload e o pré-processamento, e a escolha do formato ficará clara:
| 10M eventos (100 Mbps) | Tamanho do arquivo | Upload | Pré-processamento | Total |
|---|---|---|---|---|
| Parquet | 301 MB | 30s | 1,5 min | ~2 min |
| ORC | 395 MB | 40s | 1,5 min | ~2,2 min |
| CSV | 2,2 GB | 4 min | 1,5 min | ~5,5 min |
| CSV.GZ | 215 MB | 21s | 2 min | ~2,5 min |
| 50M eventos (100 Mbps) | Tamanho do arquivo | Upload | Pré-processamento | Total |
|---|---|---|---|---|
| Parquet | 1,7 GB | 3 min | 2 min | ~5 min |
| ORC | 1,9 GB | 3,2 min | 2 min | ~5,2 min |
| CSV | 11,1 GB | 18 min | 2 min | ~20 min |
| CSV.GZ | 1,1 GB | 2 min | 3 min | ~5 min |
Em escala, Parquet e ORC são os vencedores claros porque seus arquivos são muito menores. O tempo de upload é o principal gargalo. O pré-processamento leva praticamente o mesmo tempo em todos os formatos, exceto no CSV.GZ, que sofre uma penalidade de descompactação cada vez maior.
Qual formato você deve usar?
E o Gzip?
Arquivos CSV.GZ são 90% menores que CSV bruto, o que ajuda em conexões lentas. Mas, ao contrário de Parquet e ORC, que têm compactação integrada e podem ser consultados diretamente, os arquivos gzip precisam ser totalmente descompactados antes do processamento, e o gzip não oferece suporte à descompactação em paralelo. Com mais de 50 milhões de eventos, o pré-processamento de CSV.GZ leva de 3 a 4,5 minutos, contra cerca de 2 minutos nos outros formatos. Em uma conexão rápida, fazer o upload de um arquivo Parquet um pouco maior quase sempre é a melhor escolha.
Se você estiver em uma conexão muito lenta, de 10 Mbps, e tiver um CSV grande, o gzip ainda pode fazer sentido: gzip -k data.csvno Mac/Linux, ou 7-Zip no Windows.
Depois que você carrega um conjunto de dados de referência, não precisa fazer um novo upload de tudo quando chegam dados novos. O ProcessMind oferece suporte ao carregamento incremental, ou uploads incrementais, para que você possa acrescentar novos eventos a um conjunto de dados existente.
Como funciona:
O impacto na performance é significativo. Em vez de fazer um novo upload do conjunto de dados completo a cada atualização, você envia apenas o que é novo:
| Cenário | Novo upload completo | Upload incremental | Tempo economizado |
|---|---|---|---|
| 10M de base + 500K novos eventos (100 Mbps) | 4 min de upload | 5s de upload | ~4 min |
| 20M de base + 2M novos eventos (100 Mbps) | 7 min de upload | 44s de upload | ~6 min |
| 50M de base + 5M novos eventos (100 Mbps) | 18 min de upload | 2 min de upload | ~16 min |
Depois de um upload incremental, o pré-processamento é executado novamente no conjunto de dados combinado, com o mesmo custo de 1–2,5 minutos. Mas você economiza todo o tempo de upload dos dados que já havia enviado.
O carregamento incremental é ideal para:
Os arquivos incrementais devem usar o mesmo formato e a mesma estrutura de colunas do upload original. Consulte o guia de carregamento incremental de dados para saber mais.
Para conjuntos de dados maiores que alguns gigabytes ou para uploads recorrentes, scripts e ferramentas de linha de comando são mais confiáveis do que uploads pelo navegador. Os navegadores podem atingir o tempo limite, consumir memória em excesso ou perder o progresso quando a rede é interrompida.
Por que a API funciona melhor para arquivos grandes:
curl mostram o progresso da transferência em tempo real.Exemplo usando curl:
# Upload a Parquet file directly using a presigned URL
curl -X PUT "$PRESIGNED_URL" --upload-file data.parquet O ProcessMind fornece URLs pré-assinadas que autorizam uploads diretos para o armazenamento em nuvem. Nenhuma credencial além da sua chave de API é necessária. Você também pode copiar a URL de upload pré-assinada diretamente no menu de configurações do conjunto de dados na interface do ProcessMind.
Consulte a documentação da API para ver exemplos completos em Bash, JavaScript e Python, incluindo como obter URLs pré-assinadas, carregar arquivos delta e lidar programaticamente com conjuntos de dados grandes.
Quando você aprimora seu modelo de processo renomeando atividades, alterando mapeamentos ou adicionando agrupamentos, apenas os cálculos dependentes do modelo precisam ser atualizados. Os dados-base permanecem no lugar:
| Conjunto de dados | Pré-processamento completo | Alteração no modelo | Tempo economizado |
|---|---|---|---|
| 1M eventos | 55s | ~14s | 75% |
| 2M eventos | 1 min | ~16s | 73% |
| 10M eventos | 1,5 min | ~20s | 78% |
| 20M eventos | 2 min | ~23s | 81% |
| 50M eventos | 2 min | ~37s | 69% |
| 100M eventos | 2,5 min | ~52s | 65% |
As alterações no modelo são rápidas porque a etapa inicial de carregamento dos dados, que cresce com o tamanho do conjunto, já foi concluída. Apenas a etapa de agregação dependente do modelo, incluindo mapeamentos de atividades, transições e variantes, é executada novamente. Para conjuntos de até 20 milhões de eventos, as alterações no modelo terminam em menos de 25 segundos. Mesmo com 100 milhões de eventos, elas levam menos de um minuto, muito mais rápido que o pré-processamento completo.
Depois que seus dados são carregados, estes são os tempos de resposta que você experimenta durante a análise. Os tempos abaixo são medianas de várias execuções de benchmark. Cada componente do Dashboard faz consultas de forma independente e é carregado em paralelo:
| Conjunto de dados | Estatísticas | Fluxo do processo | Variantes | Categorias | Navegador de dados | Animação |
|---|---|---|---|---|---|---|
| 100K | 0,6s | 1,5s | 1,1s | 1,5s | 1,2s | 1,4s |
| 1M | 0,6s | 1,6s | 1,4s | 1,9s | 1,5s | 2,0s |
| 5M | 0,6s | 2,5s | 1,8s | 2,4s | 1,3s | 2,1s |
| 10M | 0,6s | 3,4s | 2,2s | 2,5s | 1,6s | 2,4s |
| 20M | 0,6s | 3,9s | 2,7s | 3,3s | 1,9s | 3,6s |
| 50M | 0,6s | 5,1s | 4,2s | 5,7s | 1,6s | 2,7s |
| 100M | 0,6s | 7,2s | 3,5s | 4,7s | 1,6s | 5,0s |
Padrões para observar:
A conclusão: nos tamanhos recomendados de 1–10 milhões de eventos, todos os componentes do Dashboard respondem em menos de 3,5 segundos. Mesmo com 50 milhões, a maioria das consultas retorna em 2–4 segundos com filtros aplicados. Apenas os fluxos de processo e as visualizações de categorias sem filtros, em conjuntos com mais de 50 milhões de eventos, chegam a 5–6 segundos.
Este é o conselho mais importante deste guia: não comece com seu maior conjunto de dados.
A abordagem iterativa
Os números falam por si:
| Abordagem | Upload (100 Mbps) | Pré-processamento | Espera total | Velocidade do Dashboard |
|---|---|---|---|---|
| Começar com 1M de eventos | 22s | 55s | ~1,5 min | 1–2s |
| Começar com 5M de eventos | 2 min | 1,5 min | ~3,5 min | 1–2,5s |
| Começar com 50M de eventos | 18 min | 2 min | ~20 min | 1–6s |
A maioria das organizações considera que 1–5 milhões de eventos são mais do que suficientes para gerar insights acionáveis. O comportamento do processo se estabiliza bem antes de 10 milhões de eventos. Depois disso, você está principalmente adicionando duplicatas de padrões que já viu.
Se o seu arquivo Parquet com 1 milhão de eventos, de 34 MB, é carregado em 3 segundos e oferece o mesmo mapa de processo que 50 milhões de eventos, por que esperar 18 minutos?
Os números acima contam uma história clara: com 1–5 milhões de eventos, os uploads levam segundos, o pré-processamento leva menos de 2 minutos e os Dashboards respondem em 1–2,5 segundos. Com 50 milhões, você espera 20 minutos por um upload a 100 Mbps, e os Dashboards ficam mais lentos, respondendo em 3–6 segundos. A experiência é muito diferente.
Então, a pergunta real não é “qual é a velocidade da ferramenta?”. É “de quantos dados eu realmente preciso?”. A resposta quase sempre é: menos do que você imagina.
Analise primeiro um país, um departamento ou uma linha de produtos.
Isso não é uma limitação. É uma questão de clareza. A análise segmentada produz insights mais precisos do que médias globais.
Por que a segmentação funciona:
Exemplo: uma empresa europeia de logística com 42 milhões de eventos de remessas em 8 países:
Dimensões de segmentação
Geográfica, incluindo país, região e unidade; organizacional, incluindo unidade de negócio e departamento; de produto, incluindo linha de produtos e categoria; temporal, incluindo ano fiscal e trimestre; de cliente, incluindo segmento e canal.
Exclua o caminho feliz antes de fazer o upload. Essa técnica pode reduzir os conjuntos de dados em 90–95%.
A maioria dos processos de negócio segue a regra 80/20. A grande maioria dos casos percorre o caminho padrão e bem-sucedido. Se você está procurando exceções, violações de conformidade ou desvios de processo, não precisa desses dados.
Exemplo: um processo de compras a pagamentos com 1,2 milhão de pedidos de compra (8,4 milhões de eventos):
Se você está analisando problemas de conformidade, exporte apenas os casos de exceção. Isso representa uma redução de 92%, de 8,4 milhões de eventos (1,9 GB) para 670 mil eventos (150 MB). O tempo de upload cai de 3 minutos para 15 segundos a 100 Mbps. Exporte em Parquet (15 MB) e você poderá fazer o upload em menos de 2 segundos.
Como filtrar antes da exportação
Filtre por status, como rejeitado, cancelado ou exceção; por atividades específicas, como casos que contêm “Rejeição” ou “Substituição manual”; pela duração do caso, como casos que levam mais tempo do que o esperado; ou por períodos específicos ou unidades de negócio.
Cada coluna exportada consome largura de banda, armazenamento e tempo de processamento. Escolher as colunas com cuidado é uma das otimizações de maior impacto que você pode fazer.
O que deixar de fora:
Exemplo: uma exportação do SAP com 1,8 milhão de eventos de pedidos de compra e 45 colunas foi reduzida a 12 colunas essenciais:
As colunas que importam: CaseId, Activity, Timestamp e alguns atributos de negócio, como status, valor, categoria e região. Todo o restante provavelmente é ruído.
Algumas perguntas analíticas realmente exigem conjuntos de dados grandes. Entender quando isso acontece ajuda você a tomar a decisão certa:
Se você precisa de mais de 50 milhões de eventos, planeje-se: use o formato Parquet, que reduz um CSV de 11 GB para 1,7 GB e acelera o pré-processamento; use a API para transferências confiáveis; e use uma conexão de rede rápida, se disponível. Depois desse primeiro carregamento, os Dashboards continuam rápidos.
As seções acima tratam do volume de dados. A outra metade da capacidade de resposta vem da forma como o modelo e os Dashboards são construídos:
A melhor maneira de entender a performance do Process Mining é vivenciá-la com seus próprios dados.
Comece com uma amostra. Exporte 1 milhão de eventos de um período recente no formato Parquet. Faça o upload. Crie seu primeiro modelo. Veja como você consegue iterar rapidamente.
Aplique as técnicas deste guia. Use formatos colunares. Filtre as exceções. Segmente por região. Remova colunas desnecessárias. Cada otimização aproveita a anterior.
Escale de forma planejada. Depois de entender seu processo com 1 milhão de eventos, decida se precisa de mais dados. Na maioria dos casos, não precisa. Quando precisar, use o delta loading para adicionar dados em vez de fazer o upload novamente.
Comece um teste grátis e veja esses benchmarks em ação. Para obter ajuda dimensionando seu conjunto de dados ou otimizando suas exportações, fale conosco. Já ajudamos centenas de organizações a encontrar o equilíbrio certo entre volume de dados e velocidade de análise.
Aprenda sobre o processo DMAIC, o processo Six Sigma e as ferramentas de melhoria de processos Lean para gerar resultados de negócio mensuráveis.
Compare o Process Mining do Celonis com a ProcessMind para encontrar o software adequado aos seus processos, orçamento e objetivos.
Compare o Fluxicon Disco e o ProcessMind em recursos, preços e casos de uso para escolher a plataforma de Process Mining certa para sua equipe.
Compare o ProcessMind e o SAP Signavio em Process Mining, modelagem e simulação. Escolha a opção certa para sua empresa.
Tenha acesso imediato, sem cartão de crédito e sem espera. Transforme a forma como sua organização trabalha em designs de processos claros e conectados.
Construa sua arquitetura de processos, defina responsabilidades e controles e alinhe funções e atribuições em todos os níveis.
Comece seu teste grátis e crie uma base confiável para governar, gerenciar e melhorar continuamente seus processos.
Usamos cookies para melhorar sua experiência, personalizar conteúdo e analisar o tráfego. Ao clicar em "Aceitar todos", você consente com o uso de cookies.