Nesta página

Formatos de dados compatíveis para registros de eventos

Process Intelligence Process Intelligence Disponível com uma licença de Inteligência de processos ou superior. Apenas as licenças deste plano ou de um plano superior podem usar este recurso. Comparar planos Disponível com uma licença de Process Intelligence ou superior

Compatibilidade de arquivos para carregamento de dados

O ProcessMind é compatível com vários formatos de arquivo para carregar registros de eventos. Todos podem ser carregados tanto pela interface do aplicativo quanto pela API.

Formatos baseados em texto

  • .csv: valores separados por vírgula. É um formato comum e leve; a maioria dos sistemas, como Excel e ERP, consegue exportá-lo. Os delimitadores são detectados automaticamente.
  • .tsv: valores separados por tabulação. É semelhante ao CSV, mas usa tabulações em vez de vírgulas, o que ajuda quando os dados contêm vírgulas.
  • .txt: arquivos de texto simples. Podem ser usados quando estão estruturados em um formato consistente e delimitado.
  • .xes: formato padrão de registros de eventos usado por ferramentas de Process Mining. É ideal para acompanhar atividades detalhadamente, com timestamps e IDs de caso.

Formatos do Excel

  • .xls: formato de planilha do Excel (versão antiga). É compatível, mas pode carregar mais lentamente do que os formatos mais recentes.
  • .xlsx: formato moderno do Excel. É amplamente usado e totalmente compatível, sendo frequentemente preferido para dados estruturados.
  • .xlsb: pasta de trabalho binária do Excel. Carrega mais rapidamente e lida melhor com conjuntos de dados grandes do que o .xlsx, mas não é tão compatível com diferentes sistemas.

Formatos de dados binários/colunares

  • .parquet: formato Apache Parquet. Formato de armazenamento colunar otimizado para cargas de trabalho analíticas. Excelente para grandes conjuntos de dados, significativamente mais rápido que CSV para big data. Compatível com uploads incrementais (delta).
  • .orc: formato Optimized Row Columnar (ORC). Outro formato colunar eficiente, comum nos ecossistemas Hadoop/Spark. Compatível com uploads incrementais (delta).
  • .jsonl / .ndjson: formato JSON Lines. Cada linha é um objeto JSON separado. Ideal para exportações de dados em streaming de APIs e sistemas de registro. Compatível com uploads incrementais (delta).

Arquivos compactados

  • .gz: arquivos compactados com Gzip. Qualquer um dos formatos acima pode ser compactado com Gzip, por exemplo, data.csv.gz e data.parquet.gz. O ProcessMind detecta automaticamente o formato interno e descompacta o arquivo quando necessário. A compactação Gzip pode reduzir o tempo de carregamento de arquivos grandes.

Dica de performance: use o formato Parquet para grandes conjuntos de dados

Para conjuntos de dados com milhões de linhas, considere usar o formato Parquet. Os arquivos Parquet são colunares, compactados e incluem informações de esquema incorporadas. Isso significa uploads mais rápidos, consultas mais rápidas e detecção automática de colunas, sem precisar interpretar uma linha de cabeçalho. O Parquet também é compatível com uploads incrementais (delta) para conjuntos de dados que crescem continuamente.

Requisitos gerais da estrutura do arquivo

Para realizar o Process Mining com sucesso no ProcessMind, os arquivos carregados, sejam do Excel, baseados em texto ou em XML, precisam seguir diretrizes estruturais específicas. Assim, o aplicativo consegue interpretar os dados corretamente e realizar uma análise precisa.

1. Linha de cabeçalho (Excel ou arquivos baseados em texto)

  • O arquivo precisa começar com uma linha de cabeçalho, localizada na primeira linha, por exemplo, na célula A1 em arquivos do Excel ou na linha 1 em arquivos CSV, TSV ou TXT. O cabeçalho define os nomes das colunas e deve indicar claramente o tipo de dado de cada coluna, por exemplo, “ID do caso,” “Atividade,” “Timestamp”.
  • Nos formatos CSV, TSV e TXT, os delimitadores e as aspas serão detectados automaticamente, facilitando o carregamento dos dados sem precisar especificar essas configurações manualmente.
  • Nos formatos Parquet e ORC, os nomes e tipos de dados das colunas são lidos diretamente do esquema incorporado ao arquivo: não é necessária uma linha de cabeçalho.
  • Nos formatos JSONL/NDJSON, os nomes das colunas são derivados das chaves JSON na primeira linha do arquivo.

2. Conjunto mínimo de atributos

Para dar suporte à estrutura de um Event Log de Process Mining, o arquivo precisa conter, no mínimo, os seguintes atributos (colunas). Eles não precisam ter exatamente os nomes Case ID, Activity etc., mas devem conter o conteúdo especificado.

  • ID do caso: esta coluna identifica exclusivamente cada instância de processo, ou caso. Todas as linhas correspondentes à mesma instância de processo precisam ter o mesmo ID do caso.
  • Atividade: esta coluna deve descrever a atividade ou o evento específico que está sendo registrado, por exemplo, “Pedido criado,” “Pagamento processado.”
  • Registro de data e hora: cada atividade precisa estar associada a um registro de data e hora que indique a data ou o horário exato em que o evento ocorreu.
  • Observação: o formato do registro de data e hora será detectado automaticamente sempre que possível. Formatos comuns, como yyyy-MM-dd HH:mm:ss, MM/dd/yyyy e outros, são reconhecidos automaticamente.
  • Atributos opcionais: você pode incluir colunas adicionais para melhorar sua análise, como:
  • Recurso: identifica quem realizou a atividade, por exemplo, um usuário ou departamento.
  • Custo: quaisquer custos associados à atividade.
  • Outros dados personalizados: você pode incluir campos personalizados relevantes para o seu processo específico, desde que as colunas obrigatórias estejam presentes.

As colunas exatas dependem do processo que você está analisando. Nossos guias de melhoria de processos descrevem o esquema necessário para cada processo: os campos obrigatórios, as atividades que devem ser capturadas e um Template de dados que você pode preencher.

3. Formatação dos dados

  • Verifique se os dados estão formatados de maneira consistente em todas as colunas:
  • Os timestamps devem estar em um formato padrão e reconhecível, por exemplo, yyyy-MM-dd HH:mm:ss, embora o ProcessMind tente detectar automaticamente o formato da data se ele for diferente.
  • Evite linhas em branco entre as entradas de dados, pois isso pode interromper o processo de importação.
  • Verifique se os dados numéricos, como custos e durações, estão formatados como números no Excel ou corretamente formatados em arquivos baseados em texto, como CSV, TSV e TXT.
  • Nos formatos CSV, TSV e TXT, o ProcessMind vai detectar automaticamente os delimitadores, como vírgulas, tabulações e ponto e vírgula, e tratar o texto entre aspas automaticamente.

4. Seleção de planilha (somente para arquivos do Excel)

  • O ProcessMind processa automaticamente os dados da primeira planilha do seu arquivo do Excel, XLS, XLSX ou XLSB, independentemente do nome dela. Coloque os dados obrigatórios do Event Log na primeira planilha, pois as planilhas adicionais não serão consideradas durante a importação.

5. Formato XES

O formato .xes, eXtensible Event Stream, é um tipo de arquivo padrão usado para Event Logs em Process Mining. Ele captura informações detalhadas sobre as instâncias do processo, como IDs de caso, atividades, timestamps e outros atributos relevantes.

Ele é amplamente compatível com ferramentas de Process Mining e ideal para reconstruir com precisão o comportamento de processos reais.

Para consultar as especificações técnicas e todos os detalhes, acesse o site oficial do padrão XES.

6. Formatos Parquet, ORC e JSONL

Parquet e ORC são formatos binários colunares amplamente usados em pipelines de engenharia de dados, como Apache Spark, AWS Glue e Databricks. Eles incluem informações de esquema incorporadas, por isso o ProcessMind detecta automaticamente os nomes e tipos de dados das colunas, sem configuração manual.

Os arquivos JSONL, JSON Lines, também conhecidos como NDJSON, contêm um objeto JSON por linha. Cada objeto representa um único evento. As chaves JSON se tornam os nomes das colunas. Esse formato é comum na exportação de dados de APIs, sistemas de registro ou plataformas de streaming.

Os três formatos:

7. Dicas

Dica de performance: use o formato XLSB para processar mais rapidamente

Embora todos os formatos compatíveis do Excel possam ser carregados e processados pelo ProcessMind, use o formato XLSB para arquivos do Excel. O formato XLSB armazena o arquivo do Excel em formato binário, oferecendo ganhos significativos de performance, especialmente para grandes conjuntos de dados. Isso resulta em carregamento mais rápido e processamento mais ágil em comparação com os formatos XLS ou XLSX.

Para grandes conjuntos de dados: use Parquet ou ORC

Para conjuntos de dados com milhões de linhas ou pipelines de dados automatizados, use o formato Parquet ou ORC em vez de Excel ou CSV. Esses formatos colunares oferecem a melhor compactação e performance de consulta. Eles são compatíveis com carregamento incremental para conjuntos de dados que crescem continuamente.