Nesta página

Carregamento incremental de dados

Process Intelligence Process Intelligence Disponível com uma licença de Inteligência de processos ou superior. Apenas as licenças deste plano ou de um plano superior podem usar este recurso. Comparar planos Disponível com uma licença de Process Intelligence ou superior

O que é carregamento incremental de dados?

O carregamento incremental de dados, também chamado de carregamento delta, permite anexar novas linhas a uma tabela de dados existente sem substituir os dados originais. Isso é útil quando os dados do seu Event Log crescem com o tempo e você quer manter sua análise de Process Mining atualizada sem recarregar todo o conjunto de dados.

Cenários comuns incluem:

  • Exportações diárias ou semanais de dados: anexe novas transações, pedidos ou casos conforme eles ficam disponíveis.
  • Monitoramento contínuo do processo: mantenha seus Dashboards atualizados adicionando dados recentes regularmente.
  • Event Logs em crescimento: adicione novos eventos de sistemas ERP, ferramentas de CRM ou outras fontes de forma incremental.
Área de upload de dados da tabela do ProcessMind para substituir dados

info

Os arquivos Delta precisam ter a mesma estrutura de colunas (nomes e ordem das colunas) do upload original. As colunas extras no arquivo Delta são ignoradas. Colunas ausentes resultarão em valores nulos.

Requisitos

  • A tabela de dados já deve ter um upload inicial com dados carregados.
  • O arquivo delta deve estar no mesmo formato do upload original:
    • arquivos CSV exigem arquivos delta CSV
    • arquivos Parquet exigem arquivos delta Parquet
    • arquivos ORC exigem arquivos delta ORC
    • arquivos JSONL exigem arquivos delta JSONL
  • arquivos Excel, XLSX, XLS ou XLSB, e arquivos XES não são compatíveis com uploads delta: converta-os primeiro para CSV.
  • Os nomes das colunas no arquivo delta devem corresponder aos do upload original.
  • Os arquivos delta podem ser compactados com gzip (.gz), desde que o formato interno corresponda ao formato do upload original.

info

Para obter informações sobre todos os formatos de arquivo compatíveis, consulte a página Formatos de dados compatíveis.

Carregando dados incrementais

Pela API

Use a API do ProcessMind para carregar arquivos delta de forma programática. Consulte a página Referência da API: Dados para ver os detalhes completos dos endpoints.

O fluxo de trabalho é:

  1. Obtenha uma URL de upload delta pré-assinada:

    GET /v1/tenant/{tenantId}/datatables/{dataTableId}/uploads/presignedurl
        ?delta=true&filename=delta.csv&filesize=1024&filelastmodified=1704067200000
  2. Carregue o arquivo delta usando a URL pré-assinada:

    curl -X PUT --upload-file "delta.csv" \
        -H "Content-Type: text/csv" \
        "{PreSignedUploadUrl}"

Depois que o upload for concluído, o ProcessMind processará automaticamente o delta e o combinará com os dados originais. Você pode consultar GET /datatables/{dataTableId} até que hasDataLoaded seja true para saber quando o processamento terminou.

Pela interface

O carregamento incremental de dados também pode ser iniciado na aba Geral do conjunto de dados no aplicativo ProcessMind:

  1. Alterne o botão Anexar para mudar a área de upload de Substituir dados para Anexar dados.
  2. Solte o novo arquivo na área Anexar dados ou clique nela para procurar e selecionar o arquivo.

O ProcessMind carrega o arquivo como um delta e o processa junto com os dados existentes. Os uploads delta são explícitos: nunca são detectados automaticamente a partir de um upload normal, que substitui os dados.

Visualizando as partes do upload

Depois de um ou mais uploads incrementais, o histórico de uploads da tabela de dados inclui um uploadPartsarray que registra cada arquivo:

{
	"uploadHistory": {
		"uploadParts": [
			{
				"key": "datatable/123/2.csv",
				"fileName": "orders-january.csv",
				"fileSize": 524288,
				"uploadedAt": "2024-01-15T10:00:00Z"
			},
			{
				"key": "datatable/123/3.csv",
				"fileName": "orders-february.csv",
				"fileSize": 419430,
				"uploadedAt": "2024-02-15T10:00:00Z"
			}
		]
	}
}

Boas práticas

  • Use nomes de colunas consistentes em todos os arquivos para evitar problemas de alinhamento dos dados.
  • Faça os uploads em ordem cronológica sempre que possível, para que o histórico de uploads reflita a linha do tempo dos dados.
  • Mantenha os arquivos delta com tamanho razoável: carregue os dados em lotes moderados; um número muito grande de arquivos pequenos pode deixar o processamento mais lento.
  • Monitore a quantidade de linhas depois de cada delta para verificar se os dados foram carregados corretamente.

warning

Os uploads incrementais anexam dados: eles não atualizam nem substituem as linhas existentes. Se você precisar corrigir dados de um upload anterior, carregue novamente todo o conjunto de dados.

Comportamento em caso de incompatibilidade de esquema

O ProcessMind não impõe um esquema estrito entre as partes do upload. Isso significa:

  • Colunas extras nos arquivos delta são ignoradas durante o processamento: somente as colunas existentes no esquema do upload original são usadas.
  • Colunas ausentes resultam em valores nulos ou vazios para esses campos nas linhas delta.
  • Nomes de colunas diferentes são tratados como colunas completamente diferentes: as linhas delta terão valores nulos nas colunas esperadas.

Para obter os melhores resultados, verifique se todos os arquivos delta têm a mesma estrutura de colunas do upload original.

info

Nos formatos CSV e JSONL, todos os valores são lidos internamente como strings, portanto não há erro de incompatibilidade de tipos. Nos formatos Parquet e ORC, os tipos de dados das colunas são preservados pelo esquema do arquivo. Em todos os casos, se uma coluna espera dados numéricos e você carrega valores incompatíveis, a análise ou as simulações posteriores podem produzir resultados inesperados.