Op deze pagina

Incrementeel data laden

Process Intelligence Process Intelligence Beschikbaar met een Process Intelligence-licentieplaats of hoger. Alleen licentieplaatsen in dit abonnement of een hoger abonnement kunnen deze functie gebruiken. Abonnementen vergelijken Beschikbaar met een Process Intelligence-licentieplaats of hoger

Wat is incrementeel data laden?

Incremental data laden, ook wel delta laden genoemd, maakt het mogelijk om nieuwe rijen toe te voegen aan een bestaande datatabel zonder de oorspronkelijke data te vervangen. Dit is handig wanneer je event log in de loop van de tijd groeit en je process mining-analyse actueel wilt houden zonder de volledige dataset opnieuw te uploaden.

Veelvoorkomende scenario’s zijn:

  • Dagelijkse of wekelijkse data-exports: voeg nieuwe transacties, orders of cases toe zodra ze beschikbaar zijn.
  • Continue procesmonitoring: houd je dashboards actueel door regelmatig nieuwe data toe te voegen.
  • Groeiende event logs: voeg stapsgewijs nieuwe events uit ERP-systemen, CRM-tools of andere bronnen toe.
ProcessMind-datasetgedeelte voor uploaden met Replace Data

info

Deltabestanden moeten dezelfde kolomstructuur hebben, met dezelfde kolomnamen en volgorde, als de oorspronkelijke upload. Extra kolommen in het deltabestand worden genegeerd. Ontbrekende kolommen krijgen de waarde null.

Vereisten

  • De datatabel moet al een eerste upload met geladen data hebben.
  • Het delta-bestand moet dezelfde indeling hebben als de oorspronkelijke upload:
    • CSV-bestanden vereisen CSV-delta-bestanden
    • Parquet-bestanden vereisen Parquet-delta-bestanden
    • ORC-bestanden vereisen ORC-delta-bestanden
    • JSONL-bestanden vereisen JSONL-delta-bestanden
  • Excel-bestanden (XLSX/XLS/XLSB) en XES-bestanden worden niet ondersteund voor delta-uploads. Zet ze eerst om naar CSV.
  • De kolomnamen in het delta-bestand moeten overeenkomen met die van de oorspronkelijke upload.
  • Delta-bestanden mogen met gzip zijn gecomprimeerd (.gz), zolang de indeling binnenin overeenkomt met de indeling van de oorspronkelijke upload.

info

Bekijk de pagina Ondersteunde data-indelingen voor informatie over alle ondersteunde bestandsindelingen.

Incrementele data uploaden

Via de API

Gebruik de ProcessMind API om delta-bestanden programmatisch te uploaden. Bekijk de pagina API Reference: Data voor alle details over de endpoints.

De workflow is:

  1. Haal een vooraf ondertekende upload-URL voor de delta op:

    GET /v1/tenant/{tenantId}/datatables/{dataTableId}/uploads/presignedurl
        ?delta=true&filename=delta.csv&filesize=1024&filelastmodified=1704067200000
  2. Upload het delta-bestand met de vooraf ondertekende URL:

    curl -X PUT --upload-file "delta.csv" \
        -H "Content-Type: text/csv" \
        "{PreSignedUploadUrl}"

Nadat de upload is voltooid, verwerkt ProcessMind de delta automatisch en voegt deze samen met de oorspronkelijke data. Je kunt GET /datatables/{dataTableId} pollen totdat hasDataLoaded true is om te controleren wanneer de verwerking klaar is.

Via de gebruikersinterface

Je kunt incrementeel data laden via het tabblad Algemeen van de dataset in de ProcessMind-app:

  1. Schakel de schakelaar Toevoegen om het uploadgedeelte te wijzigen van Data vervangen naar Data toevoegen.
  2. Sleep het nieuwe bestand naar het gedeelte Data toevoegen of klik erop om het bestand te zoeken en te selecteren.

ProcessMind uploadt het bestand als delta en verwerkt het samen met de bestaande data. Delta-uploads zijn expliciet: ze worden nooit automatisch herkend als onderdeel van een normale upload waarbij data wordt vervangen.

Uploadonderdelen bekijken

Na een of meer incrementele uploads bevat de uploadgeschiedenis van de datatabel een uploadParts-array waarin elk bestand wordt bijgehouden:

{
	"uploadHistory": {
		"uploadParts": [
			{
				"key": "datatable/123/2.csv",
				"fileName": "orders-january.csv",
				"fileSize": 524288,
				"uploadedAt": "2024-01-15T10:00:00Z"
			},
			{
				"key": "datatable/123/3.csv",
				"fileName": "orders-february.csv",
				"fileSize": 419430,
				"uploadedAt": "2024-02-15T10:00:00Z"
			}
		]
	}
}

Aanbevolen werkwijzen

  • Gebruik consistente kolomnamen in alle bestanden om problemen met het uitlijnen van data te voorkomen.
  • Upload in chronologische volgorde wanneer dat kan, zodat de uploadgeschiedenis de tijdlijn van de data weerspiegelt.
  • Houd delta-bestanden van een redelijke omvang: upload data in middelgrote batches. Een groot aantal kleine bestanden kan de verwerking vertragen.
  • Controleer het aantal rijen na elke delta om te verifiëren dat de data correct is geladen.

warning

Incrementele uploads voegen data toe. Ze werken bestaande rijen niet bij en vervangen ze niet. Als je data uit een eerdere upload wilt corrigeren, upload je de volledige dataset opnieuw.

Gedrag bij een afwijkende schema-indeling

ProcessMind dwingt geen strikt schema af tussen uploadonderdelen. Dit betekent:

  • Extra kolommen in delta-bestanden worden tijdens de verwerking genegeerd. Alleen kolommen uit het schema van de oorspronkelijke upload worden gebruikt.
  • Ontbrekende kolommen krijgen null- of lege waarden voor die datavelden in de delta-rijen.
  • Andere kolomnamen worden behandeld als volledig andere kolommen. De delta-rijen krijgen null-waarden voor de verwachte kolommen.

Zorg voor het beste resultaat dat alle delta-bestanden dezelfde kolomstructuur hebben als de oorspronkelijke upload.

info

Bij CSV- en JSONL-indelingen worden alle waarden intern als tekst gelezen. Daardoor ontstaat er geen fout door afwijkende datatypen. Bij Parquet- en ORC-indelingen blijven de datatypen van kolommen uit het bestandsschema behouden. Als een kolom numerieke data verwacht en je onverenigbare waarden uploadt, kunnen analyses of simulaties verderop onverwachte resultaten opleveren.