Je dataset configureren
Stapsgewijze uitleg voor het uploaden, mappen en instellen van je dataset voor een nauwkeurige process mining-analyse in ProcessMind.
Incremental data laden, ook wel delta laden genoemd, maakt het mogelijk om nieuwe rijen toe te voegen aan een bestaande datatabel zonder de oorspronkelijke data te vervangen. Dit is handig wanneer je event log in de loop van de tijd groeit en je process mining-analyse actueel wilt houden zonder de volledige dataset opnieuw te uploaden.
Veelvoorkomende scenario’s zijn:
info
Deltabestanden moeten dezelfde kolomstructuur hebben, met dezelfde kolomnamen en volgorde, als de oorspronkelijke upload. Extra kolommen in het deltabestand worden genegeerd. Ontbrekende kolommen krijgen de waarde null.
.gz), zolang de indeling binnenin overeenkomt met de indeling van de oorspronkelijke upload.info
Bekijk de pagina Ondersteunde data-indelingen voor informatie over alle ondersteunde bestandsindelingen.
Gebruik de ProcessMind API om delta-bestanden programmatisch te uploaden. Bekijk de pagina API Reference: Data voor alle details over de endpoints.
De workflow is:
Haal een vooraf ondertekende upload-URL voor de delta op:
GET /v1/tenant/{tenantId}/datatables/{dataTableId}/uploads/presignedurl
?delta=true&filename=delta.csv&filesize=1024&filelastmodified=1704067200000 Upload het delta-bestand met de vooraf ondertekende URL:
curl -X PUT --upload-file "delta.csv" \
-H "Content-Type: text/csv" \
"{PreSignedUploadUrl}" Nadat de upload is voltooid, verwerkt ProcessMind de delta automatisch en voegt deze samen met de oorspronkelijke data. Je kunt GET /datatables/{dataTableId} pollen totdat hasDataLoaded true is om te controleren wanneer de verwerking klaar is.
Je kunt incrementeel data laden via het tabblad Algemeen van de dataset in de ProcessMind-app:
ProcessMind uploadt het bestand als delta en verwerkt het samen met de bestaande data. Delta-uploads zijn expliciet: ze worden nooit automatisch herkend als onderdeel van een normale upload waarbij data wordt vervangen.
Na een of meer incrementele uploads bevat de uploadgeschiedenis van de datatabel een uploadParts-array waarin elk bestand wordt bijgehouden:
{
"uploadHistory": {
"uploadParts": [
{
"key": "datatable/123/2.csv",
"fileName": "orders-january.csv",
"fileSize": 524288,
"uploadedAt": "2024-01-15T10:00:00Z"
},
{
"key": "datatable/123/3.csv",
"fileName": "orders-february.csv",
"fileSize": 419430,
"uploadedAt": "2024-02-15T10:00:00Z"
}
]
}
} warning
Incrementele uploads voegen data toe. Ze werken bestaande rijen niet bij en vervangen ze niet. Als je data uit een eerdere upload wilt corrigeren, upload je de volledige dataset opnieuw.
ProcessMind dwingt geen strikt schema af tussen uploadonderdelen. Dit betekent:
Zorg voor het beste resultaat dat alle delta-bestanden dezelfde kolomstructuur hebben als de oorspronkelijke upload.
info
Bij CSV- en JSONL-indelingen worden alle waarden intern als tekst gelezen. Daardoor ontstaat er geen fout door afwijkende datatypen. Bij Parquet- en ORC-indelingen blijven de datatypen van kolommen uit het bestandsschema behouden. Als een kolom numerieke data verwacht en je onverenigbare waarden uploadt, kunnen analyses of simulaties verderop onverwachte resultaten opleveren.
We gebruiken cookies om je ervaring te verbeteren, content te personaliseren en verkeer te analyseren. Door op "Alles accepteren" te klikken, geef je toestemming voor ons gebruik van cookies.