Op deze pagina

Ondersteunde data-indelingen voor event logs

Process Intelligence Process Intelligence Beschikbaar met een Process Intelligence-licentieplaats of hoger. Alleen licentieplaatsen in dit abonnement of een hoger abonnement kunnen deze functie gebruiken. Abonnementen vergelijken Beschikbaar met een Process Intelligence-licentieplaats of hoger

Ondersteunde bestanden voor data-upload

ProcessMind ondersteunt veel bestandsindelingen voor het uploaden van event logs. Je kunt al deze bestanden uploaden via zowel de appinterface als de API.

Tekstindelingen

  • .csv: kommagescheiden waarden. Een veelgebruikte, lichte indeling die door de meeste systemen, waaronder Excel en ERP-systemen, kan worden geëxporteerd. Scheidingstekens worden automatisch herkend.
  • .tsv: door tabs gescheiden waarden. Vergelijkbaar met CSV, maar met tabs in plaats van komma’s. Handig wanneer data komma’s bevat.
  • .txt: platte tekstbestanden. Te gebruiken wanneer de data een consistente indeling met scheidingstekens heeft.
  • .xes: standaardindeling voor event logs die in process mining-tools wordt gebruikt. Ideaal voor het gedetailleerd vastleggen van activiteiten met timestamps en case-ID’s.

Excel-indelingen

  • .xls: Excel-spreadsheetindeling (oudere versie). Wordt ondersteund, maar kan langzamer laden dan nieuwere indelingen.
  • .xlsx: moderne Excel-indeling. Veelgebruikt en volledig ondersteund, vaak de voorkeurskeuze voor gestructureerde data.
  • .xlsb: Excel Binary Workbook. Laadt sneller en verwerkt grote datasets beter dan .xlsx, maar wordt minder breed ondersteund.

Binaire/kolomindelingen

  • .parquet: Apache Parquet-indeling. Kolomgebaseerde opslag, geoptimaliseerd voor analytische workloads. Uitstekend voor grote datasets en aanzienlijk sneller dan CSV bij big data. Ondersteunt incrementele (delta-)uploads.
  • .orc: Optimized Row Columnar-indeling (ORC). Nog een efficiënte kolomgebaseerde indeling die veel voorkomt in Hadoop- en Spark-omgevingen. Ondersteunt incrementele (delta-)uploads.
  • .jsonl / .ndjson: JSON Lines-indeling. Elke regel is een afzonderlijk JSON-object. Handig voor data-extracties uit API’s en logsystemen. Ondersteunt incrementele (delta-)uploads.

Gecomprimeerde bestanden

  • .gz: Met Gzip gecomprimeerde bestanden. Elk van de bovenstaande indelingen kan met Gzip worden gecomprimeerd, bijvoorbeeld data.csv.gz en data.parquet.gz. ProcessMind detecteert de binnenste indeling automatisch en pakt het bestand uit wanneer dat nodig is. Gzip-compressie kan de uploadtijd van grote bestanden verkorten.

Prestatietip: gebruik Parquet voor grote datasets

Gebruik voor datasets met miljoenen rijen de indeling Parquet. Parquet-bestanden zijn kolomgebaseerd en gecomprimeerd en bevatten ingebouwde schemainformatie. Daardoor zijn uploads en query’s sneller en worden kolommen automatisch herkend zonder de kopregel te hoeven uitlezen. Parquet ondersteunt ook incrementele (delta-)uploads voor datasets die voortdurend groeien.

Algemene vereisten voor de bestandsstructuur

Voor succesvol process mining in ProcessMind moeten geüploade bestanden, of ze nu Excel-, tekst- of XML-indeling hebben, aan specifieke structurele richtlijnen voldoen. Zo kan de app de data correct interpreteren en nauwkeurig analyseren.

1. Kopregel (Excel of tekstgebaseerd)

  • Het bestand moet beginnen met een kopregel op de eerste regel, bijvoorbeeld in cel A1 bij Excel-bestanden of op regel 1 bij CSV-, TSV- of TXT-bestanden. De kopregel bevat de kolomnamen en moet duidelijk aangeven welk type data elke kolom bevat, bijvoorbeeld “Case-ID”, “Activiteit” en “Timestamp”.
  • Bij CSV-, TSV- en TXT-indelingen worden scheidingstekens en aanhalingstekens automatisch gedetecteerd. Zo hoef je deze instellingen niet handmatig op te geven.
  • Bij Parquet- en ORC-bestanden worden kolomnamen en datatypen rechtstreeks uit het ingebedde bestandsschema gelezen. Een kopregel is dan niet nodig.
  • Bij JSONL/NDJSON worden kolomnamen afgeleid van de JSON-sleutels in de eerste regel van het bestand.

2. Minimale set attributen

Om de structuur van een process mining-event log te ondersteunen, moet je bestand minimaal de volgende attributen (kolommen) bevatten. Deze hoeven niet dezelfde namen te hebben als de kolommen (Case-ID, Activiteit enzovoort), maar ze moeten wel de aangegeven inhoud bevatten.

  • Case-ID: deze kolom identificeert elk procesexemplaar, ofwel elke case, uniek. Elke rij die bij hetzelfde procesexemplaar hoort, moet dezelfde Case-ID hebben.
  • Activiteit: deze kolom beschrijft de specifieke activiteit of gebeurtenis die wordt vastgelegd, bijvoorbeeld “Order aangemaakt” of “Betaling verwerkt”.
  • Timestamp: elke activiteit moet een timestamp hebben die het exacte tijdstip of de exacte datum van de gebeurtenis aangeeft.
  • Notitie: de timestamp-indeling wordt zo veel mogelijk automatisch gedetecteerd. Veelgebruikte indelingen zoals yyyy-MM-dd HH:mm:ss, MM/dd/yyyy en andere worden automatisch herkend.
  • Optionele attributen: je kunt extra kolommen toevoegen om je analyse te verbeteren, zoals:
  • Bron: identificeert wie de activiteit heeft uitgevoerd, bijvoorbeeld een gebruiker of afdeling.
  • Kosten: kosten die aan de activiteit zijn verbonden.
  • Andere aangepaste data: je kunt aangepaste velden toevoegen die relevant zijn voor je proces, zolang de vereiste kolommen aanwezig zijn.

De exacte kolommen hangen af van het proces dat je analyseert. Onze gidsen voor procesverbetering beschrijven het schema dat elk proces nodig heeft: de verplichte velden, de activiteiten die je moet vastleggen en een datatemplate dat je kunt invullen.

3. Data-indeling

  • Zorg dat je data in alle kolommen dezelfde indeling heeft:
  • Timestamps moeten een standaardindeling hebben die herkenbaar is, bijvoorbeeld yyyy-MM-dd HH:mm:ss. ProcessMind probeert de datumindeling automatisch te detecteren als die afwijkt.
  • Laat geen lege rijen tussen data-items staan, omdat dit het importproces kan verstoren.
  • Zorg dat numerieke data, zoals kosten en doorlooptijden, in Excel als getallen is opgemaakt en in tekstbestanden, zoals CSV, TSV en TXT, de juiste indeling heeft.
  • Voor CSV-, TSV- en TXT-indelingen detecteert ProcessMind scheidingstekens, zoals komma’s, tabs en puntkomma’s, automatisch en verwerkt het aanhalingstekens automatisch.

4. Werkblad selecteren (alleen voor Excel-bestanden)

  • ProcessMind verwerkt automatisch data uit het eerste werkblad van je Excel-bestand (XLS, XLSX of XLSB), ongeacht de naam ervan. Zet de vereiste event log-data op het eerste werkblad. Extra werkbladen worden tijdens het importeren niet meegenomen.

5. XES-indeling

De indeling .xes (eXtensible Event Stream) is een standaardbestandstype voor event logs in process mining. De indeling bevat gedetailleerde informatie over procesinstanties, zoals case-ID’s, activiteiten, timestamps en andere relevante attributen.

Deze indeling wordt breed ondersteund door process-miningtools en is geschikt voor een nauwkeurige reconstructie van procesgedrag in de praktijk.

Ga voor technische specificaties en alle details naar de officiële website van de XES-standaard.

6. Parquet-, ORC- en JSONL-indelingen

Parquet en ORC zijn kolomgebaseerde binaire indelingen die veel worden gebruikt in data-engineeringpipelines, zoals Apache Spark, AWS Glue en Databricks. Ze bevatten ingebouwde schemainformatie, waardoor ProcessMind kolomnamen en datatypen automatisch detecteert zonder handmatige configuratie.

JSONL-bestanden, ook bekend als JSON Lines of NDJSON, bevatten één JSON-object per regel. Elk object staat voor één gebeurtenis. De JSON-sleutels worden de kolomnamen. Deze indeling komt vaak voor bij data-extracties uit API’s, logsystemen en streamingplatforms.

Alle drie de indelingen:

7. Tips

Prestatietip: gebruik XLSB voor snellere verwerking

Hoewel alle ondersteunde Excel-indelingen door ProcessMind kunnen worden geüpload en verwerkt, kun je voor Excel-bestanden het beste XLSB gebruiken. XLSB slaat je Excel-bestand binair op, wat vooral bij grote datasets duidelijke prestatievoordelen biedt. Daardoor worden bestanden sneller geladen en verwerkt dan met XLS- of XLSX-bestanden.

Voor grote datasets: gebruik Parquet of ORC

Gebruik voor datasets met miljoenen rijen of geautomatiseerde datapipelines Parquet of ORC in plaats van Excel of CSV. Deze kolomgebaseerde indelingen bieden de beste compressie en queryprestaties. Ze ondersteunen incrementeel laden voor datasets die voortdurend groeien.