ETL-tools voor process mining

ETL voor process mining

Process mining is afhankelijk van data uit meerdere systemen. Daarmee is ETL een belangrijke stap. ETL staat voor Extract, Transform, Load. Eerst haal je data uit bronsystemen. Daarna transformeer je die voor analyse en laad je de data in een datawarehouse of process mining-platform. Zo verzamel, opschoon, orden en bereid je data voor op betrouwbare procesinzichten.

Zo gebruik je ETL effectief voor process mining.

Integrale aanpak

De belangrijkste regel is eenvoudig: begin niet te snel met data-extractie. Dat kost tijd en geld.

Begin met het vaststellen van de projectdoelen en bepaal welke processen je wilt analyseren. Kies één proces en maak een snelle schets met een BPMN-model. Voeg data aan het model toe op basis van je projectdoelen. Start met data die al beschikbaar is, zoals Excel-bestanden, data die eenvoudig te exporteren is of data die al voor andere analyses wordt gebruikt. Breng daarna datagaten in kaart en haal alleen de data op die je nodig hebt om je doelen te bereiken. Verzamel niet alles voor de zekerheid. Overtollige data vertraagt je. De snelheid van je cyclus voor continue verbetering hangt vaak meer af van het verzamelen van data dan van de implementatie.

Begin met eenvoudige uploads van bestanden. Automatiseer het laden van data pas als dat zinvol is, bijvoorbeeld wanneer data vaak verandert en je continu wilt analyseren. In veel gevallen biedt statische analyse meer stabiliteit. Welke aanpak je ook kiest, laat die je niet vertragen. Een paar minuten per kwartaal besteden aan het uploaden van data is beter dan weken investeren in automatisering om er vervolgens achter te komen dat de data onjuist of onvoldoende is voor je businesscase.

Welke data heb je nodig?

Voor process mining heb je drie datapunten nodig: een case-ID, een timestamp en een activiteit. Aanvullende data, zoals kosten, gebruiker, team of CO2-voetafdruk, kan context aan je analyse toevoegen. Je kunt ook extra dimensies opnemen voor grafieken en aanvullende meetwaarden voor metrics.

Process mining-data verzamelen is meestal eenvoudig, omdat de benodigde velden veel voorkomen. Moeilijker is het maken van één dataset met alle benodigde data. Mogelijk heb je flinke transformaties nodig om afzonderlijke bronnen in één bestand samen te voegen en te standaardiseren.

Je hebt niet alles tegelijk nodig. Begin met wat je hebt.

Welk dataformaat heb je nodig?

Hoewel er geavanceerde dataformaten beschikbaar zijn, werken de meeste tools nog steeds met eenvoudige tekstbestanden. Gebruik bestanden met komma’s (CSV) of tabs (TSV/TXT) als scheidingsteken. Vermijd tekstbestanden met een vaste veldbreedte, omdat de meeste tools die niet kunnen verwerken.

Elk bestand begint met een kopregel. Daarna volgen datarijen die overeenkomen met de velden in de kopregel en dezelfde volgorde aanhouden.

Gebruik UTF-8-codering als je niet-Engelse tekens nodig hebt. Zorg dat velden geen scheidingstekens of regeleinden bevatten. Je kunt velden tussen aanhalingstekens zetten, maar vermijd aanhalingstekens binnen velden. Vervang ingesloten aanhalingstekens zo nodig door een ander teken om de verwerking eenvoudiger te maken.

Direct beschikbare data

Maak eerst een lijst van de data waar je eenvoudig bij kunt. Denk aan deze bronnen:

  • Maandelijkse of wekelijkse Excel-rapporten met onbewerkte data. Gebruik Excel om de data zo nodig opnieuw te formatteren.
  • Process mining-data uit andere tools, waarvoor vaak geen extra voorbewerking nodig is.
  • Standaardexports uit systemen zoals HR-, financiële of ITSM-systemen. Exporteer de data in een formaat dat je process mining-tool ondersteunt.
  • Exports uit analysetools die rapporteren over de data die je nodig hebt. Gebruik draaitabellen en exports om het juiste formaat te maken.
  • Datawarehouses met opgeschoonde en gecombineerde data. Gebruik warehouse-tools om de data te selecteren en als CSV te exporteren.

Processystemen

Data staat vaak opgeslagen in systemen zoals SAP, Workday, Salesforce of ServiceNow. Controleer eerst of een eenvoudige export aan je behoeften voldoet. Dat is meestal de snelste manier om waarde te creëren. Is dat niet genoeg, gebruik dan ETL-tools om data te extraheren, te transformeren en in je process mining-tool te laden.

Afhankelijk van je organisatie moet je mogelijk IT, systeemeigenaren of teams voor datawarehousing betrekken. Dat kan het verzamelen van data vertragen, maar sla deze teams niet over. Ze hebben procedures en ervaring die het proces juist kunnen versnellen. Werk met hen in een korte, flexibele cyclus. Begin met direct beschikbare data en vraag niet alles tegelijk op. Dat kan vertraging veroorzaken.

Vraag de data eerst op in tekstformaat. Automatiseer het proces later met de API of ingebouwde ETL-tools van je process mining-tool.

Ingebouwde ETL-tools in process mining-tools

Over het algemeen raden we het gebruik van ingebouwde ETL-tools van process mining-leveranciers af. Ze lijken misschien handig, maar hebben belangrijke beperkingen:

  • Lagere kwaliteit dan gespecialiseerde ETL-tools.
  • Propriëtaire technologie in plaats van industriestandaarden zoals SQL. Daardoor is meer training nodig en zijn er minder experts beschikbaar.
  • Vendor lock-in, waardoor overstappen naar een andere tool moeilijker wordt.
  • Datasilo’s die hergebruik in andere analytics- of AI-projecten beperken.

ETL-tools van derden

Veel ETL-tools van derden kunnen process mining ondersteunen. Hoewel process mining specifieke data vereist, zijn de onderliggende bewerkingen standaard.

Kies bij voorkeur tools op basis van SQL, zodat je ETL-logica kunt hergebruiken en op lange termijn kunt onderhouden. Gebruik tools die al in huis zijn om vertraging of projectblokkades door nieuwe technologie te voorkomen.

Veelgebruikte ETL-tools van derden voor process mining zijn:

  • CData: Uitstekend voor data-extractie en vaak in combinatie met andere tools gebruikt.
  • dbt: Een transformatietool op basis van SQL, met functies voor grote transformaties.
  • BigQuery: Een beheerd datawarehouse van Google, ontworpen voor snelle SQL-query’s op grote datasets.
  • Snowflake: Een cloudplatform voor schaalbare opslag en rekenkracht, gebruikt voor transformatie en analyse.
  • DataBricks: Een uniform analytics-platform dat data-engineering, machine learning en analytics combineert.
  • Talend: Een grafische ETL-tool die verschillende databronnen ondersteunt.
  • Apache Nifi: Een open-source ETL-tool voor het automatiseren van dataflows en het realtime verwerken van data.

Gespecialiseerde ETL-tools voor process mining

Gespecialiseerde ETL-tools voor process mining combineren de voordelen van ETL-tools van derden met functies en templates voor process mining.

Voorbeelden zijn:

  • Evidant: Data Transform Refinery. Richt zich op het op grote schaal extraheren en transformeren van process mining-data.
  • Konekti: Ontworpen om snel nauwkeurige datamodellen voor processen te maken.

Data beheren nadat die is geladen

Extractie is maar de helft van databeheer. De manier waarop je datasets daarna organiseert, bepaalt of de analyse betrouwbaar blijft.

  • Geef datasets een naam die bij de inhoud past. Q1_2025_Sales_Data of Customer_Support_Logs is beter dan export_final_v3. Gebruik kleur om verwante datasets te groeperen en geef een dataset een procesgerichte naam als die een specifieke rol heeft.
  • Kies het juiste formaat voor de taak. CSV of Excel volstaat voor kleine en middelgrote bestanden die je handmatig uploadt. Parquet of ORC loont bij grote datasets en geautomatiseerde pipelines.
  • Bekijk data voordat je analyseert. Controleer de structuur, de kolomtypen en enkele rijen voordat je gaat mappen. Controleer ook of de kolommen aanwezig zijn die process mining nodig heeft: case-ID, activiteit en timestamp, de process mining-velden.
  • Map bewust. Laat auto-mapping de eerste ronde doen en loop daarna de niet-gekoppelde activiteiten langs. Daar zitten vaak de interessante processtappen. Stappen die in werkelijkheid bestaan maar geen spoor in de data achterlaten, kun je markeren als dataflowdoorvoer. Zo blijven ze zichtbaar zonder de cijfers te vertekenen.
  • Breid data uit in plaats van die te vervangen. Gebruik voor terugkerende exports incrementeel laden om nieuwe rijen toe te voegen in plaats van het hele bestand opnieuw te uploaden.
  • Combineer of scheid met een reden. Datasets met dezelfde attributen kun je samenvoegen in één weergave voor simulatie en analyse. Datasets die sterk van elkaar verschillen, kun je beter apart houden, met eigen attributen om te filteren.
  • Houd filters en metrieken beheersbaar. Een filter dat in maart nuttig was, maakt het dashboard in juni onduidelijk. Verwijder filters zodra de vraag die ze beantwoordden niet meer speelt en toon alleen metrieken die iemand echt gebruikt.
  • Beheer toegang en archiveer daarna. Geef toegang tot datasets aan de mensen die die nodig hebben en archiveer verouderde datasets in plaats van ze in het actieve proces te laten staan.

Samenvatting

ETL is niet het doel van een process mining-project, maar vaak wel nodig. Richt je ETL-proces zo in dat je vertraging voorkomt:

  • Gebruik direct beschikbare data.
  • Begin met handmatige uploads en automatiseer wanneer dat passend is.
  • Gebruik bestaande tools, bij voorkeur tools op basis van SQL.

Het belangrijkste is dat je klein begint met de data die je nodig hebt en geleidelijk uitbreidt. Alles vooraf verzamelen kan je project laten ontsporen.

Gerelateerde blogposts

Ontvang waardevolle inzichten over process mining en workflow-optimalisatie in je inbox
Lean procesverbetering: een datagedreven gids

Lean procesverbetering: een datagedreven gids

Leer meer over het DMAIC-proces, Six Sigma en lean procesverbeteringstools voor meetbare bedrijfsresultaten.

Alternatieven voor Celonis: vergelijk process mining-tools

Alternatieven voor Celonis: vergelijk process mining-tools

Vergelijk Celonis voor process mining met ProcessMind en vind software die past bij je processen, budget en doelen.

Fluxicon Disco versus ProcessMind: vergelijking van process mining

Fluxicon Disco versus ProcessMind: vergelijking van process mining

Vergelijk Fluxicon Disco en ProcessMind op functies, prijzen en gebruikssituaties om het juiste process mining-platform voor je team te kiezen.

SAP Signavio versus ProcessMind: vergelijking van process mining

SAP Signavio versus ProcessMind: vergelijking van process mining

Vergelijk ProcessMind en SAP Signavio voor process mining, modellering en simulatie. Kies de oplossing die bij je bedrijf past.

Ontwerp betere processen. Bouw een verbonden architectuur. Houd de controle.

Krijg meteen toegang, zonder creditcard en zonder wachttijd. Zet de manier waarop je organisatie werkt om in heldere, verbonden procesontwerpen.

Bouw je procesarchitectuur, leg eigenaarschap en beheersmaatregelen vast en breng rollen en verantwoordelijkheden op elk niveau op één lijn.

Start je gratis proefperiode en leg één betrouwbare basis voor het beheren, besturen en continu verbeteren van je processen.