Problemen met data oplossen
Problemen met data oplossen
Dataproblemen worden op verschillende manieren zichtbaar: cases die uit elkaar vallen, events in de verkeerde volgorde, ontbrekende stappen en cijfers die niet kunnen kloppen. Op deze pagina ga je van symptoom terug naar oorzaak en van oorzaak naar oplossing, in ProcessMind als een instelling het probleem oplost en in de extractie als dat de enige oplossing is.
Bekijk Data opschonen en voorbereiden voor de volledige voorbereidingsworkflow, van hoe goede data eruitziet tot hoe je die krijgt. Bekijk Datakwaliteit voor de controles die het platform op je data uitvoert.
Eerste controles
Kijk voordat je het bronbestand onderzoekt eerst naar wat ProcessMind al aangeeft:
- De rode lijst boven de panelen. Op het tabblad Algemeen van de dataset staat in een rode lijst wat de blokkade veroorzaakt: de ontbrekende Case-ID, Activiteit of Eindtijd, activiteiten zonder data, attributen zonder waarden of een verschil tussen een opnieuw geüpload bestand en het procestype waarin het is geladen. Begin daar.
- De kwaliteitsbadge en het paneel. De score omvat ontbrekende en inconsistente waarden en problemen met timestamps. Het paneel splitst dit uit in actualiteit, attribuutdekking en activiteitenanalyse.
- AI-datavoorspellingen. Een scan van de dataset toont de gevonden aandachtspunten en stelt mappings en oplossingen voor.
- Datasetattributen. Stel de weergavenaam, het datatype en de timestampindeling in, of verberg een kolom, zonder iets opnieuw te exporteren.
De meeste problemen komen neer op drie velden
Case-ID identificeert de procesinstantie, Activiteit benoemt de stap en Eindtijd plaatst die op de tijdlijn. Starttijd, Gebruiker, Kosten en tCO₂e voegen context toe. Als je een verplicht veld aan de verkeerde kolom koppelt, klopt alles daarna niet meer.
Symptomen in de procesgrafiek
Cases zijn verdeeld over meerdere cases
Je ziet: één procesinstantie verschijnt als veel korte cases met elk één of twee stappen, waardoor de grafiek een platte rij activiteiten wordt.
Waarom: de kolom die als Case-ID is gekoppeld, identificeert iets dat kleiner is dan de procesinstantie, zoals een regelitem, factuurnummer of documentnummer uit één systeem.
Oplossing: koppel de kolom die de volledige instantie identificeert: de order, het ticket of de claim. Als geen enkele kolom dat doet, moet je de gegevens eerder in de keten samenvoegen. Combineer de identificatoren in SQL of je ETL-job, zodat elk event van één instantie dezelfde Case-ID krijgt, en upload de data opnieuw. De naamgevingsconventies per systeem staan in Waar haal je data vandaan.
Events staan in de verkeerde volgorde
Je ziet: activiteiten die later plaatsvinden staan vóór activiteiten die eerder plaatsvinden, bijvoorbeeld een factuur met een datum vóór de order.
Waarom: meestal is een van deze drie dingen aan de hand. De timestamp is met de verkeerde indeling verwerkt, bijvoorbeeld een 03/04/2025 waarde die als 4 maart in plaats van 3 april is gelezen. Events uit systemen met verschillende tijdzones zijn zonder conversie gecombineerd. Of de verkeerde kolom is als tijdveld gekoppeld.
Oplossing: controleer de indeling in datasetattributen en controleer of het type Timestamp is, niet tekst. Zet elke bron vóór het combineren van exports om naar één tijdzone, sorteer elke case op timestamp en controleer enkele cases van begin tot eind.
Stappen ontbreken
Je ziet: de grafiek slaat een stap over waarvan je zeker weet dat die plaatsvindt.
Waarom: de stap laat geen spoor achter in de data, bijvoorbeeld bij een goedkeuring per telefoon of een handtekening op papier, de activiteit is nooit gekoppeld of een filter heeft de stap uit beeld gehaald.
Oplossing: houd bestaande maar niet geregistreerde stappen zichtbaar door de activiteit te markeren als een Dataflowdoorvoer-stap en koppel de rest met Activiteiten koppelen en ontkoppelen. Niet toegewezen activiteiten worden halftransparant weergegeven, met gestippelde verbindingen. Controleer daarna welke filters actief zijn.
Cases eindigen nooit
Je ziet: veel cases stoppen gewoon zonder een eindevent te bereiken.
Waarom: de export stopt op een bepaalde datum terwijl de cases nog lopen, het model heeft geen eindevent of de afsluitende activiteit staat niet in de dataset.
Oplossing: geef het model een echt eindevent of accepteer de open cases en laat ze buiten de tijdanalyse. Tijdmetriek telt alleen gesloten cases. Een case die nog niet klaar is, is geen datafout.
Aantallen lijken te hoog
Je ziet: één activiteit wordt verdacht vaak uitgevoerd of het aantal cases is hoger dan in de bedrijfsrapportages.
Waarom: dubbele rijen, doordat dezelfde gebeurtenis twee keer is geregistreerd door een integratie of een herhaalde extractie.
Oplossing: verwijder dubbele regels op basis van Case-ID, activiteit en timestamp voordat je uploadt. De voorbereidingsworkflow laat zien waar dubbele extracties meestal ontstaan.
De kaart is onoverzichtelijk
Je ziet: honderden activiteiten, waarvan de meeste technisch zijn.
Waarom: logins, retries en achtergrondtaken staan in dezelfde extractie als de processtappen voor de bedrijfsvoering.
Oplossing: verberg attributen die je niet analyseert, filter events uit die geen deel uitmaken van het proces en groepeer activiteiten op laag niveau bij de activiteit waar ze bij horen. Waar de grens ligt tussen detail en ruis, bepalen de procesexperts.
Data uit meerdere systemen sluit niet op elkaar aan
Je ziet: het proces bevat hiaten op plekken waar één systeem data had moeten aanleveren.
Waarom: systemen zijn op verschillende momenten geëxtraheerd, gebruiken verschillende namen voor dezelfde stap of één extractie ontbreekt volledig.
Oplossing: stem de extractieperiodes en de activiteitenbenamingen op elkaar af voordat je data combineert. Geef elke dataset een rol via primair en vergelijking, in plaats van bestanden met verschillende definities samen te voegen.
Symptomen in de dataset
De upload wordt geweigerd
Je ziet: de upload eindigt met een foutmelding of het bestand wordt als één kolom geladen.
Waarom: het bestand voldoet niet aan een van de structuurvereisten. Veelvoorkomende oorzaken zijn een ontbrekende kopregel, die op de eerste regel hoort te staan, lege regels tussen dataregels, getallen die als tekst zijn opgeslagen en Excel-bestanden waarvan de data op het tweede werkblad staat. Alleen het eerste werkblad wordt ingelezen.
Oplossing: zet de kopregel op rij 1, verwijder lege rijen, controleer of getallen als getallen zijn opgeslagen en verplaats de eventdata naar het eerste werkblad. Scheidingstekens en aanhalingstekens in CSV, TSV en TXT worden automatisch herkend. Een resultaat met één kolom betekent meestal dat het bestand niet kan worden geïnterpreteerd. Exporteer het opnieuw als CSV of Parquet.
Kolommen of typen kloppen niet
Je ziet: een kolom ontbreekt of een timestamp wordt als tekst behandeld.
Waarom: het bestand is veranderd sinds de vorige upload of het type is verkeerd herkend.
Oplossing: stel het datatype en de notatie handmatig in of verberg de kolom. Controleer na het vervangen van een bestand de rode lijst op een verschil tussen het nieuwe bestand en de dataset waarin het is geladen.
Timestamps worden niet herkend
Je ziet: de timestampkolom is leeg of de doorlooptijden zijn veel te lang.
Waarom: een ongebruikelijke indeling, een landspecifieke volgorde van dag en maand, een gemengde precisie, zoals seconden en milliseconden in één kolom, of tijdzoneconversies die twee keer zijn toegepast.
Oplossing: stel de notatie expliciet in bij datasetattributen, splits exports met verschillende precisies bij de bron en gebruik vóór het uploaden één tijdzone.
Waarden zijn leeg
Je ziet: Attribuutdekking in het kwaliteitsvenster vertoont hiaten of een grafiek bevat een categorie null.
Waarom: het bronsysteem legt de waarde niet voor elke case vast of de export heeft lege velden verwijderd.
Oplossing: vul de hiaten waar mogelijk aan bij de bron en gebruik nullverwerkingsfuncties in een berekend attribuut als een lege waarde door een passende standaardwaarde kan worden vervangen.
Activiteitennamen verschillen
Je ziet: “Order goedkeuren” en “Ordergoedkeuring” staan als twee activiteiten vermeld, terwijl ze hetzelfde betekenen, of dezelfde stap heeft per land een andere naam.
Waarom: elk bronsysteem gebruikt een eigen naam voor hetzelfde werk.
Oplossing: spreek per stap één naam af. Normaliseer daarna de waarden in de extractie of voeg een berekend attribuut toe dat de varianten naar één naam omzet, en koppel de activiteit vanaf daar.
Symptomen in de cijfers
Gemiddelden lijken te laag
Je ziet: een gemiddelde doorlooptijd van cases die de bedrijfsvoering niet als realistisch herkent.
Waarom: tijdmetriek telt alleen gesloten cases. Onvoltooide cases vallen dus buiten de berekening, en de cases die wel klaar zijn, zijn vaak de snelle cases, vooral in een recente periode.
Oplossing: vergelijk gelijke situaties. Beperk de periode tot cases die tijd hebben gehad om af te ronden, lees de definities in Tijdmetriek voordat je conclusies trekt uit één gemiddelde en bekijk de verdeling in plaats van het gemiddelde.
Gemiddelden worden bepaald door uitschieters
Je ziet: gemiddelden die veel hoger liggen dan de typische case.
Waarom: een handvol extreme cases trekt het gemiddelde omhoog. Soms zijn het echte uitzonderingen, soms zijn het datafouten.
Oplossing: bekijk de staart met trage cases, bijvoorbeeld P90 tegenover de mediaan, in plaats van het gemiddelde. Controleer of extreme cases echt zijn en sluit alleen uit wat daadwerkelijk fout is. Een zeldzame maar echte uitzondering levert inzicht op. Tijdmetriek legt elke meting uit.
Een vergelijking toont niets
Je ziet: een vergelijkingsdataset meldt Niet aanwezig (0 cases, 0% dekking).
Waarom: de actieve filters of de geselecteerde periode bevatten geen cases voor die dataset, of de activiteiten ervan zijn niet aan het model gekoppeld.
Oplossing: verruim de periode, controleer de koppeling van de vergelijkingsdataset en bevestig welke dataset primair is.
Als de hoeveelheid data het probleem is
Sommige problemen zijn geen datafouten, maar ontstaan door de schaal:
- Trage uploads: gebruik bij voorkeur Parquet of ORC en voor Excel-bestanden XLSB in plaats van XLSX. Bekijk Ondersteunde dataformaten.
- Groeiende bestanden: voeg nieuwe periodes toe met een incrementele delta-upload in plaats van het hele bestand te vervangen.
- Trage analyse: verwijder kolommen die niemand analyseert, filter de ideale route weg als je uitzonderingen zoekt en bekijk één periode of regio tegelijk. De prestatiesgids laat zien welke gevolgen de omvang heeft.
- Datasets die kunnen verdwijnen: archiveer data die je niet meer analyseert, zodat de workspace alleen data bevat waarop je daadwerkelijk actie onderneemt.
Oplossen bij de bron
Elke oplossing in ProcessMind bespaart een round-trip, maar sommige problemen verdwijnen alleen eerder in de keten: een ontbrekend bronsysteem, gemengde tijdzones of identificatoren die geen enkele export samenvoegt. Die horen in de extractie en, als ze terugkomen, in het systeem dat de extractie maakt. Bekijk Waar haal je data vandaan voor de routes per systeem en ETL voor process mining voor werkwijzen die een extractie betrouwbaar houden.
Kom je er nog niet uit?
Als de controles hierboven niet verklaren wat je ziet, neem dan contact op met het supportteam. Vermeld de naam van de dataset, de case die je bekijkt, wat je verwachtte en wat je in plaats daarvan ziet. Met een screenshot van de grafiek en een screenshot van het kwaliteitsvenster is het probleem meestal sneller opgelost dan met alleen een beschrijving.
Gerelateerde onderwerpen
- Datakwaliteit - wat de badge controleert en hoe je het paneel leest
- Je dataset configureren - de rode validatielijst en de verplichte velden
- Ondersteunde data-indelingen - kopregels, werkbladen en bestandstypen
- Data opschonen en voorbereiden - de volledige voorbereidingsworkflow
- Incrementeel data laden - groeiende datasets zonder nieuwe uploads
- FAQ - de vragen die het vaakst terugkomen