In questa pagina

Risoluzione dei problemi relativi ai dati

Risoluzione dei problemi relativi ai dati

I problemi nei dati si manifestano in modi specifici: casi che si frammentano, eventi nell’ordine errato, passaggi mancanti, numeri apparentemente impossibili. Questa pagina parte dal sintomo per risalire alla causa e dalla causa per arrivare alla soluzione, all’interno di ProcessMind quando è sufficiente modificare un’impostazione e nell’estrazione quando non esistono alternative.

Per il flusso di lavoro completo di preparazione, cioè per capire come devono essere i dati corretti e come ottenerli, consulti Pulizia e preparazione dei dati. Per i controlli che la piattaforma esegue sui Suoi dati, consulti Qualità dei dati.

Primi controlli

Prima di analizzare il file sorgente, controlli ciò che ProcessMind Le mostra già:

  • L’elenco rosso sopra i pannelli. Nella scheda Generale del set di dati, un elenco rosso indica il blocco: ID del caso, Attività o Ora di fine mancanti, attività prive di dati, attributi senza valori oppure una mancata corrispondenza tra un file ricaricato e il tipo di processo con cui è stato caricato. Inizi da qui.
  • Il badge di qualità e il pannello. Il punteggio comprende i valori mancanti, i valori incoerenti e i problemi relativi ai timestamp; il pannello li suddivide in aggiornamento, copertura degli attributi e analisi delle attività.
  • Raccomandazioni sui dati generate dall’AI. Una scansione del set di dati elenca i problemi rilevati e suggerisce mappature e correzioni.
  • Attributi del set di dati. Imposti il nome visualizzato, il tipo di dati e il formato del timestamp, oppure nasconda una colonna, senza dover esportare nuovamente i dati.

La maggior parte dei problemi riguarda tre campi

ID del caso identifica l’istanza del processo, Attività indica il passaggio e Ora di fine lo colloca nella sequenza temporale. Ora di inizio, Utente, Costo e tCO₂e aggiungono contesto. Se associa uno dei campi obbligatori alla colonna errata, tutto ciò che segue risulterà errato.

Sintomi nel grafo del processo

I casi sono suddivisi in più casi

Si osserva: una singola istanza del processo appare come molti casi brevi, ciascuno con uno o due passaggi, perciò il grafo mostra una semplice sequenza orizzontale di attività.

Perché: la colonna associata a ID del caso identifica un elemento più piccolo dell’istanza del processo, ad esempio una riga d’ordine, un numero di fattura o un numero di documento proveniente da un sistema.

Soluzione: associ la colonna che identifica l’intera istanza: l’ordine, il ticket o la richiesta di risarcimento. Se nessuna singola colonna svolge questa funzione, l’unificazione deve avvenire a monte: unisca gli identificativi in SQL o nel Suo processo ETL, in modo che ogni evento della stessa istanza riporti lo stesso ID del caso, quindi carichi nuovamente i dati. Le convenzioni di denominazione per ciascun sistema sono descritte in Dove ottenere i dati.

Gli eventi sono nell’ordine errato

Si osserva: attività che si verificano più tardi compaiono prima di attività precedenti, ad esempio una fattura datata prima dell’ordine.

Perché: le cause più comuni sono tre. Il timestamp è stato interpretato con il formato errato, ad esempio un valore 03/04/2025 letto come 4 marzo anziché 3 aprile. Gli eventi provenienti da sistemi con fusi orari diversi sono stati combinati senza conversione. Oppure la colonna errata è stata associata al campo dell’ora.

Soluzione: controlli il formato negli attributi del set di dati e verifichi che il tipo sia Timestamp anziché testo. Converta ogni origine in un unico fuso orario prima di combinare le esportazioni, ordini ogni caso in base al timestamp e controlli a campione alcuni casi dall’inizio alla fine.

Mancano alcuni passaggi

Si osserva: il grafo salta un passaggio che si verifica sicuramente.

Perché: il passaggio non lascia traccia nei dati, ad esempio in caso di approvazione telefonica o firma cartacea, l’attività non è mai stata mappata oppure un filtro l’ha esclusa dalla visualizzazione.

Soluzione: mantenga visibili i passaggi esistenti ma non registrati contrassegnando l’attività come passaggio data flow through, quindi mappi le altre attività con Mappatura e annullamento della mappatura delle attività. Le attività non mappate vengono visualizzate in trasparenza, con collegamenti tratteggiati. Controlli infine quali filtri sono attivi.

I casi non terminano mai

Si osserva: molti casi si interrompono senza raggiungere un evento di fine.

Perché: l’esportazione si interrompe a una certa data mentre i casi sono ancora in corso, il modello non contiene un evento di fine oppure l’attività di chiusura non è presente nel set di dati.

Soluzione: assegni al modello un evento di fine reale oppure accetti i casi aperti ed escluda questi ultimi dall’analisi temporale: le metriche temporali considerano solo i casi chiusi. Un caso non ancora terminato non rappresenta un errore nei dati.

I conteggi sembrano gonfiati

Si osserva: un’attività viene eseguita con una frequenza sospettosamente elevata oppure il numero di casi è superiore a quello riportato dall’azienda.

Perché: sono presenti righe duplicate, cioè lo stesso evento è stato registrato due volte da un’integrazione o da un’estrazione ripetuta.

Soluzione: elimini i duplicati in base all’ID del caso, all’attività e al timestamp prima del caricamento; il flusso di lavoro di preparazione descrive l’origine abituale delle estrazioni duplicate.

La mappa è sovraccarica

Si osserva: centinaia di attività, per la maggior parte tecniche.

Perché: gli accessi, i tentativi ripetuti e i processi eseguiti in background si trovano nella stessa estrazione dei passaggi di business.

Soluzione: nasconda gli attributi che non analizza, filtri gli eventi che non fanno parte del processo e raggruppi gli eventi di basso livello nell’attività a cui appartengono. Stabilire dove finiscono i dettagli e inizia il rumore spetta agli esperti del processo.

I dati provenienti da più sistemi non sono allineati

Si osserva: il processo presenta lacune nel punto in cui un sistema avrebbe dovuto contribuire.

Perché: i sistemi vengono estratti in momenti diversi, denominano lo stesso passaggio in modo differente oppure un’estrazione è stata completamente omessa.

Soluzione: allinei le finestre di estrazione e il vocabolario delle attività prima di combinare i dati e assegni a ciascun set di dati il relativo ruolo tramite principale e confronto, invece di concatenare file non coerenti.

Sintomi nel set di dati

Il caricamento viene rifiutato

Si osserva: il caricamento termina con un errore oppure il file viene caricato come un’unica colonna.

Perché: il file non rispetta uno dei requisiti della struttura. I casi più comuni sono l’assenza della riga di intestazione, che deve trovarsi nella prima riga, righe vuote tra le voci dei dati, numeri memorizzati come testo e file Excel in cui i dati si trovano nel secondo foglio: viene letto solo il primo foglio.

Soluzione: inserisca l’intestazione nella riga 1, rimuova le righe vuote, verifichi che i numeri siano effettivamente numeri e sposti i dati degli eventi nel primo foglio. I delimitatori e le virgolette nei file CSV, TSV e TXT vengono rilevati automaticamente; pertanto, un risultato costituito da un’unica colonna indica generalmente che il file non può essere interpretato. Lo esporti nuovamente in formato CSV o Parquet.

Le colonne o i tipi sono errati

Si osserva: manca una colonna oppure un timestamp viene trattato come testo.

Perché: il file è cambiato dall’ultimo caricamento oppure il tipo è stato rilevato in modo errato.

Soluzione: imposti manualmente il tipo e il formato dei dati oppure nasconda la colonna. Dopo aver sostituito un file, controlli l’elenco rosso per verificare che non vi sia una mancata corrispondenza tra il nuovo file e il set di dati in cui è stato caricato.

I timestamp non vengono riconosciuti

Si osserva: la colonna dei timestamp è vuota oppure le durate risultano molto più lunghe del previsto.

Perché: il formato è insolito, l’ordine di giorno e mese dipende dalla lingua, la precisione è mista, con secondi e millisecondi nella stessa colonna, oppure le conversioni del fuso orario sono state applicate due volte.

Soluzione: imposti esplicitamente il formato negli attributi del set di dati, separi all’origine le esportazioni con precisione mista e standardizzi i dati su un unico fuso orario prima del caricamento.

I valori sono vuoti

Si osserva: la copertura degli attributi nel pannello della qualità presenta lacune oppure un grafico contiene una categoria null.

Perché: il sistema di origine non acquisisce il valore per ogni caso oppure l’esportazione ha eliminato i campi vuoti.

Soluzione: colmi le lacune all’origine, quando possibile, e utilizzi le funzioni di gestione dei valori null in un attributo calcolato quando un valore vuoto può essere sostituito con un valore predefinito sensato.

I nomi delle attività non coincidono

Si osserva: “Approve Order” e “Order Approval” sono elencate come due attività che indicano la stessa cosa oppure lo stesso passaggio ha nomi diversi a seconda del Paese.

Perché: ogni sistema di origine utilizza un’etichetta propria per indicare lo stesso lavoro.

Soluzione: concordi un unico nome per ogni passaggio, quindi normalizzi i valori nell’estrazione oppure aggiunga un attributo calcolato che associ le varianti a un unico nome e mappi l’attività a partire da quest’ultimo.

Sintomi nei numeri

Le medie sembrano troppo basse

Si osserva: una durata media del caso che l’azienda non considera realistica.

Perché: le metriche temporali considerano solo i casi chiusi, quindi i casi non terminati vengono esclusi; inoltre, quelli conclusi sono spesso i più rapidi, soprattutto in un periodo recente.

Soluzione: confronti dati omogenei. Limiti il periodo ai casi che hanno avuto il tempo necessario per concludersi, legga le definizioni in Metriche temporali prima di trarre conclusioni da una singola media e osservi la distribuzione anziché la media.

Le medie sono influenzate dai valori anomali

Si osserva: medie molto superiori rispetto al caso tipico.

Perché: alcuni casi estremi fanno aumentare la media; talvolta si tratta di eccezioni reali, talvolta di errori nei dati.

Soluzione: analizzi la coda dei casi lenti, confrontando P90 e mediana, anziché la media; verifichi se i casi estremi sono autentici ed escluda solo ciò che è effettivamente errato. Un’eccezione rara ma reale è comunque un’informazione utile. Metriche temporali spiega ogni misura.

Un confronto non mostra alcun risultato

Si osserva: un set di dati di confronto riporta Non presente (0 casi, copertura 0%).

Perché: i filtri attivi o il periodo selezionato non contengono casi per quel set di dati oppure le relative attività non sono mappate nel modello.

Soluzione: estenda il periodo, controlli la mappatura del set di dati di confronto e verifichi quale set di dati è principale.

Quando il problema è la quantità di dati

Alcuni problemi non dipendono da errori nei dati, ma dalla loro scala:

  • Caricamenti lenti: preferisca Parquet o ORC e, per i file Excel, XLSB anziché XLSX; consulti Formati di dati supportati.
  • File in crescita: aggiunga i nuovi periodi con un caricamento incrementale (delta) invece di sostituire l’intero file.
  • Analisi lente: elimini le colonne che nessuno analizza, filtri il percorso standard quando cerca le eccezioni e analizzi un periodo o una regione alla volta; la guida alle prestazioni mostra l’impatto delle dimensioni.
  • Set di dati archiviabili: archivi ciò che non analizza più, così l’area di lavoro contiene i dati su cui interviene effettivamente.

Correggere il problema all’origine

Ogni correzione effettuata all’interno di ProcessMind evita un passaggio aggiuntivo, ma alcuni problemi scompaiono solo a monte: un sistema di origine mancante, fusi orari misti o identificativi che nessuna esportazione riesce a unificare. Questi aspetti devono essere risolti nell’estrazione e, se si ripresentano, nel sistema che la produce. Consulti Dove ottenere i dati per i percorsi specifici di ciascun sistema e ETL per il Process Mining per le pratiche che mantengono affidabile un’estrazione.

Ha ancora bisogno di aiuto?

Se i controlli precedenti non spiegano ciò che osserva, contatti il team di assistenza indicando il nome del set di dati, il caso che sta analizzando, ciò che si aspettava e ciò che vede invece. Uno screenshot del grafo e uno del pannello della qualità consentono generalmente di risolvere il problema più rapidamente rispetto a una descrizione.

Argomenti correlati