Sur cette page

Formats de données pris en charge pour les journaux d’événements

Process Intelligence Process Intelligence Disponible avec une licence utilisateur Process Intelligence ou supérieure. Seules les licences utilisateur de ce forfait ou d’un forfait supérieur peuvent utiliser cette fonctionnalité. Comparer les forfaits Disponible avec une licence utilisateur Process Intelligence ou une offre supérieure

Prise en charge des fichiers pour l’importation de données

ProcessMind prend en charge de nombreux formats de fichiers pour l’importation de journaux d’événements. Tous peuvent être importés depuis l’interface de l’application ou via l’API.

Formats textuels

  • .csv : valeurs séparées par des virgules. Format courant et léger, exportable par la plupart des systèmes, notamment Excel et les ERP. Les séparateurs sont détectés automatiquement.
  • .tsv : valeurs séparées par des tabulations. Format similaire au CSV, mais utilisant des tabulations au lieu de virgules, ce qui est utile lorsque les données contiennent des virgules.
  • .txt : fichiers texte brut. Ils peuvent être utilisés si les données sont structurées de manière cohérente, avec un séparateur.
  • .xes : format standard des journaux d’événements utilisé par les outils de Process Mining. Il convient particulièrement au suivi détaillé des activités avec horodatages et identifiants de cas.

Formats Excel

  • .xls : format de feuille de calcul Excel, dans une version antérieure. Il est pris en charge, mais peut être plus lent à charger que les formats récents.
  • .xlsx : format Excel moderne. Largement utilisé et entièrement pris en charge, il est souvent privilégié pour les données structurées.
  • .xlsb : classeur binaire Excel. Il se charge plus rapidement et gère mieux les jeux de données volumineux que .xlsx, mais il est moins largement pris en charge.

Formats de données binaires et en colonnes

  • .parquet : format Apache Parquet. Format de stockage en colonnes optimisé pour les charges analytiques. Excellent pour les grands volumes de données, il est nettement plus rapide que le CSV pour le Big Data. Prend en charge les importations incrémentielles (delta).
  • .orc : format Optimized Row Columnar (ORC). Autre format en colonnes performant, courant dans les écosystèmes Hadoop et Spark. Prend en charge les importations incrémentielles (delta).
  • .jsonl / .ndjson : format JSON Lines. Chaque ligne est un objet JSON distinct. Idéal pour exporter des données en continu depuis des API et des systèmes de journalisation. Prend en charge les importations incrémentielles (delta).

Fichiers compressés

  • Les fichiers .gz sont compressés avec Gzip. Tous les formats précédents peuvent être compressés avec Gzip, par exemple data.csv.gz et data.parquet.gz. ProcessMind détecte automatiquement le format interne et décompresse le fichier si nécessaire. La compression Gzip peut réduire le temps d’importation des fichiers volumineux.

Conseil de performance : utilisez le format Parquet pour les grands jeux de données

Pour les jeux de données contenant des millions de lignes, envisagez le format Parquet. Les fichiers Parquet sont organisés en colonnes, compressés et contiennent les informations de schéma intégrées. Les importations et les requêtes sont ainsi plus rapides, et les colonnes sont détectées automatiquement sans analyser une ligne d’en-tête. Parquet prend également en charge les importations incrémentielles (delta) pour les jeux de données qui continuent de croître.

Exigences générales relatives à la structure des fichiers

Pour réussir votre Process Mining dans ProcessMind, les fichiers que vous importez, qu’ils soient au format Excel, texte ou XML, doivent respecter des règles de structure précises. L’application peut ainsi interpréter correctement les données et produire une analyse fiable.

1. Ligne d’en-tête (Excel ou format texte)

  • Le fichier doit commencer par une ligne d’en-tête située sur la première ligne, par exemple cellule A1 pour les fichiers Excel ou ligne 1 pour les fichiers CSV, TSV ou TXT. L’en-tête définit les noms des colonnes et doit indiquer clairement le type de données contenu dans chacune d’elles, par exemple « ID de cas », « Activité » et « Horodatage ».
  • Pour les formats CSV, TSV et TXT, les séparateurs et les guillemets sont détectés automatiquement. Vous pouvez ainsi importer vos données sans configurer manuellement ces paramètres.
  • Pour les formats Parquet et ORC, les noms et les types de données des colonnes sont lus directement dans le schéma intégré au fichier : aucune ligne d’en-tête n’est nécessaire.
  • Pour les formats JSONL/NDJSON, les noms des colonnes sont déduits des clés JSON présentes sur la première ligne du fichier.

2. Ensemble minimal d’attributs

Pour prendre en charge la structure d’un journal d’événements de Process Mining, votre fichier doit contenir au minimum les attributs suivants, sous forme de colonnes. Leurs noms ne doivent pas nécessairement correspondre à ceux indiqués ici, comme Case ID ou Activity, mais leur contenu doit être conforme aux exigences décrites.

  • ID de cas : cette colonne identifie de manière unique chaque instance de processus, ou cas. Toutes les lignes correspondant à la même instance doivent contenir le même ID de cas.
  • Activité : cette colonne décrit l’activité ou l’événement enregistré, par exemple « Commande créée » ou « Paiement traité ».
  • Horodatage : chaque activité doit être associée à un horodatage indiquant la date ou l’heure exacte de l’événement.
  • Note : le format de l’horodatage sera détecté automatiquement dans la mesure du possible. Les formats courants comme yyyy-MM-dd HH:mm:ss, MM/dd/yyyy et d’autres sont reconnus automatiquement.
  • Attributs facultatifs : vous pouvez ajouter des colonnes pour approfondir votre analyse, notamment :
  • Ressource : identifie la personne ou l’entité qui a réalisé l’activité, par exemple un utilisateur ou un service.
  • Coût : coûts associés à l’activité.
  • Autres données personnalisées : vous pouvez ajouter des champs personnalisés pertinents pour votre processus, à condition que les colonnes obligatoires soient présentes.

Les colonnes exactes dépendent du processus que vous analysez. Nos guides d’amélioration des processus décrivent le schéma requis pour chaque processus : champs obligatoires, activités à capturer et modèle de données à compléter.

3. Formatage des données

  • Veillez à appliquer un format cohérent à toutes les colonnes :
  • les horodatages doivent utiliser un format standard et reconnaissable, par exemple yyyy-MM-dd HH:mm:ss, même si ProcessMind tente de détecter automatiquement le format de date utilisé.
  • Évitez les lignes vides entre les entrées, car elles peuvent perturber l’importation.
  • Vérifiez que les données numériques, comme les coûts et les durées, sont enregistrées comme des nombres dans Excel ou correctement formatées dans les fichiers texte, CSV, TSV ou TXT.
  • Pour les formats CSV, TSV et TXT, ProcessMind détecte automatiquement les séparateurs, comme les virgules, les tabulations et les points-virgules, et traite automatiquement les textes entre guillemets.

4. Sélection de la feuille (fichiers Excel uniquement)

  • ProcessMind traite automatiquement les données de la première feuille de votre fichier Excel, qu’il soit au format XLS, XLSX ou XLSB, quel que soit son nom. Placez les données requises du journal d’événements sur cette première feuille, car les feuilles supplémentaires ne sont pas prises en compte lors de l’importation.

5. Format XES

Le format .xes, ou eXtensible Event Stream, est un type de fichier standard utilisé pour les journaux d’événements en Process Mining. Il contient des informations détaillées sur les instances de processus, notamment les Case ID, les activités, les horodatages et d’autres attributs pertinents.

Il est largement pris en charge par les outils de Process Mining et convient particulièrement à la reconstitution précise du comportement réel des processus.

Pour consulter les spécifications techniques et l’ensemble des détails, rendez-vous sur le site officiel de la norme XES.

6. Formats Parquet, ORC et JSONL

Parquet et ORC sont des formats binaires en colonnes largement utilisés dans les pipelines d’ingénierie des données, notamment avec Apache Spark, AWS Glue et Databricks. Ils contiennent les informations de schéma intégrées, ce qui permet à ProcessMind de détecter automatiquement les noms et les types de données des colonnes, sans configuration manuelle.

Les fichiers JSONL, ou JSON Lines, également appelés NDJSON, contiennent un objet JSON par ligne. Chaque objet représente un événement distinct. Les clés JSON deviennent les noms des colonnes. Ce format est courant pour exporter des données depuis des API, des systèmes de journalisation ou des plateformes de diffusion en continu.

Les trois formats permettent de :

  • Prenez en charge l’importation depuis l’interface et l’API ProcessMind
  • Prenez en charge les importations incrémentielles (delta)
  • Les fichiers peuvent être compressés au format gzip (.gz) pour accélérer le transfert

7. Conseils

Conseil de performance : utilisez le format XLSB pour accélérer le traitement

Tous les formats Excel pris en charge peuvent être importés et traités par ProcessMind, mais utilisez le format XLSB pour vos fichiers Excel. Le format XLSB stocke le fichier Excel dans un format binaire, ce qui améliore nettement les performances, en particulier pour les grands jeux de données. Le chargement et le traitement sont ainsi plus rapides qu’avec les formats XLS ou XLSX.

Pour les grands jeux de données : utilisez Parquet ou ORC

Pour les jeux de données contenant des millions de lignes ou pour les pipelines automatisés, utilisez le format Parquet ou ORC plutôt qu’Excel ou CSV. Ces formats en colonnes offrent la meilleure compression et les meilleures performances de requête. Ils prennent en charge le chargement incrémentiel des jeux de données qui continuent de croître.