Amélioration des processus Lean : un guide fondé sur les données
Découvrez le processus DMAIC, le processus Six Sigma et les outils d'amélioration des processus Lean pour obtenir des résultats métier mesurables.
La performance du Process Mining dépend de trois facteurs : le volume de données que vous chargez, la manière dont vous les structurez et la façon dont le système les traite. Ce guide couvre ces trois aspects à l’aide de benchmarks réels et de méthodes concrètes pour améliorer les résultats.
Nous publions tous nos chiffres. Comparez-les avec ceux de n’importe quel outil de Process Mining du marché.
Principaux enseignements
Lorsque vous chargez des données dans ProcessMind, trois étapes se déroulent. Voici précisément où passe le temps :
Chargement, qui domine le temps total. Votre fichier transite par Internet jusqu’à notre infrastructure cloud. C’est le principal goulot d’étranglement pour les fichiers volumineux. Les contraintes physiques s’imposent : un fichier CSV de 50 millions d’événements, soit 11 Go, nécessite 2 minutes avec une connexion gigabit, 18 minutes à 100 Mbit/s ou plus de 3 heures à 10 Mbit/s. Les mêmes données au format Parquet ne représentent que 1,7 Go, ce qui réduit ces durées à 19 secondes, 3 minutes et 28 minutes. C’est la principale raison d’utiliser des formats en colonnes comme Parquet ou ORC, ou des jeux de données plus petits.
Prétraitement, coût ponctuel d’environ 30 secondes à 2,5 minutes. Une fois le chargement terminé, nous transformons vos données en stockage optimisé en colonnes : les événements sont indexés, les transitions d’activités sont précalculées, les variantes de processus sont identifiées et les statistiques récapitulatives sont calculées. Cette étape prend 30 secondes pour les petits jeux de données et jusqu’à 2,5 minutes pour 100 millions d’événements. Ce coût n’est facturé qu’une fois par chargement, puis vous en bénéficiez pour les analyses suivantes.
Modifications du modèle, recalcul partiel de 6 à 52 secondes. Lorsque vous modifiez le modèle de processus en ajoutant ou supprimant des activités, ou en changeant les correspondances, seuls les calculs dépendant du modèle sont mis à jour. Cette étape prend 6 secondes pour les petits jeux de données et jusqu’à 52 secondes pour 100 millions d’événements, soit bien moins qu’un prétraitement complet. Les modifications des filtres sont instantanées.
Performance des Dashboards : toujours rapide
Les Dashboards sont rapides. Une fois le prétraitement terminé, les interactions avec les Dashboards répondent en moins de 2,5 secondes pour les jeux de données allant jusqu’à 10 millions d’événements. Même avec 50 millions d’événements, la plupart des requêtes aboutissent en 2 à 5 secondes. Seuls les flux de processus sur des jeux de données de plus de 100 millions d’événements approchent 7 secondes. Consultez les temps de réponse détaillés ci-dessous.
Nous avons consacré d’importants efforts au prétraitement afin que l’analyse, à laquelle vous consacrez des heures, paraisse instantanée.
Une fois vos données chargées, plusieurs caractéristiques déterminent la vitesse des requêtes. Les comprendre vous aide à concevoir de meilleurs exports et à définir des attentes réalistes.
Le nombre d’activités compte. Les modèles de processus comportant 10 à 20 activités distinctes sont optimaux. Au-delà de 50 activités, le calcul du flux de processus prend plus de temps et sa compréhension devient plus difficile. Un trop grand nombre de nœuds et d’arêtes crée une surcharge visuelle. Si votre export contient de nombreuses activités, envisagez de regrouper les étapes liées.
La diversité des variantes influe sur le calcul. Un processus dans lequel 80 % des cas suivent 5 variantes s’analyse plus rapidement qu’un processus où chaque cas emprunte un chemin différent. Une forte variation n’est pas un problème en soi et signale souvent des difficultés réelles, mais prévoyez des temps de requête légèrement plus longs.
Plus de colonnes signifie davantage de données à parcourir. Chaque attribut inclus est indexé et interrogé. Les colonnes essentielles, CaseId, Activity et Timestamp, sont toujours nécessaires. Les colonnes supplémentaires facilitent le filtrage et la catégorisation, mais chacune entraîne une surcharge.
Les cas longs prennent plus de temps. Un cas comportant 50 événements nécessite davantage de calculs qu’un cas en comportant 5. Si votre processus comprend des cas couvrant des centaines d’événements, les requêtes seront proportionnellement plus lentes. Cette caractéristique est inhérente au Process Mining et ne dépend pas d’un outil particulier.
Savoir à quoi vous attendre vous aide à planifier. Ces benchmarks sont exécutés sur une infrastructure AWS de production, avec la latence réelle du réseau, puis calculés comme moyennes de plusieurs tests. Nous avons testé plus de 50 types de requêtes pour chaque taille de jeu de données.
Le tableau ci-dessous présente des estimations réalistes pour chaque taille de jeu de données. Pour les fichiers volumineux, surtout avec des connexions lentes, le chargement domine. Il s’agit du principal facteur de votre temps d’attente total.
| Jeu de données | Événements réels | Taille du fichier | Chargement (1 Gbit/s) | Chargement (100 Mbit/s) | Chargement (50 Mbit/s) | Chargement (10 Mbit/s) | Prétraitement |
|---|---|---|---|---|---|---|---|
| 100K | 125 260 | 22 Mo | < 1 s | 2 s | 4 s | 22 s | 35 s |
| 500K | 626 300 | 110 Mo | 1 s | 11 s | 22 s | 2 min | 45 s |
| 1M | 1 253 424 | 221 Mo | 3 s | 22 s | 44 s | 4 min | 55 s |
| 2M | 2 506 848 | 443 Mo | 5 s | 44 s | 1,5 min | 7 min | 1 min |
| 5M | 4 996 877 | 1,1 Go | 13 s | 2 min | 4 min | 18 min | 1,5 min |
| 10M | 12 511 867 | 2,2 Go | 25 s | 4 min | 7 min | 37 min | 1,5 min |
| 20M | 25 023 734 | 4,4 Go | 50 s | 7 min | 15 min | 1,2 h | 2 min |
| 50M | 62 559 335 | 11,1 Go | 2 min | 18 min | 37 min | 3 h | 2 min |
| 100M | 125 118 670 | 22,3 Go | 4 min | 37 min | 1,2 h | 6 h | 2,5 min |
Les tailles de fichiers correspondent à des fichiers CSV non compressés utilisant un schéma d’Event Log courant, avec CaseId, Activity, Timestamp et 5 à 8 attributs métier. Vos fichiers peuvent être plus ou moins volumineux selon le nombre de colonnes et leur contenu.
Les durées de chargement à 1 Gbit/s sont mesurées avec un débit effectif de 88 Mo/s vers AWS eu-central-1. Les autres vitesses sont extrapolées à partir de débits pratiques : 50 Mbit/s → environ 5 Mo/s, 100 Mbit/s → environ 10 Mo/s, 10 Mbit/s → environ 1 Mo/s. Le débit réel dépend de votre réseau, de la distance jusqu’au centre de données et de la charge du moment.
À retenir : le temps de prétraitement se stabilise entre 1 et 2,5 minutes, quelle que soit l’échelle. Le temps de chargement augmente linéairement avec la taille du fichier. Réduire la taille du fichier est l’optimisation la plus efficace à votre disposition.
Le format du fichier que vous chargez a une incidence majeure sur la vitesse de chargement et le temps de prétraitement. ProcessMind prend en charge CSV, Parquet, ORC, Excel et XES. Pour les jeux de données volumineux, Parquet et ORC sont nettement plus performants que CSV, tant en taille de fichier qu’en vitesse de traitement.
| Jeu de données | CSV | Parquet | ORC | CSV.GZ |
|---|---|---|---|---|
| 1M événements | 221 Mo | 34 Mo | 39 Mo | 20 Mo |
| 5M événements | 1,1 Go | 151 Mo | 197 Mo | 107 Mo |
| 10M événements | 2,2 Go | 301 Mo | 395 Mo | 215 Mo |
| 20M événements | 4,4 Go | 603 Mo | 791 Mo | 430 Mo |
| 50M événements | 11,1 Go | 1,7 Go | 1,9 Go | 1,1 Go |
| 100M événements | 22,3 Go | 3,4 Go | 3,7 Go | 2,2 Go |
Les fichiers Parquet sont 85 % plus petits que les fichiers CSV. Les fichiers ORC sont 82 % plus petits. Tous deux sont des formats en colonnes dotés d’une compression intégrée, aucune étape supplémentaire n’est donc nécessaire. Votre outil ETL ou votre plateforme de données, comme Spark, Databricks, dbt ou BigQuery, prend probablement déjà en charge l’export au format Parquet ou ORC.
La taille du fichier ne représente que la moitié du sujet. Après le chargement, vos données passent par une ingestion et un calcul analytique dépendant du format, notamment l’indexation des événements ainsi que le calcul des transitions et des variantes. L’étape analytique domine et prend le même temps pour tous les formats. CSV.GZ est le seul format à ajouter un temps significatif, car les fichiers gzip ne peuvent pas être répartis pour une décompression parallèle.
| Jeu de données | Parquet | ORC | CSV | CSV.GZ |
|---|---|---|---|---|
| 1M événements | 55 s | 55 s | 55 s | 55 s |
| 5M événements | 1,5 min | 1,5 min | 1,5 min | 1,5 min |
| 10M événements | 1,5 min | 1,5 min | 1,5 min | 2 min |
| 20M événements | 2 min | 2 min | 2 min | 2,5 min |
| 50M événements | 2 min | 2 min | 2 min | 3 min |
| 100M événements | 2,5 min | 2,5 min | 2,5 min | 4,5 min |
Le temps de prétraitement est presque identique pour Parquet, ORC et CSV, car le calcul analytique domine, quel que soit le format d’entrée. En revanche, le prétraitement de CSV.GZ se dégrade nettement à grande échelle : il passe d’environ une minute pour 1 million d’événements à plus de 4 minutes pour 100 millions. Les fichiers compressés au format gzip ne peuvent pas être répartis ni traités en parallèle. La décompression ajoute donc une étape de plus en plus longue avant le début de l’analyse.
Si vous tenez compte à la fois du temps de chargement et du prétraitement, le choix du format devient évident :
| 10M événements (100 Mbit/s) | Taille du fichier | Chargement | Prétraitement | Total |
|---|---|---|---|---|
| Parquet | 301 Mo | 30 s | 1,5 min | environ 2 min |
| ORC | 395 Mo | 40 s | 1,5 min | environ 2,2 min |
| CSV | 2,2 Go | 4 min | 1,5 min | environ 5,5 min |
| CSV.GZ | 215 Mo | 21 s | 2 min | environ 2,5 min |
| 50M événements (100 Mbit/s) | Taille du fichier | Chargement | Prétraitement | Total |
|---|---|---|---|---|
| Parquet | 1,7 Go | 3 min | 2 min | environ 5 min |
| ORC | 1,9 Go | 3,2 min | 2 min | environ 5,2 min |
| CSV | 11,1 Go | 18 min | 2 min | environ 20 min |
| CSV.GZ | 1,1 Go | 2 min | 3 min | environ 5 min |
À grande échelle, Parquet et ORC sont clairement les plus performants, car leurs fichiers sont nettement plus petits. Le chargement constitue le principal goulot d’étranglement. Le prétraitement prend à peu près le même temps pour tous les formats, à l’exception de CSV.GZ, qui subit une pénalité de décompression croissante.
Quel format choisir ?
Et gzip ?
Les fichiers CSV.GZ sont 90 % plus petits que les fichiers CSV bruts, ce qui est utile avec les connexions lentes. Toutefois, contrairement à Parquet et ORC, qui intègrent la compression et peuvent être interrogés directement, les fichiers gzip doivent être entièrement décompressés avant leur traitement et gzip ne prend pas en charge la décompression parallèle. À partir de 50 millions d’événements, le prétraitement de CSV.GZ prend 3 à 4,5 minutes, contre environ 2 minutes pour les autres formats. Avec une connexion rapide, charger un fichier Parquet légèrement plus volumineux est presque toujours préférable.
Si votre connexion est très lente, à 10 Mbit/s, et que vous disposez d’un fichier CSV volumineux, gzip peut néanmoins être pertinent : gzip -k data.csvsur Mac/Linux, ou 7-Zip sur Windows.
Une fois le jeu de données de référence chargé, vous n’avez pas besoin de tout recharger lorsque de nouvelles données arrivent. ProcessMind prend en charge le chargement delta, ou chargement incrémentiel, afin que vous puissiez ajouter de nouveaux événements à un jeu de données existant.
Fonctionnement :
L’impact sur les performances est important. Au lieu de recharger votre jeu de données croissant à chaque mise à jour, vous ne chargez que les nouvelles données :
| Scénario | Rechargement complet | Chargement delta | Temps économisé |
|---|---|---|---|
| 10M de base + 500K nouveaux événements (100 Mbit/s) | 4 min de chargement | 5 s de chargement | environ 4 min |
| 20M de base + 2M nouveaux événements (100 Mbit/s) | 7 min de chargement | 44 s de chargement | environ 6 min |
| 50M de base + 5M nouveaux événements (100 Mbit/s) | 18 min de chargement | 2 min de chargement | environ 16 min |
Après un chargement delta, le prétraitement est relancé sur le jeu de données combiné, avec le même coût de 1 à 2,5 minutes. Vous économisez toutefois tout le temps de chargement des données déjà transférées.
Le chargement delta est idéal pour :
Les fichiers delta doivent utiliser le même format et la même structure de colonnes que le chargement initial. Consultez le guide du chargement incrémentiel des données pour plus d’informations.
Pour les jeux de données de plusieurs gigaoctets ou les chargements récurrents, les scripts et les outils en ligne de commande sont plus fiables que les chargements depuis un navigateur. Les navigateurs peuvent interrompre la session, consommer trop de mémoire ou perdre la progression en cas de coupure réseau.
Pourquoi l’API est plus adaptée aux fichiers volumineux :
curl affichent la progression du transfert en temps réel.Exemple avec curl :
# Upload a Parquet file directly using a presigned URL
curl -X PUT "$PRESIGNED_URL" --upload-file data.parquet ProcessMind fournit des URL pré-signées qui autorisent les chargements directs vers le stockage cloud. Aucune information d’authentification supplémentaire n’est nécessaire au-delà de votre clé API. Vous pouvez également copier directement l’URL de chargement pré-signée depuis le menu des paramètres du jeu de données dans l’interface ProcessMind.
Consultez la documentation de l’API pour découvrir des exemples complets en Bash, JavaScript et Python, notamment pour obtenir des URL pré-signées, charger des fichiers delta et traiter des jeux de données volumineux par programmation.
Lorsque vous affinez votre modèle de processus en renommant des activités, en modifiant les correspondances ou en ajoutant des regroupements, seuls les calculs dépendant du modèle doivent être mis à jour. Les données de base restent en place :
| Jeu de données | Prétraitement complet | Modification du modèle | Temps économisé |
|---|---|---|---|
| 1M événements | 55 s | environ 14 s | 75 % |
| 2M événements | 1 min | environ 16 s | 73 % |
| 10M événements | 1,5 min | environ 20 s | 78 % |
| 20M événements | 2 min | environ 23 s | 81 % |
| 50M événements | 2 min | environ 37 s | 69 % |
| 100M événements | 2,5 min | environ 52 s | 65 % |
Les modifications du modèle sont rapides, car l’étape initiale de chargement des données, qui augmente avec la taille du jeu de données, est déjà terminée. Seule l’étape d’agrégation dépendant du modèle est relancée, notamment pour les correspondances d’activités, les transitions et les variantes. Pour les jeux de données allant jusqu’à 20 millions d’événements, les modifications du modèle sont terminées en moins de 25 secondes. Même avec 100 millions d’événements, elles prennent moins d’une minute, soit bien moins qu’un prétraitement complet.
Une fois vos données chargées, voici les temps de réponse observés pendant l’analyse. Les durées ci-dessous correspondent aux médianes de plusieurs exécutions de benchmark. Chaque composant du Dashboard envoie ses requêtes indépendamment et se charge en parallèle :
| Jeu de données | Statistiques | Flux de processus | Variantes | Catégories | Navigateur de données | Animation |
|---|---|---|---|---|---|---|
| 100K | 0,6 s | 1,5 s | 1,1 s | 1,5 s | 1,2 s | 1,4 s |
| 1M | 0,6 s | 1,6 s | 1,4 s | 1,9 s | 1,5 s | 2,0 s |
| 5M | 0,6 s | 2,5 s | 1,8 s | 2,4 s | 1,3 s | 2,1 s |
| 10M | 0,6 s | 3,4 s | 2,2 s | 2,5 s | 1,6 s | 2,4 s |
| 20M | 0,6 s | 3,9 s | 2,7 s | 3,3 s | 1,9 s | 3,6 s |
| 50M | 0,6 s | 5,1 s | 4,2 s | 5,7 s | 1,6 s | 2,7 s |
| 100M | 0,6 s | 7,2 s | 3,5 s | 4,7 s | 1,6 s | 5,0 s |
Tendances à retenir :
À retenir : avec les tailles de jeux de données recommandées, de 1 à 10 millions d’événements, chaque composant du Dashboard répond en moins de 3,5 secondes. Même avec 50 millions d’événements, la plupart des requêtes aboutissent en 2 à 4 secondes lorsque des filtres sont appliqués. Seuls les flux de processus et les vues de catégories non filtrés sur des jeux de données de 50 millions d’événements ou plus atteignent 5 à 6 secondes.
Voici le conseil le plus important de ce guide : ne commencez pas avec votre plus grand jeu de données.
L'approche itérative
Les chiffres parlent d’eux-mêmes :
| Approche | Chargement (100 Mbit/s) | Prétraitement | Attente totale | Vitesse du Dashboard |
|---|---|---|---|---|
| Commencer avec 1M d’événements | 22 s | 55 s | environ 1,5 min | 1 à 2 s |
| Commencer avec 5M d’événements | 2 min | 1,5 min | environ 3,5 min | 1 à 2,5 s |
| Commencer avec 50M d’événements | 18 min | 2 min | environ 20 min | 1 à 6 s |
La plupart des organisations constatent que 1 à 5 millions d’événements suffisent largement pour obtenir des analyses concrètes. Le comportement du processus se stabilise bien avant 10 millions d’événements. Au-delà, vous ajoutez surtout des répétitions de schémas déjà observés.
Si votre fichier Parquet de 1 million d’événements, d’une taille de 34 Mo, se charge en 3 secondes et vous fournit la même cartographie de processus que 50 millions d’événements, pourquoi attendre 18 minutes ?
Les chiffres ci-dessus racontent une histoire claire : avec 1 à 5 millions d’événements, les chargements prennent quelques secondes, le prétraitement moins de 2 minutes et les Dashboards répondent en 1 à 2,5 secondes. Avec 50 millions d’événements, vous attendez 20 minutes pour le chargement à 100 Mbit/s et les Dashboards ralentissent à 3 à 6 secondes. L’expérience est très différente.
La vraie question n’est donc pas « à quelle vitesse l’outil fonctionne-t-il ? », mais « de quelle quantité de données ai-je réellement besoin ? ». La réponse est presque toujours inférieure à ce que vous pensez.
Commencez par analyser un pays, un service ou une ligne de produits.
Il ne s’agit pas de limiter l’analyse, mais de gagner en clarté. Une analyse segmentée produit des résultats plus précis que des moyennes globales.
Pourquoi la segmentation fonctionne :
Exemple : une entreprise européenne de logistique comptant 42 millions d’événements d’expédition répartis dans 8 pays :
Dimensions de segmentation
Géographiques, notamment le pays, la région et le site ; organisationnelles, notamment l’unité opérationnelle et le service ; liées aux produits, notamment la gamme et la catégorie ; temporelles, notamment l’exercice et le trimestre ; liées aux clients, notamment le segment et le canal.
Excluez le parcours standard avant le téléversement. Cette technique peut réduire les jeux de données de 90 à 95 %.
La plupart des processus métier suivent la règle des 80/20. La grande majorité des cas emprunte le parcours standard et aboutit correctement. Si vous recherchez des exceptions, des manquements aux règles de conformité ou des écarts de processus, ces données ne vous sont pas nécessaires.
Exemple : un processus purchase-to-pay comprenant 1,2 million de bons de commande, soit 8,4 M d’événements :
Si vous analysez des problèmes de conformité, exportez uniquement les cas présentant une exception. Vous réduisez ainsi le volume de 92 %, en passant de 8,4 M d’événements (1,9 Go) à 670 000 événements (150 Mo). Sur une connexion à 100 Mbit/s, le temps de téléversement passe de 3 minutes à 15 secondes. En exportant au format Parquet (15 Mo), vous pouvez même téléverser le fichier en moins de 2 secondes.
Comment filtrer avant l’export
Filtrez par statut, par exemple rejeté, annulé ou en exception ; par activités précises, par exemple les cas contenant « Rejection » ou « Manual Override » ; par durée du cas, par exemple les cas plus longs que prévu ; ou par période ou unité opérationnelle.
Chaque colonne exportée mobilise de la bande passante, de l’espace de stockage et du temps de traitement. Sélectionner soigneusement les colonnes constitue l’une des optimisations les plus efficaces à votre disposition.
Ce que vous pouvez exclure :
Exemple : un export SAP de 1,8 M d’événements liés à des bons de commande, comprenant 45 colonnes, a été réduit à 12 colonnes essentielles :
Les colonnes importantes : CaseId, Activity, Timestamp et quelques attributs métier, tels que le statut, le montant, la catégorie et la région. Tout le reste est probablement superflu.
Certaines questions d’analyse nécessitent réellement de grands jeux de données. Le comprendre vous aide à prendre la bonne décision :
Si vous devez traiter plus de 50 M d’événements, préparez votre environnement : utilisez le format Parquet, qui réduit un fichier CSV de 11 Go à 1,7 Go et accélère le prétraitement ; utilisez l’API pour des transferts fiables ; et privilégiez une connexion réseau rapide lorsque cela est possible. Après ce premier chargement, les Dashboards restent rapides.
Les sections précédentes portaient sur le volume de données. L’autre aspect de la réactivité dépend de la manière dont le modèle et les Dashboards sont conçus :
La meilleure façon de comprendre les performances du Process Mining consiste à les évaluer avec vos propres données.
Commencez par un échantillon. Exportez 1 M d’événements issus d’une période récente au format Parquet. Téléversez-les. Créez votre premier modèle. Observez la rapidité avec laquelle vous pouvez itérer.
Appliquez les techniques de ce guide. Utilisez des formats en colonnes. Filtrez les exceptions. Segmentez par région. Supprimez les colonnes inutiles. Chaque optimisation renforce la précédente.
Augmentez progressivement le volume. Une fois votre processus compris avec 1 M d’événements, déterminez si vous en avez besoin de davantage. Généralement, ce n’est pas nécessaire. Lorsque c’est le cas, utilisez le chargement différentiel pour ajouter les données plutôt que de les téléverser à nouveau.
Démarrez l’essai gratuit et vérifiez ces résultats par vous-même. Pour vous aider à dimensionner votre jeu de données ou à optimiser vos exports, contactez-nous. Nous avons aidé des centaines d’organisations à trouver le juste équilibre entre volume de données et vitesse d’analyse.
Découvrez le processus DMAIC, le processus Six Sigma et les outils d'amélioration des processus Lean pour obtenir des résultats métier mesurables.
Comparez le Process Mining de Celonis à ProcessMind pour trouver le logiciel adapté à vos processus, à votre budget et à vos objectifs.
Comparez Fluxicon Disco et ProcessMind selon leurs fonctionnalités, leurs tarifs et leurs cas d'usage afin de choisir la plateforme de Process Mining adaptée à …
Comparez ProcessMind et SAP Signavio pour le Process Mining, la modélisation et la simulation. Choisissez la solution adaptée à votre entreprise.
Obtenez un accès immédiat, sans carte bancaire ni attente. Transformez le fonctionnement de votre organisation en processus clairs et connectés.
Construisez votre architecture des processus, définissez les responsabilités et les contrôles, puis alignez les rôles et les responsabilités à tous les niveaux.
Démarrez l’essai gratuit et créez une Fondation fiable pour gouverner, gérer et améliorer continuellement vos processus.
Nous utilisons des cookies pour améliorer votre expérience, personnaliser le contenu et analyser le trafic. En cliquant sur « Tout accepter », vous consentez à l’utilisation de cookies.