Process Mining performansı: Karşılaştırmalar ve ipuçları

Process Mining performansını neler belirler

Process Mining performansı üç faktöre bağlıdır: yüklediğiniz veri miktarı, veriyi nasıl yapılandırdığınız ve sistemin veriyi nasıl işlediği. Bu rehber, gerçek karşılaştırmalar ve sonuçları iyileştirmenin pratik yollarıyla bu üç faktörü ele alır.

Tüm rakamlarımızı yayımlıyoruz. Piyasadaki herhangi bir Process Mining aracıyla karşılaştırın.

Temel çıkarımlar

  • Yükleme süresi toplam bekleme süresinin büyük bölümünü oluşturur. En önemli etkenler ağ hızı ve dosya boyutudur
  • CSV yerine Parquet veya ORC kullanın. Dosyalar %85’e kadar daha küçük olabilir ve ön işleme daha hızlı tamamlanır
  • Dashboardlar 10 milyona kadar olay içeren tipik veri setlerinde 1-2,5 saniyede, 50 milyonda ise en fazla 5 saniyede yanıt verir
  • Delta loading, her şeyi yeniden yüklemeden yeni verileri eklemenizi sağlar
  • 1-5 milyon olay genellikle yeterlidir. Daha fazla veri analiz kalitesini nadiren artırır
  • Daha az sütun, daha küçük dosyalar ve daha hızlı işleme anlamına gelir

Veri hattı: Zaman nereye harcanır

ProcessMind’e veri yüklediğinizde üç şey gerçekleşir. Zamanın tam olarak nereye harcandığına bakalım:

Veri hattı

  1. Yükleme, toplam sürenin en büyük bölümünü oluşturur. Dosyanız internet üzerinden bulut altyapımıza aktarılır. Büyük dosyalarda en büyük darboğaz budur. Fizik kuralları geçerlidir: 50 milyon olay içeren 11 GB’lık bir CSV dosyası gigabit bağlantıda 2 dakikada, 100 Mbps bağlantıda 18 dakikada, 10 Mbps bağlantıda ise 3 saati aşan bir sürede yüklenir. Aynı veri Parquet formatında yalnızca 1,7 GB yer kaplar. Böylece bu süreler sırasıyla 19 saniyeye, 3 dakikaya ve 28 dakikaya iner. Parquet veya ORC gibi sütun tabanlı formatları ya da daha küçük veri setlerini kullanmanın başlıca nedeni budur.

  2. Ön işleme, tek seferlik bir maliyettir ve yaklaşık 30 saniye ile 2,5 dakika sürer. Yükleme tamamlandıktan sonra verilerinizi optimize edilmiş sütun tabanlı depolamaya dönüştürürüz: olayları indeksler, etkinlik geçişlerini önceden hesaplar, süreç varyantlarını belirler ve özet istatistikleri çıkarırız. Küçük veri setlerinde bu işlem 30 saniye, 100 milyon olayda ise 2,5 dakikaya kadar sürer. Bu maliyeti her yüklemede bir kez ödersiniz ve sonrasında elde edilen avantajlardan yararlanırsınız.

  3. Model değişiklikleri, kısmi yeniden hesaplama ile 6-52 saniye sürer. Süreç modeline etkinlik eklediğinizde, etkinlik kaldırdığınızda veya haritalamaları değiştirdiğinizde yalnızca modele bağlı hesaplamalar güncellenir. Küçük veri setlerinde bu işlem 6 saniye, 100 milyon olayda ise 52 saniyeye kadar sürer. Bu süre, tam ön işlemeden çok daha kısadır. Filtre değişiklikleri anında uygulanır.

Dashboard performansı: Her zaman hızlı

Dashboardlar hızlı çalışır. Ön işleme tamamlandıktan sonra, 10 milyon olaya kadar olan veri setlerinde Dashboard etkileşimleri 2,5 saniyeden kısa sürede yanıt verir. 50 milyon olayda bile sorguların çoğu 2-5 saniye içinde sonuçlanır. Yalnızca 100 milyon ve üzeri veri setlerindeki süreç akışları 7 saniyeye yaklaşır. Aşağıdaki ayrıntılı yanıt sürelerine göz atın.

  • Her görselleştirme bileşeni bağımsız olarak ve paralel biçimde yüklenir
  • Sonuçlar önbelleğe alınır, bu nedenle bir görünüme yeniden dönmek anında gerçekleşir
  • Filtre değişiklikleri bir saniyeden kısa sürede güncellenir

Saatlerinizi geçirdiğiniz analiz bölümünün anında yanıt vermesi için ön işlemeye büyük yatırım yaptık.

Sorgu performansını anlama

Verileriniz yüklendikten sonra sorgu hızını çeşitli özellikler belirler. Bunları anlamanız, daha iyi dışa aktarımlar tasarlamanıza ve gerçekçi beklentiler oluşturmanıza yardımcı olur.

Etkinlik sayısı önemlidir. 10-20 farklı etkinlik içeren süreç modelleri en iyi sonucu verir. Etkinlik sayısı 50’yi aştığında süreç akışının hesaplanması daha uzun sürer ve akışı anlamak zorlaşır. Çok fazla düğüm ve kenar görsel karmaşa yaratır. Dışa aktarımınız çok sayıda etkinlik içeriyorsa ilgili adımları gruplandırmayı düşünün.

Varyant çeşitliliği hesaplamayı etkiler. Vakaların %80’inin 5 varyantı izlediği bir süreci analiz etmek, her vakanın kendine özgü bir yol izlediği bir süreci analiz etmekten daha hızlıdır. Yüksek çeşitlilik kötü değildir ve çoğu zaman gerçek sorunlara işaret eder. Ancak sorgu sürelerinin biraz uzamasını bekleyin.

Sütun sayısı arttıkça tarama da artar. Eklediğiniz her öznitelik indekslenir ve sorgulanır. Temel sütunlar olan CaseId, Activity ve Timestamp her zaman gereklidir. Ek sütunlar filtreleme ve kategorilendirme için faydalıdır, ancak her biri ek işlem yükü getirir.

Uzun vakaların işlenmesi daha uzun sürer. 50 olay içeren bir vakanın hesaplanması, 5 olay içeren bir vakaya göre daha fazla işlem gerektirir. Süreciniz yüzlerce olaya yayılan vakalar içeriyorsa sorgular orantılı olarak yavaşlar. Bu durum belirli bir araca özgü değildir, Process Mining’in doğal bir sonucudur.

Gerçek dünya kıyaslama verileri, Mart 2026

Neyle karşılaşacağınızı bilmeniz planlama yapmanıza yardımcı olur. Bu kıyaslamalar, gerçek ağ gecikmesinin bulunduğu üretim AWS altyapısında çalıştırılmış ve birden fazla test çalışmasının ortalaması alınmıştır. Her veri seti boyutu için 50’den fazla sorgu türünü test ettik.

Yükleme ve ön işleme süreleri

Aşağıdaki tablo, her veri seti boyutu için gerçekçi beklentileri gösterir. Özellikle yavaş bağlantılarda büyük dosyalar için yükleme süresi toplam süreye hakimdir. Toplam bekleme sürenizi belirleyen en büyük etken budur.

Veri seti Gerçek olay sayısı Dosya boyutu Yükleme (1 Gbps) Yükleme (100 Mbps) Yükleme (50 Mbps) Yükleme (10 Mbps) Ön işleme
100K 125.260 22 MB < 1 sn 2 sn 4 sn 22 sn 35 sn
500K 626.300 110 MB 1 sn 11 sn 22 sn 2 dk 45 sn
1M 1.253.424 221 MB 3 sn 22 sn 44 sn 4 dk 55 sn
2M 2.506.848 443 MB 5 sn 44 sn 1,5 dk 7 dk 1 dk
5M 4.996.877 1,1 GB 13 sn 2 dk 4 dk 18 dk 1,5 dk
10M 12.511.867 2,2 GB 25 sn 4 dk 7 dk 37 dk 1,5 dk
20M 25.023.734 4,4 GB 50 sn 7 dk 15 dk 1,2 saat 2 dk
50M 62.559.335 11,1 GB 2 dk 18 dk 37 dk 3 saat 2 dk
100M 125.118.670 22,3 GB 4 dk 37 dk 1,2 saat 6 saat 2,5 dk

Dosya boyutları, tipik bir olay günlüğü şemasına sahip sıkıştırılmamış CSV için verilmiştir. Bu şema CaseId, Activity, Timestamp ve 5-8 iş özniteliği içerir. Sütun sayısına ve içeriğe bağlı olarak dosyalarınız daha büyük veya daha küçük olabilir.

1 Gbps yükleme süreleri, AWS eu-central-1 için saniyede 88 MB etkin aktarım hızıyla ölçülmüştür. Diğer hızlar pratik aktarım hızlarına göre tahmin edilmiştir: 50 Mbps → yaklaşık 5 MB/sn, 100 Mbps → yaklaşık 10 MB/sn, 10 Mbps → yaklaşık 1 MB/sn. Gerçek aktarım hızı ağınıza, veri merkezine olan uzaklığınıza ve mevcut yüke bağlıdır.

Temel çıkarım şu: Ölçekten bağımsız olarak ön işleme süresi 1 ile 2,5 dakika arasında sabitlenir. Yükleme süresi dosya boyutuyla doğru orantılı olarak artar. Dosya boyutunu küçültmek, yapabileceğiniz en etkili optimizasyondur.

Doğru dosya formatını seçin

Yüklediğiniz dosya biçimi, yükleme hızını ve ön işleme süresini büyük ölçüde etkiler. ProcessMind CSV, Parquet, ORC, Excel ve XES destekler. Büyük veri setlerinde Parquet ve ORC, hem dosya boyutu hem de işleme hızı açısından CSV’den çok daha iyi performans gösterir.

Dosya boyutu karşılaştırması

Veri seti CSV Parquet ORC CSV.GZ
1M olay 221 MB 34 MB 39 MB 20 MB
5M olay 1,1 GB 151 MB 197 MB 107 MB
10M olay 2,2 GB 301 MB 395 MB 215 MB
20M olay 4,4 GB 603 MB 791 MB 430 MB
50M olay 11,1 GB 1,7 GB 1,9 GB 1,1 GB
100M olay 22,3 GB 3,4 GB 3,7 GB 2,2 GB

Parquet dosyaları CSV’den %85 daha küçüktür. ORC dosyaları ise %82 daha küçüktür. Her ikisi de yerleşik sıkıştırmaya sahip sütun tabanlı biçimlerdir, bu nedenle ek bir adım gerekmez. Spark, Databricks, dbt veya BigQuery gibi ETL aracınız ya da veri platformunuz muhtemelen Parquet veya ORCye dışa aktarmayı zaten destekliyordur.

Formata göre ön işleme

Dosya boyutu hikayenin yalnızca yarısıdır. Yüklemeden sonra verileriniz, olay indeksleme ile geçiş ve varyant hesaplamaları dahil olmak üzere formata bağlı veri alımı ve analitik hesaplama aşamalarından geçer. Analitik adımı sürenin büyük bölümünü oluşturur ve tüm formatlarda aynıdır. CSV.GZ, gzip dosyaları paralel açma için bölünemediğinden önemli ölçüde ek süre oluşturan tek formattır.

Veri seti Parquet ORC CSV CSV.GZ
1M olay 55 sn 55 sn 55 sn 55 sn
5M olay 1,5 dk 1,5 dk 1,5 dk 1,5 dk
10M olay 1,5 dk 1,5 dk 1,5 dk 2 dk
20M olay 2 dk 2 dk 2 dk 2,5 dk
50M olay 2 dk 2 dk 2 dk 3 dk
100M olay 2,5 dk 2,5 dk 2,5 dk 4,5 dk

Parquet, ORC ve CSV için ön işleme süresi neredeyse aynıdır, çünkü giriş formatından bağımsız olarak analitik hesaplama sürenin büyük bölümünü oluşturur. Ancak CSV.GZ ön işlemesi ölçek büyüdükçe belirgin biçimde yavaşlar. Süre 1 milyon olayda yaklaşık bir dakikadan 100 milyon olayda 4 dakikanın üzerine çıkar. Gzip ile sıkıştırılmış dosyalar bölünerek paralel işlenemez. Bu nedenle analitik başlamadan önce açma işlemi giderek daha fazla zaman alır.

Genel tablo

Hem yükleme süresini hem de ön işlemeyi değerlendirdiğinizde format seçimi netleşir:

10M olay (100 Mbps) Dosya boyutu Yükleme Ön işleme Toplam
Parquet 301 MB 30 sn 1,5 dk ~2 dk
ORC 395 MB 40 sn 1,5 dk ~2,2 dk
CSV 2,2 GB 4 dk 1,5 dk ~5,5 dk
CSV.GZ 215 MB 21 sn 2 dk ~2,5 dk
50M olay (100 Mbps) Dosya boyutu Yükleme Ön işleme Toplam
Parquet 1,7 GB 3 dk 2 dk ~5 dk
ORC 1,9 GB 3,2 dk 2 dk ~5,2 dk
CSV 11,1 GB 18 dk 2 dk ~20 dk
CSV.GZ 1,1 GB 2 dk 3 dk ~5 dk

Ölçek büyüdüğünde Parquet ve ORC açık ara en iyi seçeneklerdir, çünkü dosya boyutları çok daha küçüktür. Ana darboğaz yükleme süresidir. CSV.GZ dışında tüm formatlarda ön işleme yaklaşık aynı süreyi alır. CSV.GZ ise açma işlemi nedeniyle ölçek büyüdükçe daha fazla zaman gerektirir.

Hangi formatı kullanmalısınız?

  • Parquet: Genel olarak en iyi seçenektir. En küçük sütun tabanlı formattır, en hızlı ön işlemeyi sunar ve modern veri araçları tarafından yaygın biçimde desteklenir. Veri hattınız destekliyorsa bunu kullanın.
  • ORC: Özellikle Hadoop/Spark ekosistemi kullanıyorsanız mükemmel bir tercihtir. Boyutu Parquet’e neredeyse eşittir ve aynı hızda ön işlenir.
  • CSV: Basit ve evrenseldir. 5 milyon olayın altındaki veri setlerinde veya sütun tabanlı bir formata dışa aktarım yapamadığınızda iyi çalışır.
  • CSV.GZ: Yalnızca yükleme süresinin belirleyici olduğu, 50 Mbps’nin altındaki çok yavaş bağlantılarda önerilir. Ön işleme maliyeti, hızlı bağlantılarda veya büyük veri setlerinde bu formatı zayıf bir seçenek haline getirir.

Gzip hakkında ne düşünmelisiniz?

CSV.GZ dosyaları ham CSV’den %90 daha küçüktür, bu da yavaş bağlantılarda yardımcı olur. Ancak yerleşik sıkıştırmaya sahip ve doğrudan sorgulanabilen Parquet ve ORCnin aksine gzip dosyalarının işlenmeden önce tamamen açılması gerekir ve gzip paralel açmayı desteklemez. 50 milyon veya daha fazla olayda CSV.GZ ön işlemesi, diğer biçimlerdeki yaklaşık 2 dakikaya kıyasla 3 ila 4,5 dakika sürer. Hızlı bir bağlantıda biraz daha büyük bir Parquet dosyası yüklemek neredeyse her zaman daha iyi bir seçimdir.

Bağlantınız çok yavaşsa, 10 Mbps hızındaysanız ve büyük bir CSV dosyanız varsa gzip yine de mantıklı olabilir: gzip -k data.csvMac/Linux üzerinde veya Windows üzerinde 7-Zip.

Delta loading: Yeniden yüklemeden veri ekleyin

Temel bir veri setini yükledikten sonra yeni veriler geldiğinde her şeyi yeniden yüklemeniz gerekmez. ProcessMind, delta loading’i, yani artımlı yüklemeleri destekler. Böylece mevcut bir veri setine yeni olaylar ekleyebilirsiniz.

Nasıl çalışır:

  1. İlk veri setinizi, örneğin 2,3 milyon olay içeren 2026’nın ilk çeyreğine ait satın alma siparişlerini yükleyin
  2. İkinci çeyreğe ait veriler geldiğinde yalnızca yeni olayları delta dosyası olarak yükleyin, örneğin 800 bin yeni olay
  3. ProcessMind dosyaları otomatik olarak birleştirir ve yeniden işler

Performans etkisi büyüktür. Büyüyen veri setinizi her seferinde yeniden yüklemek yerine yalnızca yeni verileri yüklersiniz:

Senaryo Tam yeniden yükleme Delta yükleme Kazanılan süre
10M temel + 500K yeni olay (100 Mbps) 4 dk yükleme 5 sn yükleme ~4 dk
20M temel + 2M yeni olay (100 Mbps) 7 dk yükleme 44 sn yükleme ~6 dk
50M temel + 5M yeni olay (100 Mbps) 18 dk yükleme 2 dk yükleme ~16 dk

Delta yüklemesinden sonra birleştirilmiş veri seti yeniden ön işlenir ve aynı 1-2,5 dakikalık süre gerekir. Ancak daha önce yüklediğiniz veriler için gereken yükleme süresinin tamamını kazanırsınız.

Delta loading şu durumlar için idealdir:

  • Haftalık veya aylık veri yenilemeleri: Yeni işlemleri kullanılabilir oldukça ekleyin
  • Sürekli süreç izleme: Büyük yüklemeler yapmadan Dashboardları güncel tutun
  • Büyüyen olay günlükleri: ERP, CRM veya diğer kaynak sistemlerden yeni olaylar ekleyin

Delta dosyaları, ilk yüklemeyle aynı dosya formatını ve sütun yapısını kullanmalıdır. Ayrıntılar için artımlı veri yükleme rehberine göz atın.

Büyük veya otomatik yüklemeler için API kullanımı

Birkaç gigabaytı aşan veri setlerinde veya tekrarlanan yüklemelerde komut dosyaları ya da komut satırı araçları, tarayıcı üzerinden yapılan yüklemelerden daha güvenilirdir. Tarayıcılar zaman aşımına uğrayabilir, aşırı bellek tüketebilir veya ağ kesildiğinde ilerlemeyi kaybedebilir.

API büyük dosyalarda neden daha iyi çalışır:

  • Güvenilir aktarımlar. Bağlantınız kesilirse baştan başlamadan yeniden deneyebilirsiniz.
  • Tarayıcı bellek sınırı yoktur. Tarayıcılar çok gigabaytlık dosyalarda zorlanır. Komut satırı araçları bu dosyaları kolayca işler.
  • Otomasyon. Gece yüklemelerini planlayın, ETL hatlarıyla entegre edin veya CI/CD üzerinden yüklemeleri tetikleyin.
  • İlerleme izleme. Araçlar gerçek zamanlı aktarım ilerlemesini gösterir.curl
  • Delta yüklemeleri. Yeni verileri planlı biçimde program aracılığıyla ekleyin.

Curl kullanarak örnek:

# Upload a Parquet file directly using a presigned URL
curl -X PUT "$PRESIGNED_URL" --upload-file data.parquet

ProcessMind, bulut depolamaya doğrudan yüklemeleri yetkilendiren ön imzalı URL’ler sağlar. API anahtarınız dışında ek kimlik bilgileri gerekmez. Ön imzalı yükleme URL’sini ProcessMind kullanıcı arayüzündeki veri seti ayarları menüsünden doğrudan kopyalayabilirsiniz.

Ön imzalı URL’leri alma, delta dosyalarını yükleme ve büyük veri setlerini program aracılığıyla işleme dahil olmak üzere eksiksiz Bash, JavaScript ve Python örnekleri için API belgelerine göz atın.

Model yineleme hızı

Etkinlikleri yeniden adlandırarak, haritalamaları değiştirerek veya gruplar ekleyerek süreç modelinizi geliştirdiğinizde yalnızca modele bağlı hesaplamaların güncellenmesi gerekir. Temel veriler yerinde kalır:

Veri seti Tam ön işleme Model değişikliği Kazanılan süre
1M olay 55 sn ~14 sn %75
2M olay 1 dk ~16 sn %73
10M olay 1,5 dk ~20 sn %78
20M olay 2 dk ~23 sn %81
50M olay 2 dk ~37 sn %69
100M olay 2,5 dk ~52 sn %65

Model değişiklikleri hızlıdır, çünkü veri seti boyutuyla büyüyen ilk veri yükleme adımı zaten tamamlanmıştır. Yalnızca etkinlik haritalamaları, geçişler ve varyantlar dahil olmak üzere modele bağlı toplama adımı yeniden çalıştırılır. 20 milyon olaya kadar olan veri setlerinde model değişiklikleri 25 saniyeden kısa sürede tamamlanır. 100 milyon olayda bile bir dakikadan kısa sürer, bu da tam ön işlemeden çok daha hızlıdır.

Dashboard yanıt süreleri

Verileriniz yüklendikten sonra analiz sırasında karşılaşacağınız yanıt süreleri aşağıdaki gibidir. Bu süreler, birden fazla kıyaslama çalışmasının medyan değerleridir. Her Dashboard bileşeni bağımsız olarak sorgulanır ve paralel biçimde yüklenir:

Veri seti İstatistikler Süreç akışı Varyantlar Kategoriler Veri tarayıcısı Animasyon
100K 0,6 sn 1,5 sn 1,1 sn 1,5 sn 1,2 sn 1,4 sn
1M 0,6 sn 1,6 sn 1,4 sn 1,9 sn 1,5 sn 2,0 sn
5M 0,6 sn 2,5 sn 1,8 sn 2,4 sn 1,3 sn 2,1 sn
10M 0,6 sn 3,4 sn 2,2 sn 2,5 sn 1,6 sn 2,4 sn
20M 0,6 sn 3,9 sn 2,7 sn 3,3 sn 1,9 sn 3,6 sn
50M 0,6 sn 5,1 sn 4,2 sn 5,7 sn 1,6 sn 2,7 sn
100M 0,6 sn 7,2 sn 3,5 sn 4,7 sn 1,6 sn 5,0 sn

Dikkat edilmesi gereken örüntüler:

  • İstatistikler, özet sayılar ve süreler dahil olmak üzere, boyuttan bağımsız olarak yaklaşık 0,6 saniyede sonuçlanır. Bu sorgular büyük ölçüde optimize edilmiştir.
  • Süreç akışı, tüm etkinlikler arasındaki geçişleri hesapladığı için veri seti boyutuyla birlikte yavaşlar.
  • Varyantlar ve Kategoriler orta düzeyde ölçeklenir. Önceden toplanmış veriler bunların hızlı kalmasını sağlar.
  • Veri tarayıcısı sayfalama sayesinde hızlı kalır. Filtreler uygulandığında süre 1 saniyenin altına iner.
  • Animasyon, görselleştirilen etkin vakaların sayısına göre değişir.

Sonuç şu: Önerilen 1-10 milyon olaylık veri seti boyutlarında her Dashboard bileşeni 3,5 saniyeden kısa sürede yanıt verir. 50 milyon olayda bile filtreler uygulandığında sorguların çoğu 2-4 saniye içinde sonuçlanır. Yalnızca 50 milyon ve üzeri veri setlerindeki filtresiz süreç akışları ve kategori görünümleri 5-6 saniyeye ulaşır.

Küçük başlayın, büyüyün

Bu rehberdeki en önemli öneri şudur: En büyük veri setinizle başlamayın.

Yinelemeli yaklaşım

  1. Bir örneklemle başlayın. Son 3 aylık dönemi kapsayan 1 milyon olay çıkarın. Gigabit bağlantıda yükleme 3 saniye, 100 Mbps bağlantıda 22 saniye sürer. Ön işleme 1 dakikadan kısa sürer. 2 dakika içinde analize başlayabilirsiniz.
  2. Modelinizi oluşturun. Etkinlikleri yapılandırın, filtreleri ayarlayın ve farklı görünümleri deneyin. Tipik veri setlerinde model değişiklikleri 6-20 saniye sürer. Serbestçe yineleyin.
  3. Bulgularınızı doğrulayın. Süreç anlamlı mı? Etkinlik adları doğru mu? Veri kalitesi sorunları var mı? Yüklemeler hızlıyken bunları düzeltin.
  4. Yalnızca gerektiğinde ölçek büyütün. Nadir olayları veya uzun vadeli eğilimleri incelemek için gerçekten daha fazla veriye ihtiyacınız varsa 5 milyona ya da 10 milyona çıkın. Verileri yeniden yüklemek yerine eklemek için delta loading kullanın.

Rakamlar kendini gösteriyor:

Yaklaşım Yükleme (100 Mbps) Ön işleme Toplam bekleme Dashboard hızı
1M olayla başlayın 22 sn 55 sn ~1,5 dk 1-2 sn
5M olayla başlayın 2 dk 1,5 dk ~3,5 dk 1-2,5 sn
50M olayla başlayın 18 dk 2 dk ~20 dk 1-6 sn

Çoğu kuruluş, 1-5 milyon olayın uygulanabilir içgörüler için fazlasıyla yeterli olduğunu görür. Süreç davranışı 10 milyon olaydan çok önce istikrara kavuşur. Bu noktadan sonra çoğunlukla zaten gördüğünüz örüntülerin tekrarlarını eklersiniz.

1 milyon olay içeren 34 MB’lık Parquet dosyanız 3 saniyede yükleniyor ve size 50 milyon olayla aynı süreç haritasını sunuyorsa neden 18 dakika bekleyesiniz?

Veri stratejisi: Doğru boyutu bulmak

Yukarıdaki rakamlar net bir tablo ortaya koyuyor: 1-5 milyon olayda yüklemeler saniyeler içinde tamamlanır, ön işleme 2 dakikadan kısa sürer ve Dashboardlar 1-2,5 saniyede yanıt verir. 50 milyonda ise 100 Mbps bağlantıda yükleme için 20 dakika beklersiniz ve Dashboard yanıtları 3-6 saniyeye çıkar. Deneyim belirgin biçimde farklıdır.

Asıl soru “araç ne kadar hızlı?” değil, “gerçekte ne kadar veriye ihtiyacım var?” sorusudur. Yanıt, neredeyse her zaman düşündüğünüzden daha az veridir.

Önce segmentlere ayırın, sonra toplulaştırın

Önce tek bir ülkeyi, departmanı veya ürün grubunu analiz edin.

Bu bir kısıtlama değildir, netlik sağlar. Segmentlere ayrılmış analiz, küresel ortalamalara göre daha keskin içgörüler üretir.

Segmentlere ayırma neden işe yarar:

  • Süreçler bölgelere göre farklılaşır. Almanya’daki operasyonlar, ABD’deki operasyonlardan farklı onay zincirleri izler. Fransa’daki iş kanunları farklı İK Workflowları oluşturur. Bunları birlikte analiz etmek gürültü yaratır.
  • Paydaşların öncelikleri farklıdır. EMEA Başkan Yardımcısı EMEA ile ilgilenir. Ona EMEA verilerini gösterin. Küresel görünüm daha sonra gelebilir.
  • Daha hızlı yineleme. Tek bir ülkenin verisi 10 milyon yerine 500 bin olay içerebilir. Saatler yerine dakikalar içinde yineleme yaparsınız.
  • Yerleşik kıyaslama. Almanya’yı analiz ettikten sonra aynısını Fransa için yapın. Artık karşılaştırma yapabilirsiniz.

Örnek: 8 ülkeye yayılmış 42 milyon sevkiyat olayı bulunan Avrupalı bir lojistik şirketi:

  • Her şeyi analiz etmek: 42 milyon olay, 9,3 GB, 100 Mbps bağlantıda 16 dakika yükleme, 2 dakika ön işleme
  • Yalnızca Almanya’yı analiz etmek: 8,5 milyon olay, 1,9 GB, 3 dakika yükleme, 1,5 dakika ön işleme
  • Yalnızca Hollanda’yı analiz etmek: 3,1 milyon olay, 690 MB, 1 dakika yükleme, 1 dakika ön işleme
  • Delta loading kullanmak: Önce Almanya’yı yükleyin, ardından hazır olduğunda Hollanda’yı ekleyin

Segmentasyon boyutları

Coğrafi boyutlar, ülke, bölge ve tesis dahil; kurumsal boyutlar, iş birimi ve departman dahil; ürün boyutları, ürün grubu ve kategori dahil; zaman boyutları, mali yıl ve çeyrek dahil; müşteri boyutları, segment ve kanal dahil.

Sorunsuz akışı filtreleyin

Sorunsuz akışı yüklemeden önce hariç tutun. Bu yöntem veri setlerini %90-95 oranında küçültebilir.

Çoğu iş süreci 80/20 kuralını izler. Vakaların büyük çoğunluğu standart ve başarılı yolu takip eder. İstisnaları, uyumluluk ihlallerini veya süreç sapmalarını arıyorsanız bu verilere ihtiyacınız yoktur.

Örnek: 1,2 milyon satın alma siparişi ve 8,4 milyon olay içeren bir satın almadan ödemeye süreci:

  • 1,1 milyon sipariş (%92) şu akışı izliyor: Satın Alma Siparişi Oluştur → Onayla → Mal Kabulü → Fatura → Ödeme
  • 96.000 siparişte (%8) istisnalar bulunuyor: retler, iadeler, mükerrer faturalar ve eksik onaylar

Uyumluluk sorunlarını analiz ediyorsanız yalnızca istisna içeren vakaları dışa aktarın. Bu, 8,4 milyon olaydan (1,9 GB) 670 bin olaya (150 MB) düşerek %92’lik bir azalma sağlar. 100 Mbps bağlantıda yükleme süresi 3 dakikadan 15 saniyeye iner. Parquet olarak dışa aktarın (15 MB), böylece dosyayı 2 saniyeden kısa sürede yükleyebilirsiniz.

Dışa aktarmadan önce nasıl filtrelenir?

Duruma göre, örneğin reddedildi, iptal edildi veya istisna; belirli etkinliklere göre, örneğin “Reddetme” veya “Manuel geçersiz kılma” içeren vakalar; vaka süresine göre, örneğin beklenenden uzun süren vakalar; ya da belirli zaman aralıklarına veya iş birimlerine göre filtreleyin.

Sütun seçimi: Az, çoktur

Dışa aktardığınız her sütun bant genişliği, depolama alanı ve işlem süresi gerektirir. Sütunları dikkatle seçmek, yapabileceğiniz en etkili optimizasyonlardan biridir.

Neleri dahil etmeyin:

  • Uzun metin alanları. Sipariş açıklamaları, yorumlar, notlar ve serbest metin alanları. 5 milyon olayda 500 karakterlik bir açıklama alanı dosyanıza 2,5 GB ekler.
  • Kişisel veriler. Adlar, e-posta adresleri ve telefon numaraları. Kişisel verileri kaldırmak dosya boyutunu küçültür, gizlilik risklerini ortadan kaldırır ve uyumluluğu kolaylaştırır.
  • Gereksiz tanımlayıcılar. OrderId varsa OrderGUID, OrderReference veya LegacyOrderNumber alanlarına ihtiyacınız yoktur.
  • Denetim sütunları. CreatedBy, ModifiedBy, CreatedDate ve ModifiedDate alanlarını özellikle analiz etmiyorsanız dahil etmeyin.
  • Sistem sütunları. Dahili işaretler, bölümleme anahtarları ve teknik meta veriler.

Örnek: 45 sütun içeren 1,8 milyon satın alma siparişi olayından oluşan bir SAP dışa aktarımını 12 temel sütuna indirdik:

  • Dosya boyutu: 2,1 GB → 380 MB (%82 azalma)
  • Parquet olarak: 380 MB → 58 MB (ek %85 azalma)
  • Yükleme süresi (100 Mbps): 3,5 dk → 6 saniye
  • Aynı analitik değer

Önemli sütunlar: CaseId, Activity, Timestamp ve durum, tutar, kategori ve bölge gibi birkaç iş özniteliği. Geri kalan her şey büyük olasılıkla gürültüdür.

Ölçeğin önemli olduğu durumlar

Bazı analitik sorular gerçekten büyük veri setleri gerektirir. Bunun ne zaman geçerli olduğunu bilmeniz doğru kararı vermenize yardımcı olur:

  • Nadir olay tespiti. 100.000 vakada bir gerçekleşen uç durumları bulmak için anlamlı örnekler içerecek kadar büyük bir kitle gerekir. Nadir bir istisna %0,01 oranında gerçekleşiyorsa 50 örneği analiz etmek için 500 bin vakaya ihtiyacınız vardır.
  • Düşük sıklıklı yolların ölçümü. Zamanın %0,1’inde gerçekleşen süreç varyantları 1 milyon olaylık bir örneklemde görünmeyebilir, ancak 50 milyon olaylık bir kitlede önemli olabilir.
  • Uyumluluk ve denetim. Bazı düzenlemeler tüm kitleyi kapsayan analiz gerektirir. Örnekleme kabul edilmez.
  • Çok yıllı eğilim analizi. 2024’ün ilk çeyreğini 2025’in ilk çeyreği ve 2026’nın ilk çeyreğiyle karşılaştırmak için üç dönemi de kapsayan verilere ihtiyacınız vardır. Bu verileri delta loading ile kademeli olarak oluşturun.

50 milyon veya daha fazla olaya ihtiyacınız varsa önceden plan yapın: 11 GB boyutundaki CSV’yi 1,7 GBye düşüren ve ön işlemeyi hızlandıran Parquet biçimini kullanın, güvenilir aktarımlar için API’yi kullanın ve mümkünse hızlı bir ağ bağlantısından yararlanın. İlk yüklemeden sonra Dashboardlar hızlı kalır.

Modeli ve arayüzü hızlı tutun

Yukarıdaki bölümler veri hacmiyle ilgilidir. Hızlı yanıtın diğer yarısı, modelin ve Dashboardların nasıl oluşturulduğuna bağlıdır:

  • Modeli basitleştirin. Büyük süreçleri modüler Subprocesslere ayırın, görünür binlerce öğenin bulunduğu bir Canvasın oluşturulması yavaştır ve okunması imkânsızdır. Yapısal değişikliklerden sonra otomatik yerleşimi çalıştırın.
  • Dashboardları seçerek kullanın. Her grafik ve kutucuk hesaplanmalıdır. Birinin işlem yaptığı grafikleri tutun, geri kalanları her şeyi tek görünümde üst üste yığmak yerine kendi Dashboardlarına taşıyın.
  • Grafiği veri setine göre seçin. Büyük veri setlerinde ayrıntılı pasta grafikleri ve çok kategorili kırılımlar gibi işlem yükü yüksek görselleştirmeler yerine özetleyen grafikleri tercih edin.
  • Filtreleri ölçülü uygulayın. Filtreler tek tek kullanıldığında ucuz, birlikte kullanıldığında maliyetlidir. Sorunuzu yanıtlayan filtreleri tutun ve sonrasında kaldırın.
  • Animasyonu izleyin. Animasyon maliyeti etkin vakaların sayısıyla artar. Yalnızca akışa ihtiyacınız olduğunda hızı düşürün veya kuyrukları ve efektleri kapatın, Süreç animasyonu bölümüne göz atın.
  • Arşivleyin ve yeniden inceleyin. Eski veri setlerini ve süreçleri etkin çalışma alanından çıkarın, her şeyi aynı anda optimize etmek yerine düzeltmeye değer darboğazları bulmak için simülasyonu zaman metrikleriyle birlikte kullanın.

Sonraki adımlar

Process Mining performansını anlamanın en iyi yolu, bunu kendi verilerinizle deneyimlemektir.

  1. Bir örneklemle başlayın. Yakın tarihli bir dönemden 1 milyon olayı Parquet formatında dışa aktarın. Bunları yükleyin. İlk modelinizi oluşturun. Ne kadar hızlı yineleme yapabildiğinizi görün.

  2. Bu rehberdeki teknikleri uygulayın. Sütun tabanlı formatlar kullanın. İstisnaları filtreleyin. Bölgeye göre segmentlere ayırın. Gereksiz sütunları kaldırın. Her optimizasyon bir öncekinin üzerine eklenir.

  3. Ölçeği bilinçli biçimde büyütün. Sürecinizi 1 milyon olayla anladıktan sonra daha fazlasına ihtiyacınız olup olmadığına karar verin. Genellikle ihtiyacınız olmaz. İhtiyaç duyduğunuzda verileri yeniden yüklemek yerine eklemek için delta loading kullanın.

Ücretsiz denemeyi başlatın ve bu kıyaslamaları uygulamada görün. Veri setinizin boyutunu belirleme veya dışa aktarımlarınızı optimize etme konusunda yardım için bize ulaşın. Yüzlerce kuruluşun veri hacmi ile analiz hızı arasında doğru dengeyi bulmasına yardımcı olduk.

İlgili blog gönderileri

Process Mining ve Workflow optimizasyonu hakkında uzman içgörülerini gelen kutunuzdan alın
Yalın süreç iyileştirme: Veri odaklı rehber

Yalın süreç iyileştirme: Veri odaklı rehber

Ölçülebilir iş sonuçları elde etmek için DMAIC sürecini, Six Sigma sürecini ve yalın süreç iyileştirme araçlarını öğrenin.

Celonis alternatifleri: Process Mining araçlarını karşılaştırın

Celonis alternatifleri: Process Mining araçlarını karşılaştırın

Süreçlerinize, bütçenize ve hedeflerinize uygun yazılımı bulmak için Celonis Process Mining ile ProcessMind’i karşılaştırın.

Fluxicon Disco ve ProcessMind: Process Mining karşılaştırması

Fluxicon Disco ve ProcessMind: Process Mining karşılaştırması

Ekibiniz için doğru process mining platformunu seçmek üzere Fluxicon Disco ve ProcessMind’i özellikler, fiyatlandırma ve kullanım alanları açısından karşılaştır…

SAP Signavio ve ProcessMind: Process Mining karşılaştırması

SAP Signavio ve ProcessMind: Process Mining karşılaştırması

Process Mining, modelleme ve simülasyon açısından ProcessMind ile SAP Signavio’yu karşılaştırın. İşletmeniz için doğru seçimi yapın.

Daha iyi süreçler tasarlayın. Bağlantılı bir mimari oluşturun. Kontrolü elinizde tutun.

Kredi kartı gerektirmeden ve beklemeden hemen erişim sağlayın. Kuruluşunuzun çalışma biçimini net ve bağlantılı süreç tasarımlarına dönüştürün.

Süreç mimarinizi oluşturun, sahiplik ve kontrolleri tanımlayın, rolleri ve sorumlulukları her düzeyde uyumlu hale getirin.

Ücretsiz denemeyi başlatın ve süreçlerinizi yönetmek, yönlendirmek ve sürekli iyileştirmek için güvenilir bir temel oluşturun.