Process Mining için veri temizleme ve hazırlama
Etkili Process Mining, kaliteli verilerle başlar. Çalışmanın çoğu aynı birkaç sorunun çözümüne dayanır: hiç kaydedilmemiş olaylar, sistemler arasında eşleşmeyen kimlikler, birbiriyle uyuşmayan biçimler ve dikkatsizce ele alınamayacak kadar büyük veya hassas dışa aktarımlar. Bu sayfada bu sorunları ve çözüm adımlarını ele alıyoruz. Aynı işlemleri ProcessMind içinde yapmak için Veri Setinizi yapılandırma ve Veri kalitesi sayfalarına bakın.
Veri temizleme ve hazırlama neden önemlidir?
Process Mining, bir iş sürecindeki etkinliklerin ayrıntılı sırasını içeren Event Loglara, yani veri setlerine, dayanır. Bu veri setleri eksik veya tutarsızsa ya da hata içeriyorsa elde ettiğiniz içgörüler güvenilir olmaz. Temiz ve doğru yapılandırılmış veriler, aracın iş akışlarını haritalamasını, darboğazları belirlemesini ve iyileştirme alanlarını öne çıkarmasını sağlar.
Veri temizleme ve hazırlamada temel adımlar
1. Sürece dahil olan her sistemden veri toplayın
Veriler genellikle birden fazla sistemden gelir: siparişler ve faturalar için ERP, müşteri adımları için CRM, talepler için hizmet masası. Temizlemeye başlamadan önce tüm sistemlerden veri toplayın. Çünkü dışarıda bıraktığınız bir sistemde bulunan adımı daha sonra geri getiremezsiniz.
- Veri kaynaklarını birleştirin: sürecin bir bölümünü kaydeden sistemleri listeleyin ve her birinden veri çıkarın. Örneğin Siparişten Tahsilata süreci, bir satış sistemiyle (örneğin Salesforce) bir finans sistemini (örneğin SAP) kapsar.
- Veri silolarını ortadan kaldırın: hangi sistemlerin dahil edileceği ve bu sistemlerden kimin dışa aktarım yapabileceği konusunda süreç sahipleriyle anlaşın. Eksik veriler genellikle bozuk bir sorgudan değil, raporlanmayan bir sistemden kaynaklanır. Entegrasyon araçları, örneğin Apache NiFi, Talend, Informatica veya Power BI, birden fazla kaynağı tek dosyada birleştirebilir.
- Çıkaramayacağınız veriler için plan yapın: bir adım sistem dışında gerçekleşiyorsa, örneğin telefonla onay veya kâğıt üzerinde imza, en azından sonucunu dijital bir sisteme kaydedin veya süreç görünümünün eksiksiz kalması için bu adımı modelleyin. Sistem bazında veri kaynaklarını ele alan Veri kaynakları sayfasına bakın.
2. Yinelenen kayıtları kaldırın
Yinelenen kayıtlar, etkinlik sayılarını artırarak ve tek bir olayı birden fazla olay gibi göstererek analizi çarpıtır. Aynı vaka kimliğine, etkinliğe ve zaman damgasına sahip kayıtları belirleyin, ardından bunları kaldırın veya tek satırda birleştirin.
3. Eksik verileri ele alın
Eksik zaman damgaları, etkinlikler veya vaka kimlikleri olayların sırasını bozar ve eksik süreç modelleri oluşturur.
- Eksik değerleri belirleyin: boş zaman damgalarını, boş etkinlik adlarını ve null vaka kimliklerini arayın.
- Boşlukları doldurun: mümkün olduğunda diğer kaynaklardan veya alan bilginizden yararlanın. Bir zaman damgası eksikse çevredeki olay zamanları aralığı daraltabilir.
- Uydurmak yerine modelleyin: hiç kaydedilmemiş adımları sahte zaman damgaları oluşturarak değil, süreç modelleme yoluyla ekleyin. Böylece keşfedilen süreç ile belgelenen süreç birbiriyle örtüşür.
- Tahmin edin veya çıkarın: kritik boşluklarda bir tahmin tekniği kullanın (örneğin ortalama ile doldurma veya regresyon modeli). Bir vaka kurtarılamıyorsa vakayı kaldırın ve nedenini not edin.
4. Biçimleri, kimlikleri ve adları standartlaştırın
- Zaman damgaları: her yerde tek bir biçim kullanın (örneğin,
YYYY-MM-DD HH:MM:SS). Dışa aktarımda farklı saat dilimleri varsa tümünü UTC’ye dönüştürün. Desteklenen tarih biçimlerinin listesine bakın - Vaka kimlikleri: aynı süreç, farklı sistemlerde genellikle farklı tanımlayıcılar taşır. CRM’de sipariş numarası, finansta fatura numarası kullanılabilir. Her olayın tek bir vaka altında yer alması için bu kimlikler arasında bir eşleme oluşturun (dışa aktarımda veya arama tablosu olarak) ve her süreç örneğine benzersiz bir kimlik verin. ProcessMind’de birleştirdiğiniz her veri setinde vaka kimliği sütununun aynı şekilde eşlendiğini kontrol edin; bkz. veri seti öznitelikleri.
- Etkinlik adları: sistemler aynı adımı farklı biçimlerde adlandırabilir. Her adım için tek bir ifade belirleyin (“Siparişi Onayla” ve “Sipariş Onayı” aynı etkinliktir).
- Değerler ve türler: sayıları sayı olarak tutun (maliyetler, süreler, tutarlar) ve her sütunda tek birim kullanın.
5. İlgisiz olayları kaldırın
Kaydedilen her olay analiz ettiğiniz sürece ait değildir. Sistem girişleri, teknik yeniden denemeler ve idari görevler, içgörü sağlamadan haritayı gereksiz ayrıntılarla doldurur.
- Ait olmayanları filtreleyin: hangi olayların süreci açıkladığına karar vermek için alan bilginizden yararlanın ve diğerlerini hariç tutun.
- Doğru ayrıntı düzeyini seçin: fazla genel olaylar, örneğin “sipariş işlendi”, aradığınız farklılıkları gizler. Fazla ayrıntılı olaylar ise haritayı teknik ayrıntılarla doldurur. Düşük düzeyli olayları ait oldukları iş etkinliğinde gruplayın; sınırın nerede olacağına süreç uzmanları karar versin.
6. Aykırı değerleri ve gürültüyü ele alın
Aykırı değerler, sürecin normalde nasıl işlediğine dair yanlış bir görünüm oluşturur. Nadir bir olay nedeniyle olağanüstü uzun süren bir görev, ortalamaları belirleyebilir.
- Aykırı değerleri belirleyin: bir adım için normal aralığın çok dışında kalan süreleri işaretleyin.
- Bunları tutup tutmayacağınıza karar verin: nadir ama önemli bir hata gibi gerçek bir istisna, korunmaya değer bir içgörü sağlayabilir. Veri hatası ise korunmamalıdır. Yalnızca yanlış olanı kaldırın, işinize gelmeyeni değil.
7. Olay sırasını kontrol edin
Olaylar yanlış sıradaysa araç hatalı akışı izler.
- Sırayı doğrulayın: her vakanın olayları zaman damgalarını izlemelidir. Aynı vakada “Sipariş Oluşturuldu” olayından önce “Sipariş Onaylandı” olayının gelmesi, zaman damgalarının kontrol edilmesi gerektiğini gösterir.
- Zaman damgasına göre sıralayın: yüklemeden önce her vakanın olaylarını zaman damgası sütununa göre sıralayın.
8. Büyük veri setlerini ele alın
Büyük dışa aktarımların hazırlanması ve yüklenmesi yavaştır. Bu nedenle boyutla mücadele etmek yerine boyutu önceden planlayın.
- Keşfetmek için örnekleyin, analiz etmek için yükleyin: çıkarılan olayların anlamlı olup olmadığını görmek için temsili bir örnek yeterlidir; analiz gerektirdiğinde dışa aktarımın tamamını yükleyin.
- Kademeli yükleyin: her şeyi değiştirmek yerine yeni dönemleri kademeli (delta) yüklemelerle ekleyin.
- Sütun tabanlı biçimleri tercih edin: büyük hacimlerde Parquet ve ORC dosyaları CSV veya Excel dosyalarından daha küçüktür ve daha hızlı yüklenir; bkz. Desteklenen veri biçimleri.
9. Hassas verileri koruyun
Event Loglar ad, adres, müşteri numarası ve kullanıcı kimlikleri içerir. Bu nedenle dışa aktarımı kişisel veri olarak ele alın.
- Anonimleştirin veya maskeleyin: analizin ihtiyaç duymadığı verileri kaldırın veya maskeleyin. Kullanıcı kimliklerini yalnızca kaynak analizi gerektiğinde tutun.
- Erişimi sınırlandırın: dışa aktarımı mümkün olduğunca az kişiye, yalnızca ihtiyaç duyanlara verin ve yüklediğiniz veri setleri için role dayalı erişim denetiminden yararlanın.
- Size uygulanan kurallara uyun: saklama sınırları, aktarım sırasında ve beklemede şifreleme ve müşteri verileri için GDPR gibi düzenlemeler.
10. Event Log oluşturun
Veriler temiz, tutarlı ve sıralı hale geldiğinde Process Mining için temel Veri Seti olan Event Logu oluşturun. Her logda şunlar bulunmalıdır:
- Vaka kimliği: her süreç örneği için benzersiz tanımlayıcı.
- Etkinlik: gerçekleşen adımın adı.
- Zaman damgası: olayın gerçekleştiği zaman; olayların sırasını belirler.
İsteğe bağlı sütunlar daha fazla ayrıntı sağlar: kaynak (kişi veya ekip), departman, maliyet veya süreci bölümlere ayırmak için kullanmak istediğiniz özel bir öznitelik. Gereksinimlerin tamamı Desteklenen veri biçimleri sayfasında listelenir.
11. Veri Setini doğrulayın
Sonuçlara güvenmeden önce Veri Setinin düşündüğünüz süreci temsil ettiğini kontrol edin.
- Vakaları örnek olarak kontrol edin: birkaç süreç örneğini baştan sona inceleyin ve olay sıralarının anlamlı olduğunu doğrulayın.
- Test analizi çalıştırın: süreci bir kez keşfedin ve açıkça anlamsız sonuçları arayın. Hiç gerçekleşmeyen etkinlikler, hatalı görünen başlangıç veya bitiş olayları ve kapanmış olması gereken vakalar buna örnektir.
- Süreç sahipleriyle doğrulayın: iş uzmanları, verilerin işlerin gerçekte nasıl yürüdüğünü yansıtıp yansıtmadığını birkaç dakika içinde söyleyebilir.
ProcessMind içinde veri temizleme
Yukarıdaki hazırlık işlemlerinin çoğunu yüklemeden sonra ProcessMind içinde gerçekleştirebilirsiniz:
- Sütunları eşleyin ve yapılandırın: kaynak dosyayı yeniden düzenlemek yerine veri seti özniteliklerinde görünen adları, veri türlerini ve zaman damgası biçimlerini ayarlayın.
- Kaliteyi kontrol edin: Veri kalitesi Dashboardı eksik değerleri ve tutarsızlıkları işaretleyerek analizden önce düzeltmenizi sağlar; AI veri önerileri ise eşlemeler ve düzeltmeler önerir.
- İlgisiz verileri gizleyin veya filtreleyin: veri seti özniteliklerinde sütunları gizleyin ve ihtiyacınız olmayan olayları çıkarmak için filtreleri kullanın.
- Yeniden yüklemek yerine verileri yenileyin: verileri yerinde değiştirin veya sürekli büyüyen veri setleri için kademeli (delta) yüklemeleri kullanın.
ProcessMind dışında temizlik yapmak için Python/Pandas, Excel veya Google Sheets, ETL araçları ve OpenRefine gibi genel amaçlı araçları yüklemeden önce kullanabilirsiniz. Adlandırma, biçimler, kademeli yükleme ve arşivlemeyi kapsayan daha geniş rehber için Process Mining için ETL sayfasına bakın.
İlgili konular
- Verileri nereden alabilirsiniz? - sistemlerinizden her adım için bir satır çıkarın
- Desteklenen veri biçimleri - dosya türleri ve yapı gereksinimleri
- Veri kalitesi - kalite rozetinin kontrol ettikleri
- Veri sorunlarını giderme - belirtiye göre düzeltmeler
- Process Mining için ETL - daha geniş veri hazırlama rehberi