用于流程挖掘的ETL工具

流程挖掘中的ETL

流程挖掘依赖来自多个系统的数据,因此ETL是关键步骤。ETL代表Extract、Transform、Load,即提取、转换和加载。它从源系统提取数据,将数据转换为适合分析的格式,再加载到数据仓库或流程挖掘平台中。这一工作流帮助您收集、清洗、整理和准备数据,从而获得可靠的流程洞察。

以下介绍如何有效地将ETL用于流程挖掘。

全局方法

最重要的原则很简单:不要急于提取数据,因为这会耗费时间和资金。

首先明确项目目标,确定希望分析的流程。选择一个流程,并使用BPMN模型快速勾勒流程框架。根据项目目标向模型中添加数据。先从容易获取的数据开始,例如Excel文件、易于导出的数据,或已用于其他分析的数据。然后找出数据缺口,仅提取实现目标所需的数据。不要因为“以防万一”就收集所有数据。过多的数据会拖慢进度。持续改进周期的速度,往往更多取决于数据收集,而不是实施本身。

先从简单的文件上传开始。只有在确有必要时才自动加载数据,例如数据经常变化且您需要持续分析时。很多情况下,静态分析反而更稳定。无论选择哪种方式,都不要让它拖慢进度。每季度花几分钟上传一次数据,总好过花数周自动化这一过程,最后却发现数据不正确或不足以支持业务场景。

您需要哪些数据?

流程挖掘需要三类数据:案例ID、时间戳和活动。成本、用户、团队或CO2排放等额外数据,可以为分析提供更多背景。您还可以加入用于图表的额外维度,以及用于指标的其他度量值。

获取流程挖掘数据通常并不困难,因为所需字段很常见。真正困难的是创建包含全部必要数据的单一数据集。您可能需要进行大量转换,才能将不同数据源合并并标准化到一个文件中。

您不必一次准备好所有数据,先从已有数据开始。

您需要什么数据格式?

虽然现在有更高级的数据格式,但大多数工具仍依赖简单的文本文件。请使用逗号分隔的CSV文件或制表符分隔的TSV/TXT文件。避免使用固定宽度文本文件,因为大多数工具无法处理这类文件。

每个文件都应以表头行开头,后面接数据行,且数据行中的字段应与表头字段及其顺序一致。

如果需要使用非英语字符,请采用UTF-8编码。确保字段中不包含分隔符或换行符。您可以用引号包围字段,但应避免在字段内部使用引号。如有必要,可将字段中的引号替换为其他字符,以简化处理。

易于获取的数据

先列出您可以轻松访问的数据。可以考虑以下来源:

  • 包含原始数据的月度或周度Excel报告。必要时使用Excel重新整理数据。
  • 来自其他工具的流程挖掘数据,通常无需额外预处理。
  • 来自HR、财务或ITSM系统等系统的标准导出数据。请以流程挖掘工具支持的格式导出数据。
  • 分析工具导出的数据,这些工具用于报告您所需的数据。使用数据透视表和导出功能创建合适的格式。
  • 经过清洗和合并的数据仓库。使用数据仓库工具筛选数据,并将其导出为CSV。

流程系统

数据通常存储在SAP、Workday、Salesforce或ServiceNow等系统中。首先确认简单导出是否能满足需求,这通常是最快实现价值的方式。如果不能,再使用ETL工具将数据提取、转换并加载到流程挖掘工具中。

根据您所在的组织,可能需要协调IT、系统负责人或数据仓库团队。这样做可能会减慢数据收集,但不要绕过这些团队。他们拥有相关流程和经验,可以帮助加快进度。与他们采用敏捷循环协作。先从现成数据开始,避免一次性索取全部数据,以免造成延误。

首先,以文本格式请求数据。之后,使用流程挖掘工具的API或内置ETL工具自动化这一过程。

流程挖掘工具中的内置ETL工具

我们通常不建议使用流程挖掘供应商提供的内置ETL工具。它们看似方便,但存在明显局限:

  • 质量低于专用ETL工具。
  • 使用SQL等行业标准之外的专有技术,增加培训需求,也减少可获得的专业支持。
  • 供应商锁定,切换工具更加困难。
  • 形成数据孤岛,限制数据在其他分析或AI项目中的复用。

第三方ETL工具

许多第三方ETL工具都支持流程挖掘。虽然流程挖掘需要特定数据,但底层操作是通用的。

优先选择基于SQL的工具,以便复用ETL逻辑并长期维护。尽量使用企业现有工具,避免采用新技术导致延误或项目受阻。

常见的流程挖掘第三方ETL工具包括:

  • CData:擅长数据提取,通常与其他工具配合使用。
  • dbt:基于SQL的数据转换工具,支持处理大规模转换任务。
  • BigQuery:Google提供的托管式数据仓库,适合对大型数据集执行快速SQL查询。
  • Snowflake:基于云的平台,支持可扩展的存储和计算,适用于数据转换与分析。
  • DataBricks:统一分析平台,结合数据工程、机器学习和分析能力。
  • Talend:图形化ETL工具,支持多种数据源。
  • Apache Nifi:开源ETL工具,用于自动化数据流和实时数据处理。

流程挖掘专用ETL工具

流程挖掘专用ETL工具将第三方ETL工具的优势与流程挖掘功能和模板结合起来。

示例包括:

  • EvidantData Transform Refinery。专注于大规模提取和转换流程挖掘数据。
  • Konekti:用于快速创建准确的流程数据模型。

管理数据加载后的数据

数据提取只是数据管理的一半。后续如何组织数据集,决定了分析能否保持可信。

  • 按内容命名数据集。Q1_2025_Sales_DataCustomer_Support_Logs优于export_final_v3。使用颜色对相关数据集进行分组;如果数据集承担特定角色,请使用与流程相关的名称。
  • **根据用途选择格式。**手动上传的小型和中型文件使用CSV或Excel即可;大型数据集和自动化管道则适合Parquet或ORC。
  • **分析前先预览。**映射前检查结构、列类型和几行数据,并确认流程挖掘所需的列:案例ID、活动和时间戳(流程挖掘字段)。
  • **有计划地映射。**先让自动映射完成第一轮,再处理未映射活动;有价值的流程步骤通常就隐藏在其中。现实中存在但未在数据中留下痕迹的步骤,可以标记为数据流经,既保持可见,又不会扭曲数据。
  • **扩展数据,而不是替换数据。**对于定期导出,使用增量加载追加新行,无需重新上传整个文件。
  • **按需合并或拆分。**具有相同属性的数据集可以合并到一个视图中,用于模拟和分析;差异较大的数据集则应分开管理,并使用各自的属性进行筛选。
  • **规范管理筛选器和指标。**三月有用的筛选器,到了六月可能会让仪表板变得难以理解。问题解决后移除相应筛选器,只展示实际有人查看的指标。
  • **控制访问权限,然后归档。**仅向需要访问数据集的人员授予权限,并将过时数据集归档,不要让它们留在活跃流程中。

总结

ETL不是流程挖掘项目的目标,但通常不可或缺。请合理设置ETL流程,避免延误:

  • 使用现成数据。
  • 先手动上传,适时再自动化。
  • 使用现有工具,并优先选择SQL工具。

最重要的是,从所需数据的小范围应用开始,再逐步扩展。一次性收集全部数据可能使项目偏离轨道。

相关文章

在收件箱中接收流程挖掘和工作流优化的专家洞察
精益流程改进:数据驱动指南

精益流程改进:数据驱动指南

了解DMAIC流程、六西格玛流程和精益流程改进工具,推动业务取得可衡量的成果。

Celonis替代方案:比较流程挖掘工具

Celonis替代方案:比较流程挖掘工具

比较Celonis流程挖掘与ProcessMind,找到适合您流程、预算和目标的软件。

Fluxicon Disco与ProcessMind:流程挖掘对比

Fluxicon Disco与ProcessMind:流程挖掘对比

从功能、定价和使用场景等方面比较Fluxicon Disco与ProcessMind,为您的团队选择合适的流程挖掘平台。

SAP Signavio与ProcessMind:流程挖掘对比

SAP Signavio与ProcessMind:流程挖掘对比

比较ProcessMind与SAP Signavio在流程挖掘、建模和模拟方面的能力,为您的企业选择合适的方案。

设计更优流程,构建互联架构,始终掌控全局。

无需信用卡,无需等待,即可立即访问。将您组织的工作方式转化为清晰、互联的流程设计。

构建流程架构,定义所有权和控制措施,并在各个层级统一角色与职责。

开始免费试用,为流程治理、管理和持续改进建立可靠的统一基础。