本页内容

事件日志支持的数据格式

Process Intelligence Process Intelligence 流程智能席位或更高等级可用。只有此方案或更高等级的席位可以使用此功能。 比较方案 Process Intelligence席位或更高席位等级可用

数据上传支持的文件格式

ProcessMind支持多种事件日志文件格式。所有格式都可以通过应用界面API上传。

文本格式

  • .csv:逗号分隔值。常见且轻量,大多数系统(Excel、ERP等)都可以导出。分隔符会自动识别。
  • .tsv:制表符分隔值。与CSV类似,但使用制表符而非逗号;适合数据中包含逗号的情况。
  • .txt:纯文本文件。只要采用一致的分隔格式即可使用。
  • .xes:流程挖掘工具使用的事件日志标准格式。适合记录带时间戳和案例ID的详细活动。

Excel格式

  • .xls:Excel电子表格格式(旧版本)。支持使用,但加载速度可能比新格式慢。
  • .xlsx:现代Excel格式。应用广泛且完全支持,通常更适合结构化数据。
  • .xlsb:Excel二进制工作簿。加载速度更快,处理大型数据集的能力优于.xlsx,但兼容性不如其他格式普遍。

二进制/列式数据格式

  • .parquet:Apache Parquet格式。针对分析工作负载优化的列式存储格式,适合大型数据集处理大数据时明显快于CSV。支持增量(delta)上传
  • .orc:Optimized Row Columnar(ORC)格式。Hadoop/Spark生态中常用的另一种高效列式格式。支持增量(delta)上传
  • .jsonl / .ndjson:JSON Lines格式。每行都是一个独立的JSON对象,适合从API和日志系统流式导出数据。支持增量(delta)上传

压缩文件

  • .gz:Gzip压缩文件。上述任一格式都可以使用gzip压缩(例如data.csv.gzdata.parquet.gz)。ProcessMind会自动识别内部格式,并按需解压。使用gzip压缩可以缩短大文件的上传时间。

性能提示:大型数据集使用Parquet

对于包含数百万行的数据集,建议使用Parquet格式。Parquet文件采用列式存储并经过压缩,同时包含嵌入式架构信息,因此上传和查询速度更快,还能自动识别列,无需解析表头行。Parquet还支持持续增长数据集的增量(delta)上传。

通用文件结构要求

要在ProcessMind中成功进行流程挖掘,您上传的文件无论是Excel、文本格式还是XML格式,都必须遵循特定的结构要求。这样可以确保应用正确解析数据并执行准确分析。

1.表头行(Excel或文本格式)

  • 文件必须以表头行开头,并位于第一行(例如,Excel文件中的单元格A1,或CSV、TSV、TXT文件中的第1行)。表头定义列名称,并应清楚标明每列的数据类型(例如“Case ID”“Activity”“Timestamp”)。
  • 对于CSV、TSV和TXT格式,分隔符和引号会被自动检测,无需手动指定这些设置即可上传数据。
  • 对于ParquetORC格式,列名称和数据类型会直接从文件内嵌架构中读取,无需表头行。
  • 对于JSONL/NDJSON格式,列名称取自文件第一行中的JSON键。

2.最少属性集

为支持流程挖掘事件日志结构,您的文件至少必须包含以下属性(列)。这些属性不必使用Case ID、Activity等列名,但必须包含所规定的内容。

  • 案例ID:此列用于唯一标识每个流程实例(或案例)。同一流程实例对应的每一行都必须使用相同的案例ID。
  • 活动:此列应描述所记录的具体活动或事件(例如“Order Created”“Payment Processed”)。
  • 时间戳:每项活动都必须关联一个时间戳,用于标记事件发生的准确时间或日期。
  • 备注:时间戳格式会尽可能自动检测。常见格式(如yyyy-MM-dd HH:mm:ssMM/dd/yyyy)及其他格式都会自动识别。
  • 可选属性:您可以添加其他列来改进分析,例如:
  • 资源:标识执行活动的对象(例如用户、部门)。
  • 成本:与活动相关的任何成本。
  • 其他自定义数据:只要必需列齐全,您就可以添加与具体流程相关的自定义字段。

具体列取决于您要分析的流程。我们的流程改进指南会说明每个流程所需的架构、需要记录的活动,以及可供您填写的数据模板。

3.数据格式

  • 确保所有列中的数据格式保持一致:
  • 时间戳应采用标准且可识别的格式(例如yyyy-MM-dd HH:mm:ss),但如果日期格式不同,ProcessMind会尝试自动检测。
  • 避免在数据条目之间插入空行,否则可能影响导入。
  • 确保数值数据(例如成本、时长)在Excel中采用数字格式,在文本文件(CSV、TSV、TXT)中也使用正确格式。
  • 对于CSV、TSV和TXT格式,ProcessMind会自动检测分隔符(逗号、制表符、分号等),并自动处理带引号的文本。

4.工作表选择(仅限Excel文件)

  • 无论工作表名称是什么,ProcessMind都会自动处理Excel文件(XLS、XLSX或XLSB)中的第一个工作表。请将所需的事件日志数据放在第一个工作表中,因为导入时不会处理其他工作表。

5.XES格式

.xes(eXtensible Event Stream)格式是流程挖掘中用于事件日志的标准文件类型。它记录流程实例的详细信息,例如案例ID、活动、时间戳和其他相关属性。

流程挖掘工具广泛支持该格式,非常适合准确还原真实流程行为。

如需技术规范和完整详情,请访问官方XES标准网站

6.Parquet、ORC和JSONL格式

ParquetORC是数据工程管道(Apache Spark、AWS Glue、Databricks等)中广泛使用的列式二进制格式。它们包含嵌入式架构信息,因此ProcessMind无需手动配置即可自动识别列名称和数据类型。

JSONL(JSON Lines,也称为NDJSON)文件每行包含一个JSON对象。每个对象代表一个事件,JSON键会成为列名称。这种格式常用于从API、日志系统或流式平台导出数据。

三种格式都支持:

7.提示

性能提示:使用XLSB格式加快处理

ProcessMind支持上传和处理所有受支持的Excel格式,但Excel文件建议使用XLSB格式。XLSB以二进制格式存储Excel文件,能够显著提升性能,尤其适合大型数据集。与XLS或XLSX格式相比,它的加载和处理速度更快。

大型数据集:使用Parquet或ORC

对于包含数百万行的数据集或自动化数据管道,请使用ParquetORC格式,而不是Excel或CSV。这些列式格式具有更好的压缩和查询性能,并支持持续增长数据集的增量加载。