事件日志支持的数据格式
数据上传支持的文件格式
ProcessMind支持多种事件日志文件格式。所有格式都可以通过应用界面和API上传。
文本格式
- .csv:逗号分隔值。常见且轻量,大多数系统(Excel、ERP等)都可以导出。分隔符会自动识别。
- .tsv:制表符分隔值。与CSV类似,但使用制表符而非逗号;适合数据中包含逗号的情况。
- .txt:纯文本文件。只要采用一致的分隔格式即可使用。
- .xes:流程挖掘工具使用的事件日志标准格式。适合记录带时间戳和案例ID的详细活动。
Excel格式
- .xls:Excel电子表格格式(旧版本)。支持使用,但加载速度可能比新格式慢。
- .xlsx:现代Excel格式。应用广泛且完全支持,通常更适合结构化数据。
- .xlsb:Excel二进制工作簿。加载速度更快,处理大型数据集的能力优于.xlsx,但兼容性不如其他格式普遍。
二进制/列式数据格式
- .parquet:Apache Parquet格式。针对分析工作负载优化的列式存储格式,适合大型数据集处理大数据时明显快于CSV。支持增量(delta)上传。
- .orc:Optimized Row Columnar(ORC)格式。Hadoop/Spark生态中常用的另一种高效列式格式。支持增量(delta)上传。
- .jsonl / .ndjson:JSON Lines格式。每行都是一个独立的JSON对象,适合从API和日志系统流式导出数据。支持增量(delta)上传。
压缩文件
- .gz:Gzip压缩文件。上述任一格式都可以使用gzip压缩(例如
data.csv.gz、data.parquet.gz)。ProcessMind会自动识别内部格式,并按需解压。使用gzip压缩可以缩短大文件的上传时间。
性能提示:大型数据集使用Parquet
对于包含数百万行的数据集,建议使用Parquet格式。Parquet文件采用列式存储并经过压缩,同时包含嵌入式架构信息,因此上传和查询速度更快,还能自动识别列,无需解析表头行。Parquet还支持持续增长数据集的增量(delta)上传。
通用文件结构要求
要在ProcessMind中成功进行流程挖掘,您上传的文件无论是Excel、文本格式还是XML格式,都必须遵循特定的结构要求。这样可以确保应用正确解析数据并执行准确分析。
1.表头行(Excel或文本格式)
- 文件必须以表头行开头,并位于第一行(例如,Excel文件中的单元格A1,或CSV、TSV、TXT文件中的第1行)。表头定义列名称,并应清楚标明每列的数据类型(例如“Case ID”“Activity”“Timestamp”)。
- 对于CSV、TSV和TXT格式,分隔符和引号会被自动检测,无需手动指定这些设置即可上传数据。
- 对于Parquet和ORC格式,列名称和数据类型会直接从文件内嵌架构中读取,无需表头行。
- 对于JSONL/NDJSON格式,列名称取自文件第一行中的JSON键。
2.最少属性集
为支持流程挖掘事件日志结构,您的文件至少必须包含以下属性(列)。这些属性不必使用Case ID、Activity等列名,但必须包含所规定的内容。
- 案例ID:此列用于唯一标识每个流程实例(或案例)。同一流程实例对应的每一行都必须使用相同的案例ID。
- 活动:此列应描述所记录的具体活动或事件(例如“Order Created”“Payment Processed”)。
- 时间戳:每项活动都必须关联一个时间戳,用于标记事件发生的准确时间或日期。
- 备注:时间戳格式会尽可能自动检测。常见格式(如
yyyy-MM-dd HH:mm:ss、MM/dd/yyyy)及其他格式都会自动识别。 - 可选属性:您可以添加其他列来改进分析,例如:
- 资源:标识执行活动的对象(例如用户、部门)。
- 成本:与活动相关的任何成本。
- 其他自定义数据:只要必需列齐全,您就可以添加与具体流程相关的自定义字段。
具体列取决于您要分析的流程。我们的流程改进指南会说明每个流程所需的架构、需要记录的活动,以及可供您填写的数据模板。
3.数据格式
- 确保所有列中的数据格式保持一致:
- 时间戳应采用标准且可识别的格式(例如
yyyy-MM-dd HH:mm:ss),但如果日期格式不同,ProcessMind会尝试自动检测。 - 避免在数据条目之间插入空行,否则可能影响导入。
- 确保数值数据(例如成本、时长)在Excel中采用数字格式,在文本文件(CSV、TSV、TXT)中也使用正确格式。
- 对于CSV、TSV和TXT格式,ProcessMind会自动检测分隔符(逗号、制表符、分号等),并自动处理带引号的文本。
4.工作表选择(仅限Excel文件)
- 无论工作表名称是什么,ProcessMind都会自动处理Excel文件(XLS、XLSX或XLSB)中的第一个工作表。请将所需的事件日志数据放在第一个工作表中,因为导入时不会处理其他工作表。
5.XES格式
.xes(eXtensible Event Stream)格式是流程挖掘中用于事件日志的标准文件类型。它记录流程实例的详细信息,例如案例ID、活动、时间戳和其他相关属性。
流程挖掘工具广泛支持该格式,非常适合准确还原真实流程行为。
如需技术规范和完整详情,请访问官方XES标准网站。
6.Parquet、ORC和JSONL格式
Parquet和ORC是数据工程管道(Apache Spark、AWS Glue、Databricks等)中广泛使用的列式二进制格式。它们包含嵌入式架构信息,因此ProcessMind无需手动配置即可自动识别列名称和数据类型。
JSONL(JSON Lines,也称为NDJSON)文件每行包含一个JSON对象。每个对象代表一个事件,JSON键会成为列名称。这种格式常用于从API、日志系统或流式平台导出数据。
三种格式都支持:
- 支持通过界面和ProcessMind API上传
- 支持增量(delta)上传
- 可使用gzip压缩(
.gz)以加快传输
7.提示
性能提示:使用XLSB格式加快处理
ProcessMind支持上传和处理所有受支持的Excel格式,但Excel文件建议使用XLSB格式。XLSB以二进制格式存储Excel文件,能够显著提升性能,尤其适合大型数据集。与XLS或XLSX格式相比,它的加载和处理速度更快。
大型数据集:使用Parquet或ORC
对于包含数百万行的数据集或自动化数据管道,请使用Parquet或ORC格式,而不是Excel或CSV。这些列式格式具有更好的压缩和查询性能,并支持持续增长数据集的增量加载。