数据问题排查
数据问题排查
数据问题通常会以特定方式显现:案例被拆分、事件顺序错误、步骤缺失,或数值看起来不可能。本页将从症状追溯原因,再从原因找到解决方法:能通过ProcessMind中的设置解决的,在平台内处理;必须从源头解决的,则在数据提取环节处理。
如需了解完整的数据准备工作流,包括合格数据的特征及其准备方法,请参阅数据清理与准备。如需了解平台对数据执行的检查,请参阅数据质量。
首先检查
在深入检查源文件之前,先查看ProcessMind已经提供的信息:
- 面板上方的红色列表。在数据集的常规选项卡中,红色列表会列出阻碍项:缺少案例ID、活动或结束时间,活动没有数据,属性没有值,或重新上传的文件与其加载时使用的流程类型不匹配。先从这里开始。
- **质量徽章和面板。**评分涵盖缺失值、不一致值和时间戳问题;面板会进一步拆分为数据新鲜度、属性覆盖率和活动分析。
- **AI数据建议。**系统会扫描数据集,列出发现的问题,并建议映射和修复方法。
- **数据集属性。**无需重新导出数据,即可设置显示名称、数据类型和时间戳格式,或隐藏某一列。
大多数问题都归结为三个字段
案例ID用于标识流程实例,活动用于命名步骤,结束时间用于确定其在时间线上的位置。开始时间、用户、成本和tCO₂e用于补充上下文。将某个必需字段映射到错误的列,后续所有结果都会出错。
流程图中的症状
案例被拆分为多个案例
*您会看到:*一个流程实例显示为许多只有一两个步骤的短案例,因此流程图呈现为一排平铺的活动。
*原因:*映射为案例ID的列标识的是比流程实例更小的对象,例如行项目、发票编号,或某个系统中的单据编号。
*解决方法:*映射能够标识完整实例的列,例如订单、工单或索赔。如果没有单个列可以完成标识,则需要在上游完成统一:在SQL或ETL作业中合并标识符,使同一实例的每个事件都携带相同的案例ID,然后重新上传。各系统的命名约定请参阅数据来源。
事件顺序错误
*您会看到:*后发生的活动出现在先发生的活动之前,例如发票日期早于订单日期。
*原因:*通常有三个原因。时间戳使用了错误的格式解析(03/04/2025值被读作3月4日,而不是4月3日)。来自不同时区系统的事件未经转换就被混合。或者,错误的列被映射为时间字段。
解决方法:检查格式和数据集属性,并确认类型为时间戳而不是文本。合并导出数据前,将所有来源转换为同一时区;按时间戳对每个案例排序,并抽查几个案例的完整过程。
步骤缺失
*您会看到:*流程图跳过了一个确定发生过的步骤。
*原因:*该步骤没有在数据中留下记录(例如电话审批或纸质签名),活动从未完成映射,或筛选器将其从视图中移除了。
解决方法:对于实际存在但未被记录的步骤,将活动标记为数据流经步骤,使其保持可见;其余活动使用活动映射与取消映射完成映射。未映射的活动会以半透明显示,并通过虚线连接。然后检查哪些筛选器处于启用状态。
案例始终未结束
*您会看到:*许多案例在到达结束事件前就停止了。
*原因:*导出数据在案例仍在运行时就截止于某个日期,模型没有结束事件,或结束活动不在数据集中。
*解决方法:*为模型设置真实的结束事件,或接受开放案例,并将其排除在时间分析之外。时间指标只统计已关闭的案例。尚未完成的案例不一定是数据错误。
计数看起来偏高
*您会看到:*某个活动的执行次数异常频繁,或案例数高于业务报告中的数量。
*原因:*存在重复行,同一事件可能被集成流程或重复提取记录了两次。
*解决方法:*上传前,按案例ID、活动和时间戳去重;准备工作流介绍了重复提取通常产生的原因。
流程图过于杂乱
*您会看到:*数百个活动,其中大多数属于技术活动。
*原因:*登录、重试和后台作业与业务步骤位于同一份数据提取结果中。
*解决方法:*隐藏不参与分析的属性,筛选掉不属于流程的事件,并将低层级事件归入所属活动。详细程度与噪声之间的界限,应由流程专家决定。
多个系统的数据无法对齐
*您会看到:*流程中出现了本应由某个系统提供数据的缺口。
*原因:*系统在不同时间提取数据,对同一步骤使用了不同名称,或完全遗漏了某份数据提取结果。
*解决方法:*合并数据前,统一提取时间范围和活动词汇,并通过主要数据集和比较数据集为每个数据集指定角色,而不是直接拼接彼此不一致的文件。
数据集中的症状
上传被拒绝
*您会看到:*上传以错误结束,或文件被加载为单列。
*原因:*文件不符合某项结构要求。常见问题包括缺少表头行(表头应位于第一行)、数据条目之间存在空行、数字以文本形式存储,以及数据位于第二个工作表的Excel文件。系统只读取第一个工作表。
*解决方法:*将表头放在第1行,删除空行,确保数字以数字格式存储,并将事件数据移到第一个工作表。CSV、TSV和TXT中的分隔符与引号会自动检测,因此单列结果通常表示文件无法正确解析。请将其重新导出为CSV或Parquet。
列或类型错误
*您会看到:*某一列缺失,或时间戳被识别为文本。
*原因:*文件自上次上传后发生了变化,或系统错误识别了数据类型。
*解决方法:*手动设置数据类型和格式,或隐藏该列。替换文件后,检查红色列表,确认新文件与其加载到的数据集是否匹配。
无法识别时间戳
*您会看到:*时间戳列为空,或计算出的持续时间过长。
*原因:*格式特殊、日期和月份顺序因地区设置不同、同一列中混用了秒和毫秒精度,或时区转换被执行了两次。
*解决方法:*在数据集属性中明确设置格式,在源系统拆分不同精度的导出数据,并在上传前统一使用一个时区。
值为空
您会看到:质量面板中的属性覆盖率存在缺口,或图表中出现空值类别。
*原因:*源系统没有为每个案例记录该值,或导出过程丢弃了空字段。
*解决方法:*在可行的情况下从源头补齐缺失值;如果空值可以替换为合理的默认值,则在计算属性中使用空值处理函数。
活动名称不一致
您会看到:“批准订单”和“订单审批”被列为两个含义相同的活动,或同一步骤在不同国家使用了不同名称。
*原因:*每个源系统都为同一项工作使用自己的名称。
*解决方法:*为每个步骤确定一个统一名称,然后在数据提取结果中规范化这些值,或添加计算属性,将不同名称映射为一个名称,再据此映射活动。
数值中的症状
平均值看起来过低
*您会看到:*平均案例持续时间与业务认知中的合理值不符。
*原因:*时间指标只统计已关闭的案例,因此未完成的案例会被排除;而已完成的案例通常处理较快,尤其是在较近的时间段内。
*解决方法:*确保比较对象一致。将时间范围限定为有足够时间完成的案例;在根据单个平均值得出结论前,先阅读时间指标中的定义;同时查看分布,而不是只看平均值。
平均值受异常值影响过大
*您会看到:*平均值远高于典型案例。
*原因:*少数极端案例拉高了平均值;有时它们是真实例外,有时则是数据错误。
*解决方法:*查看慢案例尾部,即比较P90与中位数,而不是只看平均值;确认极端案例是否真实,并且只排除确实错误的数据。罕见但真实的例外也可能提供洞察。时间指标介绍了每项度量。
比较没有显示结果
您会看到:比较数据集显示不存在(0个案例,覆盖率为0%)。
*原因:*当前筛选器或所选时间段中没有该数据集的案例,或者其活动尚未映射到模型。
*解决方法:*扩大时间范围,检查比较数据集的映射,并确认哪个数据集是主要数据集。
问题源于数据规模
有些问题不是数据错误,而是规模问题:
- 上传缓慢:优先使用Parquet或ORC;对于Excel文件,优先使用XLSB而不是XLSX。请参阅支持的数据格式。
- 文件不断增长:使用增量上传追加新的时间段,而不是替换整个文件。
- 分析缓慢:删除无人分析的列;查找异常时筛选掉正常路径;一次只查看一个时间段或一个区域。性能指南说明了不同数据规模带来的成本。
- 可以归档的数据集:归档不再分析的数据,让工作空间只保留您实际需要采取行动的数据。
从源头修复
在ProcessMind内部完成修复可以避免一次双向导入导出,但有些问题只能在上游消除:缺少源系统、时区混用,或没有任何导出能够统一的标识符。这些问题应在数据提取环节解决;如果反复出现,则应在生成数据提取结果的系统中解决。各系统的数据来源请参阅数据来源;有关保持数据提取结果可靠的实践,请参阅面向流程挖掘的ETL。
仍未解决?
如果上述检查无法解释您看到的情况,请联系支持团队,并提供数据集名称、您正在查看的案例、预期结果以及实际结果。附上流程图和质量面板的截图,通常比文字描述更快定位问题。