イベントログでサポートされているデータ形式
データアップロードでサポートされているファイル
ProcessMindでは、イベントログのアップロードにさまざまなファイル形式を利用できます。すべての形式をアプリのUIとAPIの両方からアップロードできます。
テキスト形式
- .csv:カンマ区切り値。一般的で軽量な形式で、ExcelやERPなど、ほとんどのシステムからエクスポートできます。区切り文字は自動検出されます。
- .tsv:タブ区切り値。CSVと似ていますが、カンマの代わりにタブを使います。データにカンマが含まれる場合に便利です。
- .txt:プレーンテキストファイル。一貫した区切り形式で構造化されていれば利用できます。
- .xes:プロセスマイニングツールで使われるイベントログの標準形式。タイムスタンプとケースIDを含む詳細なアクティビティ追跡に適しています。
Excel形式
- .xls:Excelスプレッドシート形式(旧バージョン)。対応していますが、新しい形式より読み込みに時間がかかる場合があります。
- .xlsx:最新のExcel形式。広く使われており、完全に対応しています。構造化データでは、多くの場合この形式が推奨されます。
- .xlsb:Excelバイナリブック。大規模データセットを.xlsxより高速に読み込めますが、対応範囲はそれほど広くありません。
バイナリ/列指向データ形式
- .parquet:Apache Parquet形式。分析処理向けに最適化された列指向ストレージ形式です。大規模なデータセットに適しており、大量データではCSVより大幅に高速です。増分(差分)アップロードに対応しています。
- .orc:Optimized Row Columnar(ORC)形式。HadoopやSparkのエコシステムで広く使われている、効率的な別の列指向形式です。増分(差分)アップロードに対応しています。
- .jsonl/.ndjson:JSON Lines形式。各行が個別のJSONオブジェクトです。APIやログシステムからデータをストリーミング出力する場合に適しています。増分(差分)アップロードに対応しています。
圧縮ファイル
- .gz:Gzip圧縮ファイル。上記の形式はいずれもGzipで圧縮できます(例:
data.csv.gz、data.parquet.gz)。ProcessMindは内部の形式を自動的に検出し、必要に応じて解凍します。Gzip圧縮を使うと、大きなファイルのアップロード時間を短縮できます。
大規模なデータセットにはParquetを使用:パフォーマンスのヒント
数百万行のデータセットでは、Parquet形式の使用を検討してください。Parquetファイルは列指向で圧縮されており、スキーマ情報も埋め込まれています。そのため、アップロードとクエリが高速になり、ヘッダー行を解析しなくても列を自動検出できます。Parquetは、継続的に増加するデータセット向けの増分(差分)アップロードにも対応しています。
一般的なファイル構造の要件
ProcessMindでプロセスマイニングを正常に実行するには、アップロードするファイル(Excel、テキストベース、XML形式など)が所定の構造要件を満たしている必要があります。これにより、アプリがデータを正しく解釈し、正確に分析できます。
1. ヘッダー行(Excelまたはテキストベース)
- ファイルはヘッダー行で始まり、1行目に配置する必要があります(ExcelファイルではセルA1、CSV、TSV、TXTファイルでは1行目など)。ヘッダーには列名を指定し、各列のデータの種類が明確に分かるようにします(例:「ケースID」「アクティビティ」「タイムスタンプ」)。
- CSV、TSV、TXT形式では、区切り文字と引用符が自動検出されるため、これらの設定を手動で指定せずにデータをアップロードできます。
- ParquetおよびORC形式では、列名とデータ型がファイルに埋め込まれたスキーマから直接読み取られるため、ヘッダー行は必要ありません。
- JSONL/NDJSON形式では、ファイルの1行目にあるJSONキーから列名が生成されます。
2. 最低限必要な属性
プロセスマイニングのイベントログ構造に対応するには、ファイルに少なくとも次の属性(列)が含まれている必要があります。列名(ケースID、アクティビティなど)と一致している必要はありませんが、指定された内容を含める必要があります。
- ケースID:各プロセスインスタンス(ケース)を一意に識別する列です。同じプロセスインスタンスに対応するすべての行には、同じケースIDを設定してください。
- アクティビティ:記録対象の具体的なアクティビティまたはイベントを示す列です(例:「Order Created」「Payment Processed」)。
- タイムスタンプ:各アクティビティには、イベントが発生した正確な日時を示すタイムスタンプが必要です。
- メモ:タイムスタンプの形式は可能な限り自動検出されます。一般的な形式である
yyyy-MM-dd HH:mm:ss、MM/dd/yyyyなども自動的に認識されます。 - 任意の属性:分析の精度を高めるため、次のような追加列を含めることができます。
- リソース:アクティビティを実行した担当者を識別します(例:ユーザー、部門)。
- コスト:アクティビティに関連するコストです。
- その他のカスタムデータ:必須列が存在する限り、対象プロセスに関連するカスタム項目を含めることができます。
必要な列は、分析するプロセスによって異なります。プロセス改善ガイドでは、各プロセスに必要なスキーマ、必須項目、記録するアクティビティ、入力可能なデータテンプレートを説明しています。
3. データの形式
- すべての列でデータ形式が統一されていることを確認してください。
- タイムスタンプは、標準的で認識可能な形式(例:
yyyy-MM-dd HH:mm:ss)にしてください。形式が異なる場合も、ProcessMindは日付形式の自動検出を試みます。 - データ行の間に空白行を入れないでください。インポート処理に影響する可能性があります。
- 数値データ(例:コスト、期間)は、Excelでは数値として、テキストベースのファイル(CSV、TSV、TXT)では正しい形式で指定してください。
- CSV、TSV、TXT形式では、ProcessMindが区切り文字(カンマ、タブ、セミコロンなど)を自動検出し、引用符付きテキストも自動的に処理します。
4. シートの選択(Excelファイルのみ)
- ProcessMindは、Excelファイル(XLS、XLSX、XLSB)の最初のシートから、シート名にかかわらず自動的にデータを処理します。必要なイベントログデータを最初のシートに配置してください。追加のシートはインポート時に処理されません。
5. XES形式
.xes(eXtensible Event Stream)形式は、プロセスマイニングのイベントログに使われる標準的なファイル形式です。ケースID、アクティビティ、タイムスタンプ、その他の関連属性など、プロセスインスタンスに関する詳細情報を記録します。
プロセスマイニングツールで広くサポートされており、実際のプロセスの動作を正確に再現するのに適しています。
技術仕様と詳細については、XES公式標準ウェブサイトをご覧ください。
6. Parquet、ORC、JSONL形式
ParquetとORCは、データエンジニアリングパイプライン(Apache Spark、AWS Glue、Databricksなど)で広く使われている列指向のバイナリ形式です。スキーマ情報が埋め込まれているため、ProcessMindは手動設定なしで列名とデータ型を自動検出します。
JSONL(JSON Lines、NDJSONとも呼ばれます)ファイルには、1行につき1つのJSONオブジェクトが含まれます。各オブジェクトが1つのイベントを表し、JSONキーが列名になります。API、ログシステム、ストリーミングプラットフォームからデータをエクスポートする際によく使われる形式です。
次の3つの形式に共通する特徴:
- UIとProcessMind APIの両方からアップロードできます
- 増分(差分)アップロードに対応しています
- Gzip圧縮(
.gz)に対応しており、転送を高速化できます
7. ヒント
処理を高速化するにはXLSB形式を使用:パフォーマンスのヒント
サポートされているすべてのExcel形式をProcessMindにアップロードして処理できますが、ExcelファイルにはXLSB形式を使用してください。XLSB形式ではExcelファイルがバイナリ形式で保存されるため、特に大規模なデータセットでパフォーマンスが大幅に向上します。XLSやXLSX形式と比べて、読み込みと処理が高速になります。
大規模なデータセットにはParquetまたはORCを使用
数百万行のデータセットや自動化されたデータパイプラインでは、ExcelやCSVではなくParquetまたはORC形式を使用してください。これらの列指向形式は、圧縮率とクエリ性能に優れています。継続的に増加するデータセットの増分読み込みにも対応しています。