概要
取り込んだデータは、品質を整え、分析しやすい形に変換して届けます。その段階を整理する考え方が、メダリオンアーキテクチャです。
変換の処理は Lakeflow のパイプライン(旧 Delta Live Tables)で宣言的に書き、Lakeflow ジョブで定期実行や依存関係を管理します。
押さえるべきポイント
一、メダリオンアーキテクチャ(Bronze・Silver・Gold)
Bronze に生データを保存し、Silver で重複の除去・型の整形・不正値のクレンジング・結合を行い、Gold でビジネス向けの集計を作るのが一般的な役割分担です。
二、エクスペクテーションでデータの品質を管理する
パイプラインでは CONSTRAINT 名 EXPECT (条件) で品質のルールを宣言します。ON VIOLATION を指定しなければ、違反した行も書き込まれて件数が記録されます。DROP ROW なら違反した行を捨て、FAIL UPDATE なら更新を失敗させます。
三、ジョブでタスクの依存関係を管理する
Lakeflow ジョブでは、複数のタスクの実行順序や依存関係、スケジュールを定義できます。途中のタスクが失敗したときは、修復実行(Repair run)で、失敗したタスクとその下流だけを再実行できます。
四、運用では監視と最適化も欠かせない
本番の処理では、実行の履歴やイベントログで失敗の原因を調べ、テーブルの OPTIMIZE などで性能を保ちます。最新の試験ガイドでは、トラブルシューティング・監視・最適化が独立した分野になっています。
重要な用語
| 用語 | 意味 |
|---|---|
| メダリオンアーキテクチャ | データを Bronze(生)・Silver(整形済み)・Gold(集計済み)の段階で管理する設計。 |
| Lakeflow パイプライン | データの変換を宣言的に書ける Databricks のパイプライン(旧 Delta Live Tables)。 |
| エクスペクテーション | パイプラインで宣言する、データ品質のルール。 |
| Lakeflow ジョブ | タスクの実行順序やスケジュールを管理する、Databricks のワークフローの仕組み。 |
| 修復実行(Repair run) | 失敗したタスクとその下流だけを、再実行する機能。 |
おすすめの教材
いずれも公式の情報です。内容は更新されることがあるため、最新の版を確認してください。
- 公式ドキュメントメダリオンアーキテクチャ(Databricks ドキュメント)(新しいタブで開きます)
- 公式ドキュメントLakeflow パイプライン(Databricks ドキュメント)(新しいタブで開きます)
- 公式ドキュメントパイプラインのエクスペクテーション(Databricks ドキュメント)(新しいタブで開きます)
- 公式ドキュメントLakeflow ジョブ(Databricks ドキュメント)(新しいタブで開きます)
問題で確かめる
- Data Engineer Associate 問題集分野:パイプラインと処理、ジョブと運用(4問)この分野を解く