はじめに
Databricks のデータの流れは、Lakeflow という名前の3つの機能で組み立てます。どれを何に使うかが分かると、設計の会話がしやすくなります。
取り込む: Lakeflow Connect
業務システムや SaaS、データベースからデータを取り込むための、用意された接続(コネクタ)です。自分で取り込みの処理を書かずに済みます。
変換する: Lakeflow パイプライン
Spark Declarative Pipelines(旧 Delta Live Tables)にもとづく、宣言的なパイプラインです。「どんなテーブルを作りたいか」を書くと、処理の順番や増分の更新は Databricks が管理します。
エクスペクテーション(期待する条件)を書くと、条件に合わないデータを記録したり、取り除いたりできます。
実行を管理する: Lakeflow Jobs
ノートブック・パイプライン・SQL などのタスクを、依存関係を付けて順番に実行し、スケジュールや失敗時の再実行を管理します。
メダリオンアーキテクチャ
取り込んだままの Bronze、整えた Silver、業務で使う形に集計した Gold、の3段に分けるのが定番の設計です。どの段で何を保証するかを決めておくと、品質の問題を追いやすくなります。
確認すること
- 取り込み・変換・実行の役割を分けたか
- Bronze・Silver・Gold の役割を決めたか
- データの品質の条件(エクスペクテーション)を書いたか
- 失敗時の通知と再実行を設定したか
公式の情報
2026年10月7日時点の公式の情報をもとにしています。内容は更新されることがあるため、最新の版を確かめてください。
- 公式ドキュメントLakeflow Connect(新しいタブで開きます)
- 公式ドキュメントLakeflow パイプライン(新しいタブで開きます)
- 公式ドキュメントLakeflow Jobs(新しいタブで開きます)