本文へ移動

FORWARD DEPLOYED ENGINEER

FDE 基礎読本

Claude と Databricks の最新動向と、FDE の基礎知識

Databricks基礎知識

Lakeflow でデータパイプラインを作る

取り込み(Lakeflow Connect)・変換(Lakeflow パイプライン)・実行の管理(Lakeflow Jobs)の役割分担。

はじめに

Databricks のデータの流れは、Lakeflow という名前の3つの機能で組み立てます。どれを何に使うかが分かると、設計の会話がしやすくなります。

取り込む: Lakeflow Connect

業務システムや SaaS、データベースからデータを取り込むための、用意された接続(コネクタ)です。自分で取り込みの処理を書かずに済みます。

変換する: Lakeflow パイプライン

Spark Declarative Pipelines(旧 Delta Live Tables)にもとづく、宣言的なパイプラインです。「どんなテーブルを作りたいか」を書くと、処理の順番や増分の更新は Databricks が管理します。

エクスペクテーション(期待する条件)を書くと、条件に合わないデータを記録したり、取り除いたりできます。

実行を管理する: Lakeflow Jobs

ノートブック・パイプライン・SQL などのタスクを、依存関係を付けて順番に実行し、スケジュールや失敗時の再実行を管理します。

メダリオンアーキテクチャ

取り込んだままの Bronze、整えた Silver、業務で使う形に集計した Gold、の3段に分けるのが定番の設計です。どの段で何を保証するかを決めておくと、品質の問題を追いやすくなります。

確認すること

  • 取り込み・変換・実行の役割を分けたか
  • Bronze・Silver・Gold の役割を決めたか
  • データの品質の条件(エクスペクテーション)を書いたか
  • 失敗時の通知と再実行を設定したか

公式の情報

2026年10月7日時点の公式の情報をもとにしています。内容は更新されることがあるため、最新の版を確かめてください。