本文へ移動

FORWARD DEPLOYED ENGINEER

FDE 基礎読本

Claude と Databricks の最新動向と、FDE の基礎知識

Databricks基礎知識

Delta Lake の運用

履歴とタイムトラベル、MERGE、小さなファイルの整理、liquid clustering と予測的最適化。

はじめに

Databricks のテーブルは、標準で Delta Lake の形式で保存されます。本番で使い続けるには、性能と費用を保つための運用の知識が要ります。

履歴とタイムトラベル

変更はすべて履歴(トランザクションログ)に残るので、過去の版を読んだり、誤った更新から元に戻したりできます。DESCRIBE HISTORY で、だれがいつ何をしたかを確かめられます。

MERGE で差分を反映する

MERGE INTO を使うと、新しいデータと既存のテーブルを突き合わせて、更新・追加・削除をまとめて行えます。業務システムの変更を取り込むときの基本の操作です。

小さなファイルと不要なファイル

取り込みを繰り返すと小さなファイルが増え、読み込みが遅くなります。OPTIMIZE でまとめ、VACUUM で不要になった古いファイルを削除します(既定では 7 日より古いもの)。

liquid clustering と予測的最適化

liquid clustering は、よく絞り込みに使う列でデータを並べ、読み込みを速くする仕組みで、後から並べる列を変えられます。予測的最適化を有効にすると、OPTIMIZE や VACUUM を Databricks が自動で行います。

確認すること

  • 誤更新から戻す手順(タイムトラベル)を確かめたか
  • 小さなファイルの整理を自動化したか
  • よく絞り込む列で liquid clustering を検討したか

公式の情報

2026年10月7日時点の公式の情報をもとにしています。内容は更新されることがあるため、最新の版を確かめてください。