はじめに
Databricks のテーブルは、標準で Delta Lake の形式で保存されます。本番で使い続けるには、性能と費用を保つための運用の知識が要ります。
履歴とタイムトラベル
変更はすべて履歴(トランザクションログ)に残るので、過去の版を読んだり、誤った更新から元に戻したりできます。DESCRIBE HISTORY で、だれがいつ何をしたかを確かめられます。
MERGE で差分を反映する
MERGE INTO を使うと、新しいデータと既存のテーブルを突き合わせて、更新・追加・削除をまとめて行えます。業務システムの変更を取り込むときの基本の操作です。
小さなファイルと不要なファイル
取り込みを繰り返すと小さなファイルが増え、読み込みが遅くなります。OPTIMIZE でまとめ、VACUUM で不要になった古いファイルを削除します(既定では 7 日より古いもの)。
liquid clustering と予測的最適化
liquid clustering は、よく絞り込みに使う列でデータを並べ、読み込みを速くする仕組みで、後から並べる列を変えられます。予測的最適化を有効にすると、OPTIMIZE や VACUUM を Databricks が自動で行います。
確認すること
- 誤更新から戻す手順(タイムトラベル)を確かめたか
- 小さなファイルの整理を自動化したか
- よく絞り込む列で liquid clustering を検討したか
公式の情報
2026年10月7日時点の公式の情報をもとにしています。内容は更新されることがあるため、最新の版を確かめてください。
- 公式ドキュメントテーブルの履歴(新しいタブで開きます)
- 公式ドキュメントliquid clustering(新しいタブで開きます)
- 公式ドキュメント予測的最適化(新しいタブで開きます)