本文へ移動

FORWARD DEPLOYED ENGINEER

FDE 基礎読本

Claude と Databricks の最新動向と、FDE の基礎知識

Claude基礎知識

コストと速さの最適化

プロンプトキャッシュ・Batch・モデルの使い分け・effort で、品質を保ったまま費用と待ち時間を下げる。

はじめに

本番で使い始めると、費用と応答の速さが問題になります。品質を測りながら、次の手を順に試します。

プロンプトキャッシュ

長いシステムプロンプトや資料など、毎回同じ前半部分を送る場合に効きます。キャッシュの持続は 5 分(既定)か 1 時間で、キャッシュからの読み込みは通常の入力の料金の約 1 割で済みます(Opus 5.5 は 5%)。

キャッシュは前半部分が一致しないと効かないので、変わらない部分を先頭に、変わる部分を後ろに置きます。

Message Batches API

すぐに結果がいらない大量の処理は、Batch でまとめて送ると料金が半額になります。夜間の一括処理や、評価用のデータの採点などに向きます。

モデルと effort の使い分け

簡単な分類や抽出は Haiku 4.5 のような速くて安いモデルで足りることが多くあります。難しい部分だけを高性能なモデルに回す構成も有効です。

考える深さは effort で調整できます。effort を下げると、速く安くなる代わりに、難しい問題での精度が下がることがあります。

送る前に数える

トークン数を数える API(count_tokens)は無料です。送る前に入力の大きさを確かめ、費用の見積もりや、上限を超えないかの確認に使えます。

確認すること

  • 変わらない前半部分にキャッシュを使ったか
  • 急がない処理を Batch にしたか
  • 安いモデルで足りる部分を見つけたか
  • 変更のたびに品質を評価したか

公式の情報

2026年10月7日時点の公式の情報をもとにしています。内容は更新されることがあるため、最新の版を確かめてください。