本文へ移動

FORWARD DEPLOYED ENGINEER

FDE 基礎読本

Databricks と Claude で身につける、FDE の基礎知識

Claude学習ガイド

コストと性能の最適化

プロンプトキャッシュ、Message Batches API、トークン数の事前計算、思考(thinking)の深さの調整を学びます。

概要

Claude API の料金は、入力と出力のトークン数で決まります。同じ内容を毎回送る、急がない処理を一件ずつ送る、といった使い方を見直すと、コストとレイテンシを大きく下げられます。

モデルの世代によって、思考の制御の仕方や、トークンの数え方が変わる点にも注意します。

押さえるべきポイント

  1. 一、プロンプトキャッシュで繰り返す部分を安くする

    毎回送る長いシステムプロンプトや資料に cache_control: {"type": "ephemeral"} を付けると、その部分がキャッシュされます。キャッシュの既定の有効期間は 5 分で、追加料金で 1 時間にもできます。キャッシュからの読み込みは、多くのモデルで通常の入力トークンの 1 割の料金です。

  2. 二、急がない大量の処理は Message Batches API で

    Message Batches API は大量のリクエストを非同期で処理し、通常より 50% 安くなります。多くのバッチは 1 時間以内に終わります。

  3. 三、送る前にトークン数を数える

    POST /v1/messages/count_tokens に送る予定の内容を渡すと、入力トークン数の見積もりが返ります。利用は無料です(専用のレート制限があります)。Claude 4.7 以降のモデルは新しいトークナイザーを使うため、同じ文章でも以前のモデルより 3 割ほど多く数えられることがあります。

  4. 四、思考の深さは adaptive thinking と effort で調整する

    最新のモデルでは thinking: {"type": "adaptive"} を指定し、output_config の effort で思考の深さを調整します。budget_tokens で予算を指定する従来の方式は、Claude 4.6 では非推奨、Claude 4.7 以降では使えません。

重要な用語

用語意味
トークンモデルが文章を処理する単位。料金や上限はトークン数で決まる。
プロンプトキャッシュ繰り返し送るプロンプトの先頭部分をキャッシュして、コストと待ち時間を減らす機能。
Message Batches API大量のリクエストを非同期でまとめて処理する、割安な API。
adaptive thinking問題に応じて、Claude が思考するかどうかと、その量を決める方式。
effort思考の深さなど、応答にかける労力の度合いを指定する設定。

おすすめの教材

いずれも公式の情報です。内容は更新されることがあるため、最新の版を確認してください。

問題で確かめる