概要
Claude API の料金は、入力と出力のトークン数で決まります。同じ内容を毎回送る、急がない処理を一件ずつ送る、といった使い方を見直すと、コストとレイテンシを大きく下げられます。
モデルの世代によって、思考の制御の仕方や、トークンの数え方が変わる点にも注意します。
押さえるべきポイント
一、プロンプトキャッシュで繰り返す部分を安くする
毎回送る長いシステムプロンプトや資料に cache_control: {"type": "ephemeral"} を付けると、その部分がキャッシュされます。キャッシュの既定の有効期間は 5 分で、追加料金で 1 時間にもできます。キャッシュからの読み込みは、多くのモデルで通常の入力トークンの 1 割の料金です。
二、急がない大量の処理は Message Batches API で
Message Batches API は大量のリクエストを非同期で処理し、通常より 50% 安くなります。多くのバッチは 1 時間以内に終わります。
三、送る前にトークン数を数える
POST /v1/messages/count_tokens に送る予定の内容を渡すと、入力トークン数の見積もりが返ります。利用は無料です(専用のレート制限があります)。Claude 4.7 以降のモデルは新しいトークナイザーを使うため、同じ文章でも以前のモデルより 3 割ほど多く数えられることがあります。
四、思考の深さは adaptive thinking と effort で調整する
最新のモデルでは thinking: {"type": "adaptive"} を指定し、output_config の effort で思考の深さを調整します。budget_tokens で予算を指定する従来の方式は、Claude 4.6 では非推奨、Claude 4.7 以降では使えません。
重要な用語
| 用語 | 意味 |
|---|---|
| トークン | モデルが文章を処理する単位。料金や上限はトークン数で決まる。 |
| プロンプトキャッシュ | 繰り返し送るプロンプトの先頭部分をキャッシュして、コストと待ち時間を減らす機能。 |
| Message Batches API | 大量のリクエストを非同期でまとめて処理する、割安な API。 |
| adaptive thinking | 問題に応じて、Claude が思考するかどうかと、その量を決める方式。 |
| effort | 思考の深さなど、応答にかける労力の度合いを指定する設定。 |
おすすめの教材
いずれも公式の情報です。内容は更新されることがあるため、最新の版を確認してください。
- 公式ドキュメントプロンプトキャッシュ(公式ドキュメント)(新しいタブで開きます)
- 公式ドキュメントバッチ処理(公式ドキュメント)(新しいタブで開きます)
- 公式ドキュメントトークン数の計算(公式ドキュメント)(新しいタブで開きます)
- 公式ドキュメント拡張思考と adaptive thinking への移行(公式ドキュメント)(新しいタブで開きます)
問題で確かめる
- Claude API 問題集分野:コストと性能、発展機能(4問)この分野を解く