本文へ移動

FORWARD DEPLOYED ENGINEER

FDE 基礎読本

Claude と Databricks の最新動向と、FDE の基礎知識

Claude基礎知識

評価の作り方

「良くなったか」を感覚ではなく数字で判断するための、評価用データと採点の作り方。

はじめに

生成 AI の仕組みは、プロンプトやモデルを少し変えるだけで結果が変わります。評価の仕組みがないと、改善したのか悪化したのか分かりません。

成功の基準を先に決める

「正しく分類できる割合が 9 割以上」「回答に必ず出典が付く」のように、測れる基準を決めます。お客さまと合意しておくと、PoC の判断もしやすくなります。

評価用のデータを作る

実際の業務に近い入力と、期待する答えを組にして集めます。よくある例だけでなく、まれで境界的な例(エッジケース)や、断るべき依頼も入れます。

採点のしかたは3種類

コードで判定する(完全一致・形式のチェックなど)は速くて確実です。言い回しの自由な答えは、採点の基準表(ルーブリック)を渡して、別のモデルに採点させる方法もあります。最終的な品質の確認や、採点の妥当性の確認には、人による評価を組み合わせます。

変更のたびに回す

プロンプトやモデルを変えるたびに評価を回し、以前より悪くなっていないか(回帰)を確かめます。CI に組み込むと、確認の漏れを防げます。

確認すること

  • 測れる成功の基準があるか
  • エッジケースを含む評価用データがあるか
  • 採点のしかたを決めたか
  • 変更のたびに評価を回す仕組みがあるか

公式の情報

2026年10月7日時点の公式の情報をもとにしています。内容は更新されることがあるため、最新の版を確かめてください。