はじめに
生成 AI の仕組みは、プロンプトやモデルを少し変えるだけで結果が変わります。評価の仕組みがないと、改善したのか悪化したのか分かりません。
成功の基準を先に決める
「正しく分類できる割合が 9 割以上」「回答に必ず出典が付く」のように、測れる基準を決めます。お客さまと合意しておくと、PoC の判断もしやすくなります。
評価用のデータを作る
実際の業務に近い入力と、期待する答えを組にして集めます。よくある例だけでなく、まれで境界的な例(エッジケース)や、断るべき依頼も入れます。
採点のしかたは3種類
コードで判定する(完全一致・形式のチェックなど)は速くて確実です。言い回しの自由な答えは、採点の基準表(ルーブリック)を渡して、別のモデルに採点させる方法もあります。最終的な品質の確認や、採点の妥当性の確認には、人による評価を組み合わせます。
変更のたびに回す
プロンプトやモデルを変えるたびに評価を回し、以前より悪くなっていないか(回帰)を確かめます。CI に組み込むと、確認の漏れを防げます。
確認すること
- 測れる成功の基準があるか
- エッジケースを含む評価用データがあるか
- 採点のしかたを決めたか
- 変更のたびに評価を回す仕組みがあるか
公式の情報
2026年10月7日時点の公式の情報をもとにしています。内容は更新されることがあるため、最新の版を確かめてください。
- 公式ドキュメント成功の基準と評価の作り方(新しいタブで開きます)