概要
生成AIのアプリを本番で運用するには、モデルを提供する仕組み、ツールを使うエージェント、品質を測る評価、利用を管理するガバナンスが必要です。
生成AIエンジニアの資格では、アプリケーションの開発(30%)と、アプリの組み立てとデプロイ(22%)が、特に配点の大きい分野です。
押さえるべきポイント
一、モデルを提供する(Model Serving)
Model Serving は、モデルをリアルタイム推論とバッチ推論の両方で使えるようにする仕組みです。基盤モデルはトークン従量課金ですぐに使え、性能の保証が必要な本番のワークロードでは、プロビジョンドスループットを使います。
二、SQL からまとめて推論する(ai_query)
ai_query() 関数を使うと、SQL からテーブルの各行に対してモデルを呼び出せます。結果をテーブルに保存すれば、バッチ推論のパイプラインになります。
三、ツールは Unity Catalog の関数として管理できる
エージェントが使うツールを Unity Catalog の関数として定義すると、誰が実行できるかをほかのデータ資産と同じように管理でき、複数のエージェントで再利用しやすくなります。
四、MLflow で評価し、トレースで原因を探す
評価用のデータセットと LLM ジャッジ(スコアラー)を組み合わせると、根拠性や関連性を、多くの質問で継続的に測れます。MLflow Tracing は、LLM やツールの呼び出しを入出力や所要時間つきで記録し、デバッグに役立ちます。
五、Unity Gateway で利用を管理する
Unity Gateway(旧 AI Gateway)では、レート制限、利用状況の監視、リクエストとレスポンスの Unity Catalog の Delta テーブルへの記録、予算の管理などを一元的に行えます。
六、プロンプトインジェクションに備える
取得した文書やツールの結果に含まれる指示は、信頼できないデータとして扱います。エージェントが実行できる操作は、必要最小限の権限に絞ります。
重要な用語
| 用語 | 意味 |
|---|---|
| プロビジョンドスループット | 性能を保証するために、推論の処理能力を確保して使う利用形態。 |
| ai_query | SQL からサービングエンドポイントのモデルを呼び出す関数。 |
| MLflow Tracing | LLM アプリの各ステップの入出力や所要時間を記録する機能。 |
| LLM ジャッジ | LLM を使って回答の品質を自動で評価する方法。 |
| Unity Gateway | 生成AIの利用を一元管理する Databricks のガバナンス機能(旧 AI Gateway)。 |
| プロンプトインジェクション | 外部の文章に紛れた指示で、AI の振る舞いを乗っ取ろうとする攻撃。 |
おすすめの教材
いずれも公式の情報です。内容は更新されることがあるため、最新の版を確認してください。
- 公式ドキュメントModel Serving(Databricks ドキュメント)(新しいタブで開きます)
- 公式ドキュメントAI Functions と ai_query(Databricks ドキュメント)(新しいタブで開きます)
- 公式ドキュメントエージェント(Databricks ドキュメント)(新しいタブで開きます)
- 公式ドキュメントMLflow による生成AIの品質管理(Databricks ドキュメント)(新しいタブで開きます)
- 公式ドキュメントUnity Gateway(Databricks ドキュメント)(新しいタブで開きます)
問題で確かめる
- Generative AI Engineer Associate 問題集分野:モデル提供、エージェントとツール、評価・安全性・ガバナンス(7問)この分野を解く