本文へ移動

FORWARD DEPLOYED ENGINEER

FDE 基礎読本

Databricks と Claude で身につける、FDE の基礎知識

Databricks学習ガイド

RAG と Databricks AI Search

文書のチャンク化と埋め込み、Databricks AI Search(旧 Vector Search)のインデックス、検索の精度を上げる工夫を学びます。

概要

RAG(検索拡張生成)は、質問に関係する文書を検索して LLM に渡し、その内容に基づいて回答させる手法です。社内文書に基づくチャットボットなどの土台になります。

Databricks では、Databricks AI Search(旧 Vector Search)で文書のインデックスを作り、検索します。

押さえるべきポイント

  1. 一、チャンク化は大きさの調整が肝心

    文書は適切な大きさのチャンクに分けてから埋め込みます。大きすぎると無関係な内容が混ざって検索の精度が落ち、小さすぎると文脈が欠けます。評価しながら調整します。

  2. 二、埋め込みは同じモデルで作る

    文書と質問の埋め込みは、同じ埋め込みモデルで作ります。異なるモデルのベクトルは別の空間にあるため、類似度が意味を持ちません。

  3. 三、Delta Sync Index で自動的に同期する

    Delta Sync Index は、ソースの Delta テーブルの変更をインデックスに同期します。標準エンドポイントでは、ソーステーブルでチェンジデータフィードを有効にしておく必要があります。手動で更新する Direct Vector Access Index もあります。

  4. 四、リランキングで上位の精度を上げる

    候補を多めに取得し、より精度の高いモデルで質問との関連度を計算し直して並べ替えると、上位に返る結果の質を上げられます。

重要な用語

用語意味
RAG検索した文書を LLM に渡して、その内容に基づいて回答させる手法。
チャンク検索しやすい大きさに分けた、文書の断片。
埋め込み(エンベディング)文章の意味を数値のベクトルで表したもの。
Databricks AI SearchDatabricks に組み込まれた検索の仕組み(旧 Vector Search)。
チェンジデータフィードDelta テーブルの行レベルの変更を記録する機能。
リランキング取得した候補を、より精度の高い方法で並べ替えること。

おすすめの教材

いずれも公式の情報です。内容は更新されることがあるため、最新の版を確認してください。

問題で確かめる