実践としての AI · 上級

あなたの知識をモデルに接続する:大げさな言葉なしの検索

一行でいうと: モデルはあなたの文書を知らない——各質問に関連するパッセージを見つけてプロンプトに添付する必要がある。

四つのステップ

チャンク化。構造で切る——セクション、見出し、行——そして各チャンクに文書名と見出しパスを保持する。恣意的な切り取りは悪い回答の最も一般的な原因だ。

インデックス化。意味ベースの検索と文字通りの検索を組み合わせることは、特にヘブライ語と識別子でどちらかを単独で使うより優れる。

取得。多くではなく少ない関連チャンク。多くのチャンクはコストが高く、遅くし、ノイズを追加する。

回答。モデルに素材からのみ回答し、ソースを引用し、回答がない場合に明示的にそう言うよう指示する。

落とし穴

取得で忘れられた権限;日付ベースの優先順位なしの矛盾する文書;実際にはデータクエリであるテキスト検索ではない質問;正規化されていないヘブライ語のスペル。

機能していることをどう知るか

二つのステップを別々に測定する:正しいチャンクが結果に現れたか、そしてそれが現れたら——回答は正確か?最終結果のみを測定しても何を修正すべきかわからない。

さらに深く

各々が既知の正しいチャンクを持つ質問のセットを構築し、それが上位五件に現れた頻度を測定する。それがほとんどの改善を駆動する指標だ。検索前の質問の言い換えを追加し、フォローアップの質問のために前のターンのコンテキストを保持する。