セキュリティ · 上級

モデルベースシステムのセキュリティ

一行でいうと: モデルは二つの新しいリスクを追加する:指示として解釈される外部コンテンツ、チェックなしに機密な場所に届く出力。

プロンプトインジェクション

システムが読むテキストすべて——メール、ウェブサイト、文書、コメント——が指示を含む可能性がある。モデルはあなたの指示と指示のように見えるテキストを区別しない。

ルール:外部コンテンツはデータであり、決してコマンドではない。それから派生する影響のあるアクションは人間の承認またはコードの厳格なルールが必要だ。

出力を入力として

システムがモデルが生成したものを実行、送信、または保存するなら、出力を信頼されていない入力として扱う:スキーマバリデーション、文字エスケープ、許可されたアクションのリスト。クエリを生成するモデルは幅広い権限を持つデータベースに直接実行すべきではない。

反対方向の漏洩

プロンプトで送信された機密情報、ユーザーが見ることを許可されていない取得されたチャンク。権限フィルタリングは取得ステージで起きなければならず、システムプロンプトはシークレットではない——モデルにそれを明かさせることができる。

さらに深く

テストの一部として敵対的なシナリオのセットを実行する:隠された指示を持つ文書、指示を抽出しようとする試み、権限を広げようとする入力。回帰として保持する。モデルまたはプロンプトの変更は閉じていたものを再び開く可能性があるからだ。