検索拡張生成(RAG)において、検索された文書内の誤情報がモデルの最終出力に影響を与える知識汚染攻撃への脆弱性が問題となっている。モデルは文書内の誤情報を正しく検知できたとしても、回答を合成する際にその誤情報に引きずられてしまうという課題がある。従来の対策であるコードン原則は、回答生成を担うモデルが未検証の証拠に直接アクセスすることを禁じる厳格な隔離を行うが、計算コストの増大やシステムの柔軟性の低下を招く。
従来の厳格な隔離手法に代わり、熟考的なSystem 2思考が可能なエージェントのみに信頼できない文書へのアクセスを許可するという、より洗練されたセキュリティ原則を提案した。また、誤情報の検知と、その後の回答への影響の乖離を定量化するCordon Rateと、明示的な無視指示に対する耐性を測るContamination Rateという2つの新しい評価指標を導入した。
Cordon Rateは、モデルが誤情報を検知したにもかかわらず、最終的な回答がその誤情報に影響された事例の割合を算出する。Contamination Rateは、外部知識を無視するよう明示的に指示した場合でも、モデルが暗黙的に誤情報に引きずられる度合いを、外部知識を一切与えない場合と比較することで測定する。汚染データの生成には、正解と矛盾する一文を作成し、それを500語程度の文章に拡張する手法を用いる。
BEIRベンチマークのSciFact、FiQA、MS-MARCOの各サブセットを用い、標準的なDeepSeek-Chatと推論強化型のDeepSeek-Reasonerを比較した。SciFactにおいて、DeepSeek-ChatのContamination Rateは0.25であったのに対し、DeepSeek-Reasonerは0.12へと抑制された。また、Cordon Rateにおいて、DeepSeek-ReasonerはSciFactおよびFiQAで0となり、DeepSeek-ChatがSciFactで0.175、FiQAで0.025を示した。
知識集約的な科学的事実の検証のような複雑なタスクほど、モニタリング・コントロール・ギャップが顕著になり、脆弱性が高まる。この現象は、マルチエージェントシステムにおいて、あるエージェントが誤情報を検知しても、受信側のエージェントのSystem 1メカニズムが無意識に影響を受けるリスクを示唆している。今後の課題として、エージェントのアーキテクチャにおける検知と合成の分離手法や、このギャップがハルシネーションの種類やドメインによってどのように変化するかを調査する必要がある。
検索拡張生成(RAG)は、検索された文書内の誤情報がモデルの最終出力に影響を与える知識汚染攻撃に対して脆弱である。従来のCordon Principleは、最終回答を合成するモデルが未検証の証拠に直接アクセスすることを禁止する厳格な隔離を行うが、これには多大な計算コストを伴う。本研究では、熟考的なSystem 2推論が可能なエージェントのみが信頼できない文書へのアクセスを許可するという、より洗練されたセキュリティ原則を提案している。評価のために、誤情報の検出能力とそれが下流タスクに与える影響の乖離を定量化する新しい指標を導入した。最先端の推論能力を持つ言語モデルと標準的な言語モデルを比較した実験の結果、推論能力の高いモデルは、Cordon Principleによる厳格な隔離を必要とせずとも、汚染された証拠に対して大幅に高い堅牢性を示すことが明らかになった。
RAG(検索拡張生成)における知識汚染攻撃は、悪意のある文書がモデルの回答を操作する深刻な脆弱性であり、モデルが汚染を検知しても回答生成時にその影響を受けてしまう問題があります。従来の対策である「コードン原則」は、回答生成を行うエージェントが未検証の証拠に直接アクセスすることを禁じる厳格な隔離手法ですが、計算コストの増大や柔軟性の欠如が課題でした。本研究では、連合的なパターンマッチングのみに頼るエージェントは隔離し、熟考的なSystem 2思考が可能なエージェントにのみ未検証文書へのアクセスを許可するという、洗練された原則を提案します。この原則を検証するため、汚染を検知したにもかかわらず影響を受けてしまう度合いを示すCordon Rateと、無視する意図があるにもかかわらず汚染される度合いを示すContamination Rateという2つの新しい評価指標を導入しました。実験の結果、System 2思考能力を持つエージェントは、厳格な隔離を行わなくても高い堅牢性を維持できることが示されました。
本研究は、言語モデルが誤情報を検知しても回答生成時にその影響を排除できない「モニタリング・コントロール・ギャップ」という問題に対し、System 2(遅い思考)的な推論能力の欠如が根本原因であるという仮説を立てている。この問題を定量化するため、まずCordon Rateという指標を導入しており、これはモデルが誤情報を正しく検知したにもかかわらず、最終的な回答がその誤情報に影響されてしまった事例の割合を、有効なサンプル全体に対して算出するものである。次に、明示的にコンテキストを無視するよう指示した場合でも、モデルが暗黙的に誤情報に引きずられる度合いを測るContamination Rateを定義しており、これは外部知識なしの回答と、外部知識を無視するよう指示した回答を比較することで、モデルのパラメータ知識による影響を排除して評価する。毒性データの生成には、正解と矛盾する一文を作成し、それを500語程度の文章に拡張するという単純な手法を用いており、高度な攻撃への耐性を試すのではなく、System 2推論能力の有無が誤情報への脆弱性にどう直結するかを分離して検証することを目的としている。
本実験では、推論能力(System 2思考)を持つエージェントが信頼できない文書にアクセスした際の安全性と、文脈による影響を検証しています。BEIRベンチマークのSciFact、FiQA、MS-MARCOの各サブセットを用い、標準的なDeepSeek-Chatと推論強化型のDeepSeek-Reasonerを比較しています。評価指標として、誤情報に影響される割合を示すcordon rateと、無視するよう指示しても文脈に引きずられる度合いを示すContamination Rateを算出しました。実験の結果、SciFactにおいてDeepSeek-Chatは0.25というContamination Rateを示したのに対し、DeepSeek-Reasonerは0.12へと抑制されており、推論能力が文脈による汚染を軽減することが示されました。また、これらの影響はMS-MARCOのようなオープンドメインの検索タスクよりも、SciFactのような知識集約的な科学的事実検証タスクにおいて顕著に現れます。問題の複雑さが増すほど、モデルの脆弱性が高まり、監視と制御のギャップが拡大することが明らかになりました。
本研究は、信頼できない文書へのアクセスは、システム2の思考能力を持つエージェントのみに限定すべきであるという、RAGにおける新たなセキュリティ原則を提案している。提案した隔離率と汚染率という指標を用いた実験の結果、DeepSeek-Reasonerのようなシステム2思考が可能なモデルは、SciFactおよびFiQAにおいて隔離率が0となり、高い防御性能を示した。一方で、DeepSeek-Chatのようなシステム2の能力を持たないモデルは、文脈を無視するよう明示的に指示しても、その内容に影響を受ける汚染が確認され、監視と制御の間にギャップが存在することが実証された。この現象はマルチエージェントシステムにおいても、あるエージェントが生成した誤情報を別のエージェントが検知したとしても、受信側のシステム1メカニズムが無意識にその誤情報に影響を受けるリスクを示唆している。今後は、エージェントのアーキテクチャにおいて検知と合成をいかに分離するか、また、このギャップがハルシネーションの種類やドメインによってどのように変化するかを調査する必要がある。