検索拡張生成(RAG)システムにおいて、攻撃者が外部知識を汚染して大規模言語モデル(LLM)の出力を操作する知識汚染攻撃が深刻な脅威となっている。既存の防御策は、汚染率が極めて低いという非現実的な前提を必要としたり、統計的な特徴に依存するため意味論的な操作に弱かったりするという困難がある。本研究は、複数の情報源から提供される文書の中に悪意ある主体が含まれる状況を、分散システムにおけるビザンチン耐性集約問題としてモデル化し、その解決を目指す。
従来の防御手法が単一文書内の汚染率の閾値に依存していたのに対し、本研究は知識汚染をビザンチン耐性の観点から捉え直し、マルチソースの検証メカニズムを導入した点が新規である。また、プロンプトエンジニアリングによって検知を回避する高度な隠蔽性を備えた新たな攻撃手法であるAdaptive Tampering Attack(ATA)を提案している。さらに、動的なグラフ構造と常識推論を組み合わせることで、非独立同一分布(non-IID)なデータ環境下でも高い堅牢性を実現している。
提案手法は、まず複数のソースから取得した文書をノード、文書間の類似度をエッジとする動的グラフ $\mathcal{G} = (\mathcal{V}, \mathcal{E})$ を構築する。エッジの重み $w_{ij}$ は、コンテンツのコサイン類似度とカテゴリの一致度を融合した指標 $\text{sim}(d_i, d_j) = (1-\alpha) \cdot \text{sim}_{\text{sem}}(d_i, d_j) + \alpha \cdot \text{sim}_{\text{cat}}(d_i, d_j)$ によって決定される。次に、グラフニューラルネットワーク(GNN)を用いて各文書の信頼度 $C_i$ を算出する。信頼度が不確実な文書に対しては、LLMを用いたPost Auditにより常識との乖離を示すペナルティスコア $P_i$ を算出し、信頼度を再計算する。学習時には、分類損失 $\mathcal{L}_{\text{cls}}$ とトポロジー認識損失 $\mathcal{L}_{\text{topo}}$ を組み合わせた複合損失 $\mathcal{L} = \mathcal{L}_{\text{cls}} + \lambda(t) \mathcal{L}_{\text{topo}}$ を最適化する。
Natural Questions、HotpotQA、MediNote、Finance Alpacaの4つのデータセットを用い、DeepSeek-V3やLLaMA3-8BなどのLLMと各種リトリーバーを組み合わせて評価した。比較対象として、SS-RAG、MS-RAG、RobustRAG、FilterRAGなどの既存手法および、提案するATAを含む複数の攻撃シナリオを用いた。評価指標には攻撃成功率(ASR)、真陽性率(TPR)、真陰性率(TNR)等を用いた。結果として、MediNoteにおけるPoisonedRAG攻撃に対し、MS-RAGのASR 78.80%に対して5.24%という極めて低いASRを達成した。また、常識推論の導入により、SAA攻撃下でのTPRが88.40%から95.00%へ、TNRが86.50%から94.33%へと向上した。
本手法は、悪意のあるソースが全体の50%未満である場合に、汚染文書が検証を通過する確率を閾値 $\epsilon$ 未満に抑えられることが理論的に保証されている。しかし、攻撃者がソースの過半数を占めるような状況下では、ビザンチン耐性の限界により防御が困難になる可能性がある。今後の課題として、より複雑な攻撃シナリオへの適応や、計算コストと防御性能のトレードオフの最適化が挙げられる。
本研究では、検索拡張生成(RAG)システムにおける知識汚染攻撃に対抗するための、ビザンチン耐性を備えた安全な協調型RAGフレームワークであるSecureCollaRAGを提案している。この手法は、マルチソース知識検証メカニズムを活用することで、攻撃者がRAGシステムに提供するドキュメントを汚染し、大規模言語モデル(LLM)の出力を操作する脆弱性を防ぐことを目的としている。具体的には、動的なグラフニューラルネットワーク(GNN)を用いた信頼性スコアリングにより、エージェントシステムがドキュメントの由来を安全に検証することを可能にし、ドメイン知識の完全性を維持しながら隠密な知識汚染攻撃を効果的に阻止する。広範な評価と形式的な分析を通じて、SecureCollaRAGは非独立同一分布(non-IID)のデータ分布下においても、攻撃者に対して堅牢性を維持できることが示されている。
Retrieval-Augmented Generation (RAG) は、外部知識を利用して大規模言語モデル(LLM)のハルシネーションを抑制する手法であるが、情報の収集源が増えることで、勾配ベースの最適化を用いたCorpus Poisoning Attack (CPA) や、LLMに欺瞞的な文書を自動生成させるPoisonedRAGのような、知識の汚染に対する攻撃面が拡大している。既存の防御策であるRobustRAGは、単一文書内の悪意ある段落が50%未満であるという非現実的な閾値を必要とし、FilterRAGはキーワード密度の統計的特徴に依存しているため、意味論的な操作を行う高度な攻撃に対して脆弱である。本研究では、知識の汚染問題を分散システムにおけるビザンチン耐性(Byzantine fault tolerance)の観点から捉え、複数の情報源から提供される情報の中に悪意ある主体が含まれる状況下でのビザンチン耐性集約問題としてモデル化する。提案手法であるSecureCollaRAGは、複数の情報源の文書特徴を用いて動的なグラフを構築する分散知識グラフ構築、グラフのトポロジーを利用して悪意あるパターンを特定し信頼度を算出するGNNベースの信頼度スコアリング、および検証された信頼度に基づいて情報を重み付けして汚染文書を排除する検証ベースの集約という3つのコンポーネントで構成される。実験では、4つのデータセットと3つのオープンソースモデルを用い、プロンプトエンジニアリングによって隠蔽性を高めた新たなAdaptive Tampering Attack (ATA) を含む複数の攻撃シナリオに対して、提案手法が既存手法よりも高い防御性能を持つことを示している。
AIエージェントシステムは、LLMの能力を拡張するためにツール統合や、外部知識に基づきハルシネーションを抑制するRAG(Retrieval-Augmented Generation)を活用しているが、近年はコンテンツの発見性を高めるGEO(Generative Engine Optimization)という新たなパラダイムが登場している。Model Coordination Protocol (MCP) のようなオープンなアーキテクチャによる相互運用性の向上は、GEOの手法を悪用して汚染されたソースドキュメントを体系的に拡散させるTool Poisoning Attacks (TPA) という新たな攻撃面を生み出しており、特に医療分野ではわずか $0.001\%$ のデータ汚染が臨床LLMの信頼性を著しく損なうリスクがある。既存の攻撃手法には、勾配ベースの最適化を用いて検索コーパスに「敵対的パッセージ」を挿入するものや、攻撃者が指定した回答を生成させるために悪意のあるテキストを注入するPoisonedRAGなどが存在する。これに対し、隔離後に集約を行うRobustRAGは、汚染率が $50\%$ 未満という非現実的な条件下でしか機能せず、計算コストも極めて高い。また、キーワード密度に基づいて文書をフィルタリングするFilterRAGは、統計的な信号を残さずに意味論的な操作を行う高度な攻撃に対しては無力であり、実用的な制約下で動作する信頼性を考慮した検証メカニズムの必要性が示されている。
本研究のシステムモデルは、ターゲットとなるLLM、集約サーバー、および善意の文書集合 $\mathcal{D}_{\text{benign}}$ と悪意のある文書集合 $\mathcal{D}_{\text{malicious}}$ からなる知識ソース集合で構成される。集約サーバーは、各ソースに対して検索操作を行い、得られた各ソースの脱感作済み文書集合 $\mathcal{D}_i$ の和集合として、集約された文書集合 $\mathcal{D}_{\text{agg}} = \bigcup_{i=1}^n \mathcal{D}_i$ を形成する。LLMは、事前学習済みのパラメータに基づく外部知識の使用を厳格に禁止し、集約された文書と与えられたコンテキストのみに基づいて応答空間 $\mathcal{R}$ から応答 $r$ を生成する制約下にある。攻撃者は、全ソースの半数未満($n_{\text{malicious}} < 0.5n$)という少数派であり、他のソースのデータセットやLLMの内部パラメータにアクセスできないブラックボックス設定において、LLMに有害な「脱獄」応答 $\mathcal{J}$ を生成させることを目的として、$\max P(r_t \in \mathcal{J})$ を最大化しようとする。本研究のセキュリティ目標は、悪意のあるソースが全体の50%未満である場合に、汚染された文書 $d \in \mathcal{D}_{\text{malicious}}$ が検証を通過してLLMに到達する確率を閾値 $\epsilon$ 未満に抑え、それによってLLMの出力が敵対的な影響を受ける確率 $P(r_t \in \mathcal{A})$ を制限することである。
SecureCollaRAG (SCR)は、分散合意に基づき外部RAGシステムの文書を検証する、ビザンチン耐性を備えた協調検証フレームワークである。本手法は、複数の独立したソースから取得した文書をノード、文書間の類似度をエッジとする動的グラフ $\mathcal{G} = (\mathcal{V}, \mathcal{E})$ を構築し、グラフニューラルネットワーク(GNN)を用いて各文書の信頼度 $C_i$ を算出する。エッジの重み $w_{ij}$ は、コンテンツのコサイン類似度とカテゴリの一致度を融合した指標 $\text{sim}(d_i, d_j) = (1-\alpha) \cdot \text{sim}_{\text{sem}}(d_i, d_j) + \alpha \cdot \text{sim}_{\text{cat}}(d_i, d_j)$ によって決定され、ソースの信頼度 $R_s$ は、Dynamic Feature Gate & Projection機構を通じて学習可能なパラメータとして動的に更新される。信頼度が不確実な領域にある文書に対しては、常識的なLLMを用いたPost Auditが適用され、常識との乖離を示すペナルティスコア $P_i$ を用いて信頼度を再計算する。学習時は、バイナリクロスエントロピーを用いた分類損失 $\mathcal{L}_{\text{cls}}$ と、分散正則化およびクラスター対照学習を含むトポロジー認識損失 $\mathcal{L}_{\text{topo}}$ の複合損失 $\mathcal{L} = \mathcal{L}_{\text{cls}} + \lambda(t) \mathcal{L}_{\text{topo}}$ を最適化する。理論的には、悪意のあるソースが全体の50%未満である場合、悪意のある文書を受け入れるリスクが指数関数的に小さくなることが定理によって保証されている。
本研究では、Natural Questions、HotpotQA、および実社会への影響が大きい医療(MediNote)と金融(Finance Alpaca)のデータセットを用い、提案手法であるSCRフレームワークの堅牢性を評価している。評価指標には、LLM-as-a-judgeによる正規化スコアを用いた攻撃成功率(ASR)のほか、モデルの分類能力を示す真陽性率(TPR)、真陰性率(TNR)、偽陽性率(FPR)、偽陰性率(FNR)が用いられる。実験設定では、DeepSeek-V3、Qwen-2.5-14B、LLaMA3-8BなどのLLMと、Contriever、ClinicalBERT、FinBERTなどのリトリーバーを組み合わせ、ディリクレ分布を用いた分割により悪意のあるソースが50%未満となるヘテロジニアスな環境をシミュレートしている。攻撃手法としては、提案するATA、静的なSAA、および動的なPoisonedRAGを比較対象とし、防御手法としてはSS-RAG、MS-RAG、RobustRAG、FilterRAGと対照させている。結果として、SCRはMediNoteにおけるPoisonedRAG攻撃に対し、MS-RAGのASR 78.80%に対して5.24%という極めて低いASRを達成しており、高い防御性能を示した。また、常識推論メカニズムを導入することで、SAA攻撃下でのTPRが88.40%から95.00%へ、TNRが86.50%から94.33%へと向上することが確認された。さらに、ソースの信頼性スコアの分析により、SCRが攻撃の種類を識別し、特に隠蔽性の高いATA攻撃に対しても適応的な識別能力を持つことが示されている。
本研究は、RAG(Retrieval-Augmented Generation)システムにおける知識汚染攻撃への脆弱性を軽減することを目的としている。提案手法であるSecureCollaRAGは、マルチソースのドキュメントグラフを構築し、動的グラフニューラルネットワークを用いて各ドキュメントの信頼度を算出することで、複数の情報源を用いた堅牢な知識検証を実現する。また、プロンプトエンジニアリングを活用して検知を回避する高度な攻撃手法であるAdaptive Tampering Attackを提案している。評価実験の結果、SecureCollaRAGは非独立同一分布(non-IID)なデータ分布下においても攻撃者に対して堅牢性を示すことが確認され、安全なマルチエージェント協調のための新たなパラダイムを確立した。