検索拡張生成(RAG)において、モデルが持つ内部知識(parametric knowledge)と検索された外部知識(contextual knowledge)が矛盾する「知識競合」は、回答の信頼性を著しく低下させる。従来のニューロン単位の編集は知識の絡み合いにより汎用能力を損なうリスクがあり、層単位の介入は固定的なルールに依存するため柔軟性に欠ける。本研究は、入力依存の学習可能なゲートを用いて、FFN(Feed-forward Network)の隠れ状態の活性化を動的に調整することで、この問題を解決することを目指している。
本研究の主な貢献は、バックボーンのLLMを完全に凍結した状態で、極めて軽量なゲートモジュールのみを学習させることで、知識競合を緩和する「SHIFT」を提案した点にある。SHIFTは、Group Relative Policy Optimization (GRPO) を用いて、フォーマットと忠実性(faithfulness)に基づく報酬関数によりゲートを最適化する。実験により、Qwen-3-0.6Bにおいて最強のベースラインに対し平均6.16%の向上、ConFiQA-MRではEMで11.15%の改善を達成した。また、MMLUでの性能低下を0.5%未満に抑えつつ、ゲートが知識の衝突を識別する表現を学習していることを実証した。
SHIFTは、各TransformerレイヤーのFFNブランチに軽量なゲートモジュールを導入する。隠れ状態 $h_{l,i}$ に対し、スカラー値 $g_{l,i} = \sigma(\alpha_l \cdot \text{MLP}(h_{l,i}))$ を計算し、残差ストリームへの寄与を $\text{LayerNorm}(h_{l,i} + g_{l,i} \cdot \text{FFN}(h_{l,i}))$ として変調する。学習ではバックボーン $\theta$ を固定し、ゲートパラメータ $\phi$ のみをGRPOを用いて最適化する。目的関数 $\mathcal{L}_{\text{total}}$ は、GRPOの目的関数 $\mathcal{L}_{\text{GRPO}}$、参照方策 $\pi_{\text{ref}}$ とのKLダイバージェンス、および元の挙動を維持するための正則化項 $\lambda \mathbb{D}_{KL}(\pi_{\phi} \| \pi_{\theta})$ を組み合わせたものである。
評価は、MRQAベンチマーク(HotpotQA, NQ, SQuAD等)、ConfiQA(QA, MR, MC)、およびMMLUの3カテゴリで行われた。バックボーンにはQwen-3-0.6BおよびQwen-3-8Bを使用し、比較対象としてVanilla-RAG、CtrlA、CK-PLUG、SFT、Knowledgeable-R1などの手法を設定した。指標にはExact Match (EM)、F1 Score、Accuracy (ACC) を用いた。ゲートの有効性検証として、5分割交差検証によるロジスティック回帰を行い、衝突識別能力の指標となるAUCが0.500から0.832へと向上することを確認した。
SHIFTは、入力に応じてパラメータ知識を抑制したり、逆に文脈知識に従ったりする適応的な知識仲裁を実現している。アブレーション研究では、LoRAやSFTよりも、入力依存のゲート機構とGRPOによる相対的な方策最適化が重要であることが示された。一方で、本手法は高度に専門的なドメインやマルチモーダルなQAについては未調査であり、計算リソースの制約からさらに大規模なモデルでの検証も今後の課題である。モデルサイズが小さいほど、変調による性能向上の恩恵が大きい傾向も観察された。
本研究では、検索拡張生成(RAG)において、検索されたコンテキストとモデルのパラメータ知識が衝突する問題に対処するための新手法「SHIFT」を提案している。従来のニューロン単位の編集手法は、ニューロンの絡み合い(entanglement)によりモデルの汎用的な能力を損なう副作用があるが、SHIFTはニューロンの修正を学習可能なゲートによる変調(gate modulation)として再定式化することで、この問題を回避する。技術的には、バックボーンとなるLLMを凍結したまま、0.01%未満の極めて軽量な学習可能パラメータを持つゲートモジュールを導入し、生成時に内部表現を適応的に調整することで、コンテキストとパラメータ知識のバランスを制御する。6つのデータセットを用いた広範な実験により、既存のベースラインと比較してSHIFTの有効性が検証されている。
Retrieval-Augmented Generation (RAG) において、モデルのパラメータ知識(parametric knowledge)と検索された文脈知識(contextual knowledge)が矛盾する「知識競合(knowledge conflict)」は、事実の信頼性を損なう重大な課題である。従来のニューロン単位の介入は、知識が疎に表現されているため微細な特定が困難であり、層単位の介入は固定的なルールを用いるため柔軟性に欠けるという限界がある。本研究では、バックボーンとなるLLMを凍結したまま、入力依存の学習可能なゲートを用いて隠れ状態の活性化を調整する軽量なフレームワーク「SHIFT (Selective Hidden-state Intervention on Feed-forward Networks)」を提案する。SHIFTは、Group Relative Policy Optimization (GRPO) を用いてゲートモジュールを最適化することで、知識競合時における文脈知識とパラメータ知識の動的な調停を可能にする。本手法は、全パラメータの $0.01\%$ 未満という極めて少ない学習パラメータ数で動作し、モデルの汎用的な能力を維持しつつ、知識競合の緩和において既存の強力なベースラインを上回る性能を示す。
Retrieval-Augmented Generation (RAG) における知識の衝突(parametric memory と retrieved evidence の矛盾)への対策として、プロンプティングや知識の精緻化により外部情報の利用を促す手法や、Context-DPO や RA-DIT のようにモデルを直接微調整して文脈への忠実性を高める手法が存在する。しかし、微調整ベースの手法はモデルの内部メカニズムが不明確であることや、破滅的忘却(catastrophic forgetting)を招くリスクがある。これに対し、ニューロンや FFN、アテンションヘッドなどの内部構造に知識を局在化させ、ターゲットを絞った知識編集を試みる研究も行われているが、正確な局在化の困難さや、介入に伴う計算コストの高さ、および介入の脆弱性が課題となっている。近年の研究では、アテンションヘッドや FFN モジュールを対象とした、より粗い粒度での介入(PH3, RHIO, JuICE, ROME, ParamMute など)へとシフトしているが、これらはオフラインで選択されたコンポーネントや静的な剪定ルール、定義済みの抑制係数を用いるなど、固定的な介入スキームに依存している。このような静的な戦略は、モデルの汎用的な能力を不意に損なう可能性があるため、本研究ではパラメータを変更せずに、入力に適応した内部制御を行うフレームワークである SHIFT を提案している。
SHIFTは、RAGにおける検索コンテキストとモデルのパラメータ知識の衝突を緩和するため、FFN(Feed-forward Network)の活性化を適応的に制御する手法である。具体的には、各TransformerレイヤーのFFNブランチに軽量なゲートモジュールを導入し、隠れ状態 $h_{l,i}$ に基づいてスカラー値 $g_{l,i} = \sigma(\alpha_l \cdot \text{MLP}(h_{l,i}))$ を計算することで、残差ストリームへのFFNの寄与を $\text{LayerNorm}(h_{l,i} + g_{l,i} \cdot \text{FFN}(h_{l,i}))$ として調整する。学習プロセスでは、バックボーンのパラメータ $\theta$ を固定したまま、ゲートパラメータ $\phi$ のみをGroup Relative Policy Optimization (GRPO) を用いて最適化し、フォーマットと忠実性(faithfulness)に基づく複合報酬を用いて方策を更新する。最適化の目的関数は、GRPOの目的関数 $\mathcal{L}_{\text{GRPO}}$、参照方策 $\pi_{\text{ref}}$ とのKLダイバージェンス、およびゲートが元の挙動を逸脱しすぎないための正則化項 $\lambda \mathbb{D}_{KL}(\pi_{\phi} \| \pi_{\theta})$ を組み合わせた $\mathcal{L}_{\text{total}}$ で定義される。この手法により、モデルはコンテキストの証拠と自身の知識のバランスを、入力ごとに動的に制御することが可能となる。
本実験では、提案手法であるSHIFTの有効性を検証するため、(1) MRQAベンチマーク(HotpotQA, NQ, SQuAD等)を用いたインドメイン評価、(2) ConfiQA(QA, MR, MCの3サブセット)を用いたアウトオブドメイン評価、(3) MMLUを用いた汎用能力維持の評価という3つのカテゴリで実験を行う。比較対象のベースラインとして、Vanilla-RAGやCtrlAなどのプロンプティング手法、CK-PLUGのようなデコーディング手法、およびSFTやKnowledgeable-R1といったファインチューニング手法の3群を設定している。評価指標には、正規化された予測と参照回答の一致度を測るExact Match (EM) およびトークンレベルのF1 Scoreを用い、汎用性実験では正解の含有率を示すAccuracy (ACC) を採用する。実装の詳細として、バックボーンモデルにはQwen-3-0.6BおよびQwen-3-8Bのnon-thinkingモードを使用し、SHIFTのハイパーパラメータは式(2)におけるゲートの変調範囲を制御する値を$2$に、式(4)における$\alpha$および$\beta$を全レイヤーで$0$に設定している。
SHIFTは、凍結されたLLMにおいて文脈知識とパラメータ知識の衝突を緩和するため、ゲート制御による活性化変調を行う手法であり、QwenおよびLlamaの両ファミリーにおいてVanilla-RAGを凌駕する性能を示した。実験の結果、Qwen-3-0.6Bにおいて最強のベースラインに対し平均6.16%の向上、特に知識衝突が激しいConFiQA-MRではEMで11.15%の改善を達成しており、モデルサイズが小さいほど変調による恩恵が大きい傾向が見られる。MMLUベンチマークを用いた評価では、全モデルにおいて平均0.5%未満の微小な性能低下に留まっており、汎用的な言語理解能力を維持しつつ知識の仲裁が可能であることが示された。ゲートの活性化分析では、パラメータ知識が正しく文脈が誤っている場合(Type 1)と、その逆(Type 2)を区別する能力が確認され、5分割交差検証によるロジスティック回帰のAUCが0.500から0.832へと向上したことから、ゲートが衝突を識別する表現を学習していることが実証された。アブレーション研究では、LoRAを用いた場合やSFTで学習した場合と比較して性能が低下することから、入力依存のゲート機構とGRPOによる相対的な方策最適化の重要性が示された。ケーススタディでは、誤った文脈に惑わされず正しいパラメータ知識を選択する能力と、逆に正しい文脈に従ってパラメータ知識を抑制する能力の両方が確認され、適応的な知識仲裁が実現されている。
本論文では、検索拡張生成(RAG)における知識の衝突を緩和するために、適応的な内部変調を用いる軽量なフレームワークである SHIFT を提案している。SHIFT は、FFN(Feed-Forward Network)の活性化値に対して学習可能なゲート変調(gate modulation)を適用することで、検索されたコンテキストとモデルのパラメータメモリとの間で、より信頼性の高い知識の仲裁を実現する。複数のベンチマークおよび大規模言語モデル(LLM)を用いた包括的な実験の結果、SHIFT は既存の競合するベースラインを上回る性能を示し、異なる設定においても強力な汎化性能と堅牢性を発揮することが確認された。これらの知見は、RAG における知識衝突の緩和手法として SHIFT が極めて有効であることを示唆している。
本研究の限界として、提案手法である SHIFT は、高度に専門的なドメインやマルチモーダルな質問応答(QA)については本稿では調査対象としていない。今後は、一般的なドメインや QA ベンチマークを超えて、これらのより広範な設定へと SHIFT を拡張することが課題である。加えて、計算リソースの制約により、より大規模なモデルを用いた実験は実施できていない。
本研究は、倫理的かつ責任ある方法で実施されており、公開データセットの使用に際してはすべてのデータソースを正確かつ適切に引用し、原著者を明示している。研究の透明性と再現性を確保するため、実装コードおよびデータセットを適切に公開することが予定されている。