MetaRAG: Belief-Action Aligned Policy Optimization for Agentic RAG

Qiuyi Qi, Tian Liang, Jiamu Wang, Jinjian Zhang, Wei Zhou, Pengcheng Zhu, Linjian Mo, Ming Kong, Jie Liu, Qiang Zhu
採択先: 未取得 ・ 2026-08-25 ・ source: arxiv
補充候補公開日 2026-08-25キーワード一致 2被引用 0関連度 5本文(arXiv)読む価値 4/5
Agentic RAGの核心的な課題である「検索継続か回答か」の意思決定を、外部判定器に頼らずモデル内部の信念(Belief)との整合性で解くアプローチに高い新規性と実用性がある。
本文取得済み: 本文(arXiv)を根拠に要約しています。
Retrieval-Augmented GenerationRAG
一言で: エージェント型RAGにおける検索継続か回答かの意思決定を、モデルの内部的な確信度と実際の行動を一致させる「信念と行動のアライメント」として定式化し、これを最適化する学習フレームワークMetaRAGを提案する。これにより、過剰な検索によるコスト増と、証拠不足による回答の信頼性低下の両方を抑制する。

どんなもの?

エージェント型RAGでは、モデルが検索を継続すべきか、あるいは現在の情報で回答すべきかを判断する意思決定の境界を適切に設定することが求められる。不適切な判断は、不要な検索を繰り返すオーバーサーチや、情報が不十分なまま回答するアンダーサーチを引き起こす。従来の強化学習手法は、外部の判定器によるプロセス監督や、最終的な回答の成否のみに基づく報酬に依存しており、エージェント自身が持つ「証拠が十分である」という内部的な確信と実際の行動の乖離に対処できていない。

先行研究と比べてどこがすごい?

外部の判定器や反事実的な軌跡を用いるのではなく、方策モデル自身が持つ回答可能性への信念から、軽量な意思決定レベルの診断を行う点が新規性である。検索の意思決定の質を、モデルの内部的な確信度と実際の行動の一致度として再定義した。また、回答の正誤によって報酬を制御する仕組みを導入することで、内部的に一貫していても誤った軌跡が強化される報酬ハッキングを防ぐ手法を確立した。

技術や手法のキモはどこ?

候補となる行動を決定する前にその妥当性を検証するVerify-first Action Generationと、現在の文脈で回答可能かどうかをYesまたはNoの次トークン確率から算出するInternal Belief Probingを用いる。これら二つの信号の不一致をBelief-Action Gapとして特定し、検索の過不足を診断する。学習時には、この診断に基づく一貫性報酬と、最終的な回答の成否に基づく結果報酬を組み合わせた報酬関数を用いる。この際、最終的な回答が誤っている場合には一貫性報酬をゼロにするゲート機構を導入し、誤った信念に基づいた不適切な終了プロセスが強化されないように制御する。

どうやって有効だと検証した?

7つの公開QAベンチマークを用い、Qwen2.5-3Bおよび7Bモデルで評価した。既存の強化学習手法であるGiGPOと比較して、Qwen2.5-3Bで1.9ポイント、7Bで1.5ポイント平均精度を向上させた。また、外部LLMによる監視を用いるHiPRAGと比較して、精度と効率性のトレードオフを改善した。アブレーション研究により、一貫性報酬、行動前の検証、および正誤によるゲート機構の有効性を確認した。さらに、異なる最適化アルゴリズム(DAPOやPPO)や異なるモデルバックボーン、より困難な調査タスクへの転移においても、一貫した性能向上と堅牢性が示された。

議論はある?(限界・課題)

学習時には信念プローブによる追加の順伝播が必要であり、検証プロセスによって生成長が増加するため、学習時の計算コストが増大する。推論時においても、検証プロセスによる生成長の増加が、GiGPOと比較してわずかなレイテンシの増大を招くというトレードオフがある。本手法は、検索と回答の決定を行うQA指向のAgentic RAGに限定されており、検索クエリの質や生成された根拠の忠実性、あるいは検索・回答以外の複雑なツール利用アクションを直接的に監督するものではない。

セクション別の詳細要約

MetaRAG: Belief-Action Aligned Policy Optimization for Agentic RAG

MetaRAGは、エージェント型RAGにおいて、モデルが検索の継続か回答かを判断する意思決定の質を、モデル自身の内部的な確信度と実際の行動を一致させる「信念と行動のアライメント」として再定義する最適化フレームワークである。本手法は、実際の行動の前に明示的な検証プロセスを挟むVerify-first Action Generationと、同一の質問と履歴の文脈からモデル自身の回答可能性に関する確信度を推定するInternal Belief Probingを導入している。学習時には、これらに基づいて整合性を報酬として用いるが、回答の正誤によって報酬を制御することで、内部的に一貫していても誤った軌跡が強化されるのを防いでいる。この信念プローブは学習時のみ使用されるため、推論時の計算コストを増加させない。7つの公開QAベンチマークを用いた実験により、MetaRAGは既存の強化学習ベースの手法と比較して精度と効率のトレードオフを改善し、異なるモデルや最適化手法、および深いリサーチ設定においても効果を示すことが確認された。

1 Introduction

エージェント型RAGにおける課題は、検索を継続するか回答するかという意思決定の境界が不適切になることで、過剰な検索によるコスト増(オーバーサーチ)や、証拠が不十分なまま回答する信頼性の低下(アンダーサーチ)が生じる点にあります。既存の強化学習手法は外部の判定器等に依存しており、エージェントが持つ「証拠が十分である」という内部的な確信と実際の行動が乖離している問題に対処できていません。本研究では、検索の意思決定の質を信念と行動の一致度(belief-action alignment)として定式化し、MetaRAGという学習フレームワークを提案します。MetaRAGは、候補となる行動を検証してから決定するVerify-first Action Generationと、独立したYes/No形式の推論によって証拠の十分性を評価するスコアを算出するInternal Belief Probingで構成されます。学習時には、このスコアと実際の行動の一致度を報酬として用いますが、回答の正誤によって報酬を制御するcorrectness-gated consistency rewardを導入することで、内部的に一貫していても誤った回答に至る過程に報酬が与えられるのを防ぎます。7つの公開QAベンチマークを用いた実験の結果、MetaRAGは既存の強化学習ベースの手法と比較して、回答の正確性と効率性のトレードオフを改善し、知識の境界に対する認識を強化することが示されました。

2 Related Work

Agentic RAGの研究は、プロンプトや学習を用いない推論パターンに基づく初期の手法から、学習可能な意思決定問題として扱う近年の手法へと発展しています。最終的な回答の成否のみを報酬とする結果監督型手法に対し、プロセス監督型手法は、外部のLLM判定器や因果介入、あるいは状態やサブクエリを用いたより細かい粒度の報酬割り当てによって、検索の過不足を診断します。MetaRAGはこれらプロセス監督型手法に最も近いですが、外部の判定器や反事実的な軌跡を用いるのではなく、方策モデル自身が持つ回答可能性への信念から、軽量な意思決定レベルの診断を行う点で異なります。また、LLMが自身の知識境界を評価して検索を適応させる研究も存在しますが、それらの多くは推論時の制御や出力の修正、クエリのルーティングなどに用いられています。これに対しMetaRAGは、各ステップでモデルの回答可能性への信念を調査し、実際の検索または回答というアクションと比較することで、検索の過不足を診断する学習時の信念とアクションの整合性信号として活用します。

3 Methodology

MetaRAGは、エージェント型RAGにおいて検索と回答の境界を調整するための、信念と行動を一致させる学習フレームワークである。本手法は、候補となる行動の妥当性を検証してから実際の行動を決定するVerify-first Action Generationと、モデル自身が現在の文脈で回答可能かどうかをYesまたはNoの次トークン確率から算出するInternal Belief Probingを組み合わせる。これら二つの信号の不一致をBelief-Action Gapとして診断し、回答可能だと信じているのに検索を行うOver-searchや、情報不足だと信じているのに回答してしまうUnder-searchを特定する。学習時には、この診断に基づいた一貫性報酬と、最終的な回答の正誤に基づく結果報酬を組み合わせた報酬関数を用いる。この報酬計算では、最終的な回答が誤っている場合には一貫性報酬をゼロにするゲート機構を導入することで、誤った信念に従ってタスクを解かずに終了するといった報酬ハッキングを防いでいる。これにより、モデル自身の知識境界に基づいた適切な意思決定を強化学習によって最適化する。

4 Experiments

MetaRAGは、エージェント型RAGにおいてモデルの信念と行動の整合性を最適化する手法であり、7種類のQAベンチマークを用いて評価されています。実験の結果、MetaRAGはQwen2.5-3Bおよび7Bの双方において、既存手法であるGiGPOを上回る平均精度を達成しました。また、外部LLMによる監視を用いるHiPRAGと比較して、より少ない検索回数で高い精度を実現しており、精度と効率性のトレードオフにおいて優れた性能を示しています。アブレーション研究では、一貫性報酬と行動前の検証ステップの双方が、精度の維持と適切な検索回数の制御に不可欠であることが示されました。特に、一貫性報酬の計算において、タスクを解決できた軌跡のみを対象とするアウトカム・ゲーティングが、精度の低下を防ぐために重要であることが確認されています。学習過程の解析により、MetaRAGはモデルが回答可能か否かを判断するための知識境界の認識能力を強化していることも明らかになりました。さらに、より困難な調査タスクへのゼロショット転移や、異なる最適化アルゴリズムおよびモデルファミリーを用いた検証においても、一貫した優位性と堅牢性が確認されています。

5 Conclusion

MetaRAGは、エージェント型RAGにおいて、モデル自身の回答可能性に関する信念と、検索または回答という各アクションを整合させる学習フレームワークである。外部からのプロセス監視に頼らず、モデルが持つ回答への自信と実際のアクションを比較し、正誤に基づいた一貫性報酬を用いることで、過剰な検索や検索不足の両方を防ぐ軽量な学習ガイドを提供し、推論時には信念の探索を必要としない。7つのQAベンチマークを用いた実験では、強化学習ベースの既存手法と比較して、精度と効率のトレードオフを継続的に改善することが示された。分析の結果、この手法は検索行動のキャリブレーションを向上させ、早すぎる回答の抑制や知識境界の認識強化に寄与しており、より困難なディープリサーチの設定にも転移可能であることが確認された。さらに、最適化手法やモデルのバックボーンを変えた堅牢性実験からも、信念とアクションの整合性は特定の構成に依存しない、検索エージェント学習における頑健な報酬設計原理であることが示されている。

Limitations

MetaRAGは、報酬計算時に信念プローブによる追加の順伝播を必要とし、検証を優先する推論プロセスによって生成長が増加するため、学習時および推論時の計算コストが増大するという課題がある。学習速度については、HiPRAGよりは大幅に高速であるものの、GiGPOよりは遅い。推論時においても、検証を優先する推論プロセスによって、GiGPOと比較して応答が長くなり、レイテンシがわずかに高くなる。本研究の実験は、検索と回答の決定を行うQA指向のAgentic RAGに限定されており、検索クエリの語彙的な質や、生成された根拠の忠実性、あるいは検索・回答以外のより複雑なツール利用アクションを直接的に監督するものではない。

Ethical Considerations

本研究は、エージェント型RAGシステムの検索と回答の意思決定境界を改善するフレームワークを提案しているが、検索能力の向上は、大規模な情報収集や監視、あるいは誤情報の生成といった悪用につながるリスクを孕んでいる。実験においては、既存の公開されている質疑応答および研究用ベンチマークのみを使用しており、個人を特定できる情報やプライベートなユーザーデータは含まれていない。実用化に際しては、検索対象となるコーパスが法的に取得されたものであることを確認し、必要に応じてアクセス制御を行い、重大な影響を及ぼすユースケースに対しては適切な安全策を講じる必要がある。