Beyond Vector Search: Comparing Classical RAG with Hybrid GraphRAG for Climate Science Q\&A

Daniel Naiff, Ronnie Alves, Gustavo Pinto
採択先: ENIAC 2026 ・ 2026-08-28 ・ source: arxiv
補充候補採択先 ENIAC 2026公開日 2026-08-28キーワード一致 2被引用 0関連度 5本文(arXiv)読む価値 3/5
GraphRAGとベクトル検索のハイブリッド構成は有用な示唆を与えるが、評価データセットが22問と極めて小規模であり、実験の汎用性と信頼性に課題が残るため。
本文取得済み: 本文(arXiv)を根拠に要約しています。
Retrieval-Augmented GenerationRAG
一言で: 従来のベクトル検索に基づくRAGは、複雑な科学文献における概念間の階層的な関係や文書をまたぐ依存関係を捉えられない課題があります。本研究では、ベクトル検索とGraphRAGを統合したハイブリッド手法を提案し、気候科学の質問応答において文脈の関連性と再現率を向上させました。

どんなもの?

気候学のような専門性の高い科学的コーパスを対象とした、質問応答システムを想定しています。従来のRAGは文書を個別のベクトルとして扱うため、概念間の階層的な繋がりや、複数の論文に分散した知識の依存関係をモデル化できず、関連知識の抽出が困難であるという問題があります。

先行研究と比べてどこがすごい?

キーワードの幾何学的な類似性に依存する従来のRAGに対し、Leidenアルゴリズムによるコミュニティ検出と意味的な関係性を記述する知識グラフを統合したハイブリッドアーキテクチャを提案しています。これにより、局所的なテキスト断片の検索と、コーパス全体にわたるグローバルな構造の把握を両立させ、文書間の断絶を克服する手法を提示しました。

技術や手法のキモはどこ?

提案手法は、ベクトル検索とGraphRAGを組み合わせたハイブリッド構成です。まず、PDFからメタデータを抽出し、テキストを一定の文字数と重複を持たせたチャンクに分割してベクトル化します。同時に、LLMを用いてエンティティと関係性を抽出し、知識グラフを構築します。このグラフに対し、Leidenアルゴリズムを用いて階層的なコミュニティを検出し、ボトムアップ方式でコミュニティごとの要約を生成します。検索時には、ベクトルデータベースによるチャンク検索と、グラフ内のコミュニティ要約に対する検索を並列に実行します。取得したチャンクにはソースとなる記事タイトルを付与して情報を強化し、それらを統合したリストに対してクロスエンコーダによる再ランキングを行うことで、最適なコンテキストを選択して回答を生成します。

どうやって有効だと検証した?

気候学の論文5報から作成された22個の質問と正解データセットを用い、gpt-oss-20bを推論モデルとして評価しました。評価にはDeepEvalフレームワークを用い、7種類のLLMを判定役として、正確性、回答の関連性、忠実性、文脈の関連性、文脈の再現性の5指標で測定しました。結果、提案手法は従来のRAGと比較して、文脈の関連性で160%、文脈の再現率で177%の向上を達成しました。また、判定役となるLLM間でのスコアのばらつきが抑制され、検索の予測可能性と信頼性が向上することも確認されました。

議論はある?(限界・課題)

アマゾンの気候学という限定的な領域かつ、手動選定された小規模なデータセットに基づいているため、結果の汎用性には限界があります。また、判定役をLLMに依存する手法は、評価モデル自体のバイアスに影響を受けるため、今後は専門家による検証が必要です。さらに、コンテキストのチャンク数を増やすことで、情報の網羅性と回答の厳密な根拠との間にトレードオフが生じる可能性が示唆されており、正確性を高めるための事後的な事実検証メカニズムの検討が今後の課題です。

セクション別の詳細要約

Beyond Vector Search: Comparing Classical RAG with Hybrid GraphRAG for Climate Science Q&A

従来のRAGシステムは文書を個別に扱うため、気候学のような複雑な科学的コーパスにおいて概念間の階層的な関係性を捉えられず、複数の論文にまたがる概念の依存関係を扱えないという課題があります。本研究では、ベクトル検索にGraphRAG、Leidenアルゴリズムによるコミュニティ検出、およびクロスエンコーダーを用いた再ランキングを統合したハイブリッドアーキテクチャを提案しています。この手法は、局所的な情報の検索とグローバルな構造の把握を統合することで、従来のRAGと比較して文脈の関連性で160%、文脈の再現率で177%の向上を達成しました。この結果は、テキスト断片を孤立させて扱う手法よりも、グラフ構造を活用して分散した科学文献を統合的に扱う方が、専門領域の質問応答において有効であることを示しています。

1 Introduction

アマゾンの気候バランスにおける重要性に伴い、関連する科学論文が急増しているが、分散した文書から関連知識を抽出することは質問応答システムにとって大きな課題となっている。従来のベクトル検索に基づくRAGは、文書を個別に扱うため概念間の階層的な関係性を捉えられないという限界がある。本研究では、エンティティや関係性、知識コミュニティを抽出するGraphRAGと、従来のRAGを比較検証している。実験では、特定の研究所が作成した科学論文のデータベースを用い、研究者が作成した22個の質問と期待される回答からなるデータセットを構築した。7種類の異なる規模やアーキテクチャを持つ大規模言語モデル(LLM)を用いて、回答の正確性、回答の関連性、および忠実度をLLM-as-a-Judgeの指標で評価した。その結果、GraphRAGを用いたハイブリッドなアプローチは、従来のベクトルRAGと比較して、文脈の関連性で160%、文脈の再現率で177%の向上を示した。

2 RAG and GraphRAG Architectures

従来のRAGは、文書をベクトル埋め込みとしてインデックス化し、クエリに対して意味的に最も類似したチャンクをコンテキストとして抽出する手法ですが、概念間の明示的な関係性や孤立した文書間の繋がりをモデル化できないという課題があります。これに対しGraphRAGは、大規模言語モデルを用いてテキストからエンティティと関係性を抽出し、知識グラフを構築することでこの制限を克服しています。具体的には、Leidenアルゴリズムを適用して階層的なコミュニティを検出することで多層的な要約を生成し、コーパス全体に分散したグローバルな接続性を探索することを可能にしています。先行研究では、生データに対するゼロショットでの回答精度が16%に留まるのに対し、知識グラフに基づく意味層を導入することで精度が54%まで向上することが示されており、明示的な接続なしでは大規模言語モデルの推論能力が制限されることが示唆されています。したがって、横断的なトピックの相関が必要となる科学的なデータ解析においては、単なるキーワードの幾何学的な類似性ではなく、高精度な概念マップとして機能するグラフ構造を利用するGraphRAGの採用が有効です。

3 Proposed Architectures

本研究では、気候科学の論文に関する質問応答に特化した2つのアーキテクチャを提案している。第1の構成(v1)は古典的なRAG手法に基づき、PDFからメタデータを抽出した後、再帰的な手法でテキストを1,000文字単位(重複100文字)に分割し、ポルトガル語へ翻訳してベクトル化を行う。検索時には、ユークリッド距離を用いたベクトル検索により上位10個のチャンクを抽出し、その後クロスエンコーダを用いて最も関連性の高い2個に絞り込んでから、LLMにより回答を生成する。第2の構成(v2)はGraphRAGを採用したハイブリッド手法であり、画像記述モデルによる図表のテキスト化や、チャンクサイズの拡大(1,350文字)、および新しい埋め込みモデルの導入を行っている。v2では、ベクトル化と並行してNeo4jを用いた知識グラフの構築が行われ、LLMによる情報の抽出、コサイン類似度0.90を閾値としたエンティティの正規化、Leidenアルゴリズムによる階層的なコミュニティ検出、およびボトムアップ方式の要約生成が実行される。検索フェーズでは、従来のベクトル検索と、グラフ内のコミュニティ要約に対するコサイン類似度検索を並列に実行し、取得したチャンクに記事タイトルを付与して情報を強化した上で、クロスエンコーダを用いて上位5個のコンテキストを選択し、最終的な回答を生成する。

4 Evaluation

本評価実験では、気候科学の多様なトピックを扱う5つの論文から作成された計22個の質問と正解データを用いて、提案手法の性能を検証しています。推論には gpt-oss-20b モデルを使用し、生成された回答の評価には DeepEval フレームワークを用いた LLM-as-a-judge 手法を採用しており、qwen3、llama3.3、gemma3、mixtral などの計7種類のモデルが判定役を務めています。評価指標には、回答の正確性、回答の関連性、文脈への忠実性、文脈の関連性、および文脈から関連情報を抽出する能力を示す文脈の再現性の5つが用いられています。LLMの回答に固有の変動性を抑え、結果の統計的な堅牢性を確保するため、各シナリオにつき5回から10回の繰り返し実行を行っています。実験は、NVIDIA GeForce RTX 3090 GPUを搭載したローカル環境で実施され、データの取り込みから判定までの全工程には約7時間を要しました。

5 Results

ベクトル検索を用いたRAG(V1)と、知識グラフおよび再ランキングを統合したハイブリッドなGraphRAG(V2)を比較した結果、V2は文脈の想起(Contextual Recall)と文脈の関連性(Contextual Relevancy)において顕著な改善を示し、知識の欠落を減らして生成の正確性(Correctness)を向上させた。評価指標のばらつきに着目すると、V1では評価モデル間でスコアの乖離が大きかったのに対し、V2ではスコアの分布が圧縮されており、特に文脈の想起において全モデルが0.75から0.95の間で中央値を一致させるなど、検索の予測可能性と信頼性が高まっている。個別の評価モデルの挙動では、Gemma 3:12bが厳格な基準を持ちつつもV2で高い想起スコアを示す一方、Llama 3.3 70bはV1において想起スコアの極端なばらつきを示すなど、モデルごとに特性が異なる。Mixtral 8x22bは忠実性(Faithfulness)において大きな変動を検出し、コンテキストのチャンク数を2から5に増やした際に、情報の完全性と厳密な根拠との間にトレードオフが生じる可能性を示している。一方で、文脈の想起が改善されたにもかかわらず、正解性の中央値はいずれのモデルでも0.40を下回る低水準に留まっている。

6 Limitations

本研究の結果は、アマゾンの気候学という非常に限定的な領域に絞られ、かつ手動で選定された22問という小規模なデータセットに基づいているため、汎用性には限界がある。評価手法としてLLMを判定役とするLLM-as-a-judgeを採用していることから、評価モデル自体の品質や固有のバイアスに結果が直接依存しており、今後は専門家による検証が望まれる。また、実験はOllamaを用いたローカルかつ制御された環境で実施され、ハイパーパラメータの調整も経験則に基づいたものに留まっている。これらの計算資源および運用上の制約により、本研究の結果を実用環境や異なる文脈へ適用するには、さらなる検証が必要である。

7 Related Work

Hanらによる研究では、ベクトル検索を用いたRAGとGraphRAGの変種を、Wikipediaやニュースなどの一般的なドメインで比較しており、局所的な事実に関する質問にはRAGが、複雑な推論にはGraphRAGが適しているという相補的な関係が示されている。本研究は、これらとは異なり、Leidenコミュニティ検出と意味的な三つ組を用いて分散した科学データを統合するハイブリッド構成を気候学ドメインに適用している。複数の長い文書の要約に関する研究では、高度なRAGシステムでも人間による洞察の網羅性に及ばないことが示されており、これは本研究におけるボトムアップなコミュニティ要約手法の選択を裏付けている。また、原子的な事実に基づいた自動評価手法に関する研究では、大規模言語モデルの判断と人間の専門家の判断に強い相関があることが示されている。さらに、金融ドメインにおける研究では、リランキングが複雑なテキストにおける従来の密ベクトル検索の限界を緩和することが示されており、本研究のハイブリッド構成においてクロスエンコーダによるリランキングを採用していることを支持している。

8 Concluding Remarks

本研究では、従来のベクトル検索に基づくRAG手法と、グラフ構造を活用したハイブリッドなGraphRAG手法の比較検証を行った。22個の複雑な質問と複数の大規模言語モデルを用いて評価した結果、ハイブリッド手法は従来のベクトル検索手法を上回る性能を示した。具体的には、文脈の関連性において160%、文脈の再現率において177%の向上が確認された。この性能向上は、グラフが持つ局所的な詳細情報とグローバルな構造を統合することで、ドキュメント間の断絶を克服したことによるものである。