FlexStructRAG: Flexible Structure-Aware Multi-Granular Relational Retrieval for RAG

M. Chen, Haodong Yang, Jiawei Cai, Xiaoli Huang
採択先: 未取得 ・ 2026-02-01 ・ source: semanticscholar
新着論文公開日 2026-02-01キーワード一致 2被引用 0関連度 5本文(arXiv)読む価値 4/5
多粒度な構造(グラフ、ハイパーグラフ、クラスター)を統合し、推論時の柔軟性と低コストなプロンプトを実現した点が極めて新規性が高い。
本文取得済み: 本文(arXiv)を根拠に要約しています。
Retrieval-Augmented GenerationRAG
一言で: FlexStructRAGは、固定長チャンクによる文脈の断片化と、単一の構造(グラフまたはハイパーグラフ)に依存する粒度の制約を解決する、クエリ適応型のマルチグラニュラな構造認識型RAGフレームワークである。エンティティ、二項関係、ハイパーエッジ、および意味的クラスターという4つの異なる粒度の検索ユニットを、インデックスの再構築なしに推論時に柔軟に組み合わせることが可能である。

どんなもの?

既存のRAG手法は、一様なチャンキングによる意味的断片化や、二項関係(グラフ)か$n$項関係(ハイパーグラフ)のいずれか一方の粒度に依存するという構造的バイアスを抱えている。本研究は、マイクロレベルのプリミティブからマクロレベルのトピックまでをシームレスに繋ぐ、多層的な構造認識型検索の必要性を提示している。具体的には、知識の抽出から検索、生成に至るプロセスにおいて、関係性と文脈の連続性を両立させることを目的としている。

先行研究と比べてどこがすごい?

本研究の主な貢献は、再インデックスなしで推論時に検索モードを切り替え可能な、統一的なマルチユニット知識ベースを提案した点にある。また、位置的局所性を考慮した「meso-level structure-aware semantic clustering (SSC)」を導入し、ハイパーエッジ間の意味的・位置的な近接性を利用して中間層の構造を構築した。さらに、動的パーティショニングと切り詰めスライディングウィンドウ抽出を組み合わせることで、計算量を $O(n)$ に抑えつつ、チャンク境界を跨ぐ文脈の取り込みを実現している。これにより、複雑な関係性を持つ知識集約型タスクに対して、スケーラブルかつ高精度な解決策を提供している。

技術や手法のキモはどこ?

知識構築フェーズでは、まず動的パーティショニングと切り詰めスライディングウィンドウを用いて文書をチャンク化し、LLMを用いてハイパーエッジ $\mathcal{H} = \{(e_i, s_i, \mathcal{E}_i)\}$ を抽出する。これに基づき、ハイパーグラフ $\mathcal{G}_H = (\mathcal{E}, \mathcal{H})$ と、アンカーエンティティを介した二項関係のグラフ $\mathcal{G} = (\mathcal{E}, \mathcal{R})$ を構築する。中間粒度として、ハイパーエッジの埋め込み $\mathbf{h}_i$ と抽出順序に基づく距離 $d(i, j) = \text{dist}(\mathbf{h}_i, \mathbf{h}_j) + \lambda |i - j|$ を用いてHDBSCANにより意味的クラスター $\mathcal{C}$ を形成する。検索フェーズでは、クエリ $q$ に対してエンティティ、エッジ、ハイパーエッジ、クラスターの4つのモジュールをコサイン類似度等を用いて検索し、ハイブリッドに組み合わせる。

どうやって有効だと検証した?

UltraDomainベンチマークの4ドメイン(Agriculture, CS, Legal, Mix)を用いた実験により、GraphRAGやHyperGraphRAGを含む9つのベースラインと比較検証を行った。結果として、全ドメインでExact Match (EM)、token-level F1、Generation Evaluation (GE) の全指標において最高性能を達成した。特にMixドメインでは、HyperGraphRAGに対しEMで $+10.15$、F1で $+9.37$、GEで $+6.20$ の大幅な向上を示した。アブレーション研究では、SSCの除去が EM で $-8.40$ という最大の性能低下を招くことが確認された。また、推論時のプロンプトトークン数は $1,097$ と、HyperGraphRAG の $12,221$ に対して極めて低く、効率性においても優位性が示された。

議論はある?(限界・課題)

FlexStructRAGは、計算コストをオフラインの構築フェーズへシフトさせることで、オンライン推論時のオーバーヘッドを大幅に削減することに成功している。パラメータ感度分析によれば、リトリーバルの範囲を広げることは性能向上に寄与するが、一定範囲を超えると精度が飽和し、プロンプトコストが線形に増加するというトレードオフが存在する。回答の質に関しては、RelevanceやLogical Coherenceにおいて約 $0.8$ という高いGEスコアを記録しており、構造化された知識が生成の論理的一貫性に寄与していることが示唆される。本手法は、特徴量の切り替え(feature toggles)により、特定の構造のみを利用するバリアントの制御も可能である。

セクション別の詳細要約

FlexStructRAG: Flexible Structure-Aware Multi-Granular Relational Retrieval for RAG

FlexStructRAGは、固定長チャンクによる文脈の断片化や、単一の構造化インデックスによる粒度の制約を解決するために提案された、クエリ適応型のマルチグラニュラ(多粒度)な構造認識型RAGフレームワークである。本手法は、二項関係のための知識グラフ(KG)、$n$項関係のための知識ハイパーグラフ(KHG)、および関係的証拠を文書に基づいた文脈単位に集約する構造認識型セマンティッククラスターの3つを共同で構築する。知識構築時には、一様なチャンキングによる意味的断片化を防ぐため、動的パーティショニングと、限定的な文脈依存性を組み込むための切り詰めスライディングウィンドウ抽出メカニズムを導入している。推論時には、エンティティ、エッジ、ハイパーエッジ、およびクラスターレベルの検索を柔軟に組み合わせることで、関係性と文脈の両方に整合した証拠を生成プロセスに提供する。UltraDomainベンチマークを用いた4つのドメインにおける実験の結果、FlexStructRAGは強力なRAGベースラインと比較してセマンティック評価において精度を向上させることが示された。

1 Introduction

既存のRAG手法は、固定長のテキストチャンクによる文脈の断片化や、グラフ(二項関係)またはハイパーグラフ($n$項関係)のいずれか一方の粒度に依存する構造的バイアスという課題を抱えている。提案手法であるFlexStructRAGは、エンティティ、エッジ、ハイパーエッジ、およびドキュメントに基づいたクラスターという4つの異なる粒度の検索ユニットを、インデックスの再構築なしに推論時に切り替え可能な統一フレームワークとして扱う。具体的には、LLMを用いて抽出された関係性から知識グラフと知識ハイパーグラフを構築し、各ユニットにはソーステキストへのスパンレベルのプロバナンス(根拠)を保持させることで、チャンク境界による情報の歪みを抑制している。さらに、マイクロレベルのプリミティブとマクロレベルのトピック間の中間層として、意味的類似性と位置的な近接性を利用してハイパーエッジを統合する「meso-level structure-aware semantic clustering (SSC)」を導入し、多段推論に必要な文脈の連続性と関係性の特定性を両立させている。構築プロセスにおいては、動的パーティショニングと切り詰められたスライディングウィンドウ抽出を組み合わせることで、線形時間計算量 $O(n)$ を維持しつつ、チャンクを跨ぐ限定的な文脈の取り込みとキャッシュ可能性を実現している。

2 Preliminaries

本セクションでは、グラフベースのRAGとハイパーグラフ表現の定義が導入されている。グラフベースのRAGは、エンティティの集合 $\mathcal{V}$ と関係の集合 $\mathcal{E}$ からなるグラフ $\mathcal{G} = (\mathcal{V}, \mathcal{E})$ として構造化知識を表現し、各知識項目は $k = (e, u, v)$ (ここで $e \in \mathcal{E}$、 $u, v \in \mathcal{V}$)と記述される。クエリ $q$ に対する回答生成は、検索された候補知識集合 $\mathcal{K}_q$ を用いて、$\text{Ans}(q) = \sum_{k \in \mathcal{K}_q} P(\text{Ans} | k, q)$ のように周辺化することで行われる。一方、ハイパーグラフは各ハイパーエッジが2つ以上のエンティティを接続することを許容し、知識単位を $k = (e, \mathcal{S})$ (ここで $e \in \mathcal{E}_H$、 $\mathcal{S} \subseteq \mathcal{V}$)と定義することで、$n$ 項関係を自然に表現できる。提案手法 FlexStructRAG は、オフラインフェーズで動的なチャンク分割とスライディングウィンドウ抽出を行い、知識ハイパーグラフ、知識グラフ、および構造を考慮したセマンティッククラスターを構築する。オンラインフェーズでは、これらエンティティ、エッジ、ハイパーエッジ、クラスターを検索し、クエリに整合した根拠を組み立てて生成に用いる。

3 The FlexStructRAG Architecture

FlexStructRAGは、LLMによる知識抽出の不完全性やノイズに対応するため、エンティティ、二項関係、$n$項関係(ハイパーエッジ)、および文書に基づいた意味的クラスターという複数の粒度で補完的な表現を維持するフレームワークである。知識ベース構築フェーズでは、まず動的パーティショニングと切り詰めスライディングウィンドウ戦略を用いて文書をチャンク化し、各チャンクからハイパーエッジ $\mathcal{H} = \{(e_i, s_i, \mathcal{E}_i)\}$ を抽出する。次に、ハイパーエッジを用いてハイパーグラフ $\mathcal{G}_H = (\mathcal{E}, \mathcal{H})$ を構築し、さらに高次相互作用を捉えるアンカーエンティティを介して二項関係のグラフ $\mathcal{G} = (\mathcal{E}, \mathcal{R})$ を構築する。また、中間の粒度として、ハイパーエッジの埋め込み $\mathbf{h}_i$ と抽出順序に基づく距離 $d(i, j) = \text{dist}(\mathbf{h}_i, \mathbf{h}_j) + \lambda |i - j|$ を用いてHDBSCANで意味的クラスター $\mathcal{C}$ を形成する。検索フェーズでは、クエリ $q$ に対してエンティティ、ハイパーエッジ、エッジ、およびそれらを含むクラスターを検索する4つのモジュールを備えたハイブリッドモードを基本とし、各モジュールはコサイン類似度等を用いて関連情報を取得する。UltraDomainベンチマークにおける実験結果では、FlexStructRAGはAgriculture、CS、Legal、Mixの全ドメインにおいて、既存の最良手法であるHyperGraphRAGを上回る性能を示し、例えばLegalドメインのGE(生成評価)において$65.21$を記録するなど、顕著な改善を実現している。

4 Experiments

FlexStructRAGの有効性を検証するため、UltraDomainベンチマークの4ドメイン(Agriculture, CS, Legal, Mix)を用い、Exact Match (EM)、token-level F1、およびLLMベースのGeneration Evaluation (GE) を指標として、GraphRAGやHyperGraphRAGを含む9つのベースラインと比較実験を行った。実験の結果、FlexStructRAGは全ドメインにおいて最高のEM、F1、GEを達成し、特にMixドメインではHyperGraphRAGに対しEMで $+10.15$、F1で $+9.37$、GEで $+6.20$ の大幅な向上を示した。アブレーション研究では、エンティティ、エッジ、ハイパーエッジの各リトリーバルに加え、Structure-aware Semantic Clustering (SSC) やSliding Window (SW) が性能に寄与しており、特にSSCの除去は EM で $-8.40$ という最大の性能低下を招いた。パラメータ感度分析では、リトリーバルの広さを増すと性能は向上するものの、一定範囲を超えると精度は飽和し、プロンプトコストが線形に増加するトレードオフが確認された。回答の質(RQ4)については、RelevanceやLogical Coherenceにおいて約 $0.8$ という高いGEスコアを記録し、全次元で優れた性能を示した。効率性(RQ5)に関しては、知識構築時のトークン消費量は一定程度高いものの、推論時のプロンプトトークン数は HyperGraphRAG の $12,221$ に対し $1,097$ と極めて低く、計算コストをオフラインの構築フェーズへシフトさせることでオンラインのオーバーヘッドを大幅に削減している。

5 Conclusion

FlexStructRAGは、グラフ、ハイパーグラフ、およびドキュメントに基づいた検索を統合する、構造認識型のRAGフレームワークである。本手法は、二項関係、$n$項関係、および中間レベルのセマンティック・クラスターを共同でモデリングすることで、ドキュメントの根拠を維持しつつ複雑な関係的証拠を捉える。主な貢献として、再インデックスなしで推論時にモード切り替えが可能な統一マルチユニット知識ベース、位置的局所性を備えたハイパーエッジ中心の構造認識型セマンティック・クラスタリング、およびチャンク分割の歪みを抑えつつ計算量を線形時間 $O(n)$ に抑える切り捨てスライディングウィンドウ抽出による動的パーティショニングを導入している。さらに、特徴量の切り替え(feature toggles)により、グラフのみ、ハイパーグラフのみ、あるいは構造のみのバリアントを制御可能にしており、複雑な知識集約型生成タスクに対してスケーラブルかつ効果的な解決策を提供する。