本研究の対象は、高度な相互参照性、半構造化データ、および専門的な語彙を有する産業規格(ETSI EN 301 489シリーズなど)である。従来の「Vanilla RAG」は、テキストチャンクを高次元ベクトルとしてインデックス化し、コサイン類似度等で検索を行うが、規格書特有のセクション間の親子関係や、専門用語によるセマンティック・ギャップを捉えきれない課題がある。これに対し、本研究では情報をノードとエッジで表現するGraph RAGアーキテクチャに焦点を当て、単純な意味的類似性から、論理的な依存関係や構造的な関連性を考慮した検索メカニズムへの移行を目指している。
本研究の主な貢献は、規制文書の構造的複雑性を活用した軽量かつ低遅延なGraph RAGインデックス戦略を提案し、その有効性を定量的に実証した点にある。具体的には、文書を情報単位の集合 $\mathcal{V}$ とエッジ $\mathcal{E}$ からなるプロパティグラフ $G = (\mathcal{V}, \mathcal{E})$ としてモデル化する手法を導入した。また、ETSI規格に基づいたカスタムの合成Q&Aベンチマークデータセットを構築し、構造保持が検索性能に与える影響を詳細に分析した。これにより、構造情報と関係的依存性を組み込むことが、規範的文書の検索精度向上に有効であることを明らかにした。
手法は、文書を $\mathcal{E}_{part}$(階層関係)と $\mathcal{E}_{cite}$(引用関係)の2種類のエッジを持つグラフとして構築する。検索パイプラインでは、BM25によるフィルタリングとIBM Graniteを用いたDense Re-rankerを組み合わせ、Reciprocal Rank Fusion (RRF) を用いて以下の式でスコアを統合する:
$$\text{RRF}(d) = \sum_{r \in \mathcal{R}} \frac{1}{k + \text{rank}(r, d)}$$
さらに、グラフの特性を活かすため、ノード埋め込みを近傍の加重平均で平滑化するSmoothing手法や、シードノードの近傍を展開し、次数によるペナルティを含む以下のスコア $S(v)$ を用いるExpander & Graph Re-rankerを導入している:
$$S(v) = \sum_{s \in \mathcal{S}} \text{sim}(s, q) \cdot \text{sim}(v, s) \cdot \frac{1}{\text{deg}(v)}$$
評価実験では、ETSI EN 301 489-Xシリーズの約3000ページ(50文書)を対象とし、Gemini 1.5-flashを用いて生成した合成Q&Aペアと「witness strings(golden chunks)」を用いた。評価指標には、Recall at $K$ ($R@K = \frac{|\mathcal{G} \cap \mathcal{R}_K|}{|\mathcal{G}|}$)、Average Precision at $K$ ($AP@K$)、および(Mean) Reciprocal Rank ($MRR@K$)を採用した。実験では、Vanilla構成からStructured構成まで計8種類の構成を比較し、retrieverが返したチャンクがgolden chunkの75%以上を含む場合に一致とみなす緩和策を適用した。結果として、構造の保持はPrecisionとMRRに対して正の効果をもたらしたが、Recallへの統計的に有意な影響は見られなかった。また、RRFによる混合は精度を向上させたが、近傍拡張(Neighbor expansion)の効果は限定的であった。
本研究は、規格書特有の階層構造や語彙的規則性を活用することで、単純な意味的類似性を超えた検索が可能であることを示した。構造保持とチャンク分割を組み合わせた手法が、精度と再現性のバランスにおいて最も優れた妥協点であることが示唆されている。今後の課題として、より広範なQ&Aデータセットを用いた評価の必要性や、単一文書内または異なる文書間における遠隔した箇所からの情報合成能力の検証が挙げられる。高度な自動規範分析を実現するためには、提案手法と他の技術を組み合わせたハイブリッドな解決策の検討が重要な研究方向となる。
本研究は、複雑な階層構造、ドメイン固有の語彙、および広範な相互参照依存性を有する産業規格や規範的文書に対し、従来のベクトルベースの「vanilla」RAGでは構造的・関係的な特徴を捉えきれない課題を解決するため、Graph RAGアーキテクチャの有効性を調査している。具体的には、情報をノードとエッジで表現することで、単純な意味的類似性から関係性を考慮した検索メカニズムへの移行を目指し、ETSI EN 301 489シリーズなどの公開規格を対象とした、文書構造を検索ワークフローに直接組み込む軽量かつ低遅延なインデックス戦略を提案している。評価においては、独自に合成されたQ&Aデータセットを用いて、提案手法が検索性能およびコンテキストの関連性を向上させることを定量的に分析している。実験結果は、構造情報と関係的依存性を組み込むことで、規範的文書の自動作成に向けたスケーラブルなフレームワークとして、グラフ強化型RAGが有効であることを示している。
本研究は、高度な相互参照性、半構造化データ、および専門的な語彙を持つ規格書(ETSI規格など)に対し、従来のベクトル検索に基づく「vanilla RAG」の限界を指摘し、グラフ構造を活用したGraph RAGの有効性を探求するものである。従来のRAGは、テキストチャンクを高次元ベクトルとしてインデックス化し、コサイン類似度等の指標で検索を行うが、規格書特有の階層構造(セクションやサブセクション間の親子関係)や、専門用語によるセマンティック・ギャップを十分に捉えられない課題がある。これに対し、Graph RAGはデータ単位をノード、関係性をエッジとするグラフ構造として定義し、論理的な依存関係や構造的な関連性を辿ることで、直接的な意味的類似性が低い情報も効率的に探索可能にする。既存のGraph RAGは、インデックスベース、知識ベース、およびハイブリッド型の手法に分類されるが、規制文書や規格書に特化したグラフ技術の適用に関する実証的な比較研究は極めて少ない。本論文では、ETSI EN 301 489シリーズから生成したカスタム合成ベンチマークQ&Aデータセットを用い、軽量な手法とグラフを多用する手法の検索性能を定量的に比較・評価する。
本手法は、規制文書の相互参照特性を活用するため、文書を情報単位(InfoUnit)の集合 $\mathcal{V}$ とそれらを結ぶエッジ $\mathcal{E}$ からなるプロパティグラフ $G = (\mathcal{V}, \mathcal{E})$ としてモデル化する。グラフの構造は、階層関係を示す $\mathcal{E}_{part}$(親ノードは高々1つ)と、文書間の引用関係を示す $\mathcal{E}_{cite}$(多対多)の2種類で構成される。グラフ構築では、目次から抽出したセクションコードの接頭辞関係に基づき $\mathcal{E}_{part}$ を決定し、本文内のテキスト解析とヒューリスティックな解決ロジックを用いて $\mathcal{E}_{cite}$ を特定する。検索パイプラインでは、まずBM25による高再現率なフィルタリングと、IBM Graniteを用いたDense Re-rankerによる意味的再ランキングを行い、Reciprocal Rank Fusion (RRF) を用いて両者のスコアを $\text{RRF}(d) = \sum_{r \in \mathcal{R}} \frac{1}{k + \text{rank}(r, d)}$ により統合する。さらに、グラフの近傍情報を活用するため、ノードの埋め込みを近傍の加重平均で平滑化するSmoothing手法や、検索されたシードノードの近傍を展開し、次数によるペナルティを含むスコア $S(v) = \sum_{s \in \mathcal{S}} \text{sim}(s, q) \cdot \text{sim}(v, s) \cdot \frac{1}{\text{deg}(v)}$ を用いて再ランキングするExpander & Graph Re-rankerを導入している。
本研究では、ETSI EN 301 489-Xシリーズの規格書約3000ページ(50文書)を対象に、合成Q&Aペアを用いた評価実験を行っている。Q&Aペアの生成にはGemini 1.5-flashを用い、文脈から回答と、その根拠となる「witness strings(golden chunks)」を抽出するパイプラインを構築した。評価指標には、Recall at $K$ ($R@K = \frac{|\mathcal{G} \cap \mathcal{R}_K|}{|\mathcal{G}|}$)、Average Precision at $K$ ($AP@K$)、および(Mean) Reciprocal Rank ($MRR@K$)を採用している。実験では、単純なチャンク分割を行う「Vanilla」構成と、規格の階層構造を利用する「Structured」構成を含む8種類の構成を比較しており、retrieverが返したチャンクがgolden chunkの75%以上を含んでいる場合に一致とみなす緩和策を導入している。結果として、構造の保持はPrecisionとMRRに対して正の効果をもたらすが、Recallへの統計的に有意な影響は見られず、構造保持とチャンク分割を組み合わせた手法が最も優れた妥協点であることが示された。また、密なランキングと疎なランキングをRRFで混合する手法もPrecisionとMRRを向上させたが、近傍拡張(Neighbor expansion)や再ランキングの効果は限定的であった。
本研究では、規格書や規範的文書のRAG(Retrieval-Augmented Generation)の有効性を高めるため、インデックス作成メカニズムに構造情報を統合する軽量かつ低遅延な手法を調査した。実験の結果、規格書特有の階層構造や語彙的な規則性を活用することで、単純な意味的類似性を超え、技術文書特有の複雑な相互参照に対応した検索精度の向上が可能であることが示された。本手法は、構造的資産を活用することで検索パイプラインを強化できることを実証したが、今後の課題として、より広範なQ&Aデータセットを用いた評価や、単一文書内または異なる文書間における遠隔した箇所からの情報合成能力の検証が挙げられる。特に、高度な自動規範分析を実現するためには、これらの手法と他の手法を組み合わせたハイブリッドな解決策の検討が重要な研究方向となる。