本研究は、科学文献チャットボットにおけるハルシネーションの抑制と知識抽出の効率化を目的としている。従来のキーワード検索における非構造化データのフィルタリング負荷や、LLM特有の誤情報の生成という課題に対し、Retrieval-Augmented Generation (RAG) を用いたアプローチを検討している。評価対象は、OpenAIの`text-embedding-ada-002`を用いたVectorRAG、Neo4jによるプロパティグラフを活用したGraphRAG、およびこれらを統合したHybrid RAGの3種類である。検証は「単一のアップロード文書からの検索」と「大規模コーパスからの検索」という2つの異なるシナリオで行われている。
本研究の主な貢献は、科学的知識へのアクセシビリティを向上させるためのハイブリッドなRAGシステムの提案と、その体系的な性能評価である。具体的には、構造化データ(グラフ)と非構造化データ(ベクトル)の両方を活用することで、研究目的に応じた効率的な情報ソースの選別を可能にしている。また、GPT-4o-miniを用いて生成した合成テストデータセットに対し、専門家(SME)によるアノテーションを組み合わせた、高品質な評価フレームワークを構築した。これにより、検索精度、回答の忠実度、および意味的一致性を多角的に検証している。
提案手法は、3つのアーキテクチャで構成される。VectorRAGは、`text-embedding-ada-002`でベクトル化されたチャンクに対し、LlamaIndexの`VectorIndexRetriever`を用いて類似度ベースの検索を行う。GraphRAGは、Neo4j上のプロパティグラフに対し、`VectorContextRetriever`によるノード探索と`LLMSynonymRetriever`によるキーワード検索を組み合わせ、`maxPathsPerChunk=10`の設定で構造的関係を利用する。チャンキングには、バッファサイズ1、ブレイクポイントのパーセンタイル閾値95に設定されたSemantic Splitterを採用している。Hybrid RAGは、これら両方の利点を統合し、意味的類似性と構造的関係性の双方から情報を取得する。
評価には、PubMed等の科学データベースから収集された農薬・生態毒性学に関する論文群が使用された。テストセットは2種類用意され、単一論文用にはGPT-4o-miniで生成し専門家が検証した500組のデータ、複数論文用には専門家が「Yes」と判定した60組のデータが用いられている。評価指標として、回答の正確性(Accuracy)、正解との意味的類似性を測るコサイン類似度(Cosine similarity)、およびコンテキストへの接地性を測る忠実度(Faithfulness)が用いられた。品質管理は、コンテキストの関連性、回答の導出可能性、質問への完全な回答という3基準に基づいて厳格に行われている。
実験の結果、Hybrid RAGがコサイン類似度 $0.687$、忠実度 $0.845$ と最も高いスコアを示し、検索精度と論理的一貫性の両立が確認された。手法別では、VectorRAGがコサイン類似度 $0.670$、忠実度 $0.841$ でGraphRAG(それぞれ $0.654$、$0.785$)を僅かに上回ったが、GraphRAGは複雑な概念間の関係性に対して構造的な応答を提供する特性を持つ。また、単一論文では関連性 $94.2\%$、網羅性 $92\%$ と高かったのに対し、複数論文では関連性 $81.6\%$、網羅性 $85\%$ に低下しており、多文書検索における曖昧さの解消が課題として残っている。今後の展望として、クエリの複雑さに応じた適応的検索戦略や、ドメイン特化型グラフの統合が挙げられている。
本研究は、科学文献チャットボットの性能向上を目的として、ベクトルベースおよびグラフベースの検索システムを用いたRetrieval-Augmented Generation (RAG) の評価を行っている。提案手法は、構造化データ(グラフ)と非構造化データ(ベクトル)の両方のデータベースを活用することで、研究目的に応じた効率的な情報ソースの選別を可能にする。評価実験では、「単一のアップロード文書からの検索」と「大規模コーパスからの検索」という2つのユースケースを設定し、GPTモデルを用いて生成したベンチマークテストセットとアノテーション済み出力を用いて、検索精度と回答の関連性を体系的に検証している。分析の結果、ハイブリッドRAGシステムが科学的知識へのアクセシビリティを向上させ、エビデンスに基づく意思決定を支援する可能性が示されている。
本研究では、科学文献の調査を効率化するために、Retrieval-Augmented Generation (RAG) を活用したAI搭載型文献チャットボットを提案している。LLM特有のハルシネーションや、従来のキーワード検索における非構造化データのフィルタリング負荷といった課題に対し、本システムは科学論文およびグレーリテラチャーのデータベースから情報を検索・合成することで、論文のトリアージや知識抽出を支援する。評価実験では、「単一のアップロードされた論文からの検索」と「複数の論文からなる大規模データベースからの検索」という2つのユースケースを設定し、ベクトルベース、グラフベース、およびそれらを組み合わせたハイブリッドなRAGアーキテクチャの性能を比較する。評価手法として、GPTモデルを用いて単一論文および論文集合に関する2種類の合成テストデータセットを生成し、さらに専門家(SME)によるアノテーションを付与することで、生成されたテストデータの品質とモデルの有効性を検証している。
RAG(Retrieval-Augmented Generation)は、事前学習済みseq2seqモデル(パラメトリックメモリ)と、ニューラルリトリーバーを介してアクセスする密ベクトルインデックス(非パラメトリックメモリ)を組み合わせることで、知識集約的なタスクにおけるハルシネーションの抑制と知識接地を向上させる手法である。Gaoらによる分類では、RAGはNaive、Advanced、Modularの3つのパラダイムへと進化しており、Jiangらは従来の短文単位の検索ではなく、4Kトークン程度の長い情報単位を最大8個程度取得する「LongRAG」を提案し、追加学習なしでSOTAを達成している。評価手法に関しては、RAGのハイブリッドな構造ゆえの複雑さが指摘されており、Yuらは統一的な評価フレームワーク「Auepora」を提案している。また、Salemiらは、エンドツーエンドの評価に代わり、検索された各文書を個別に評価する「eRAG」を導入しており、これは既存手法と比較してKendallの相関係数が0.168から0.494向上し、GPUメモリ使用量を最大50分の1に削減できるという計算効率の高さを示している。
本研究では、VectorRAG、GraphRAG、および両者を統合したHybrid RAGの3つの手法を提案・比較している。VectorRAGは、OpenAIの`text-embedding-ada-002`を用いて高次元ベクトル化されたドキュメントチャンクから、LlamaIndexの`VectorIndexRetriever`により類似度ベースで情報を取得する。GraphRAGは、Neo4jを用いて構築されたプロパティグラフから、`VectorContextRetriever`によるノード探索と`LLMSynonymRetriever`によるキーワード検索を組み合わせ、グラフの構造的関係を利用して情報を取得する。チャンキングには、文脈の整合性を維持するために、バッファサイズ1、ブレイクポイントのパーセンタイル閾値95に設定されたセマンティック・スプリッター(Semantic Splitter)を採用している。GraphRAGにおいては、抽出されるトリプレットの数がグラフの豊かさに直結するため、`maxPathsPerChunk`を10に設定している。Hybrid RAGは、ベクトル検索による意味的類似性とグラフ探索による構造的関係性の両方を統合することで、より包括的な情報取得を目指している。
本研究のデータセットは、知識ベースとなるソースドキュメントと、性能評価用のテストセットの2種類で構成されている。ソースドキュメントはPubMed等の科学データベースからウェブスクレイピング等で収集された、農薬・除草剤の有効成分や生態毒性学に関する研究論文群であり、手法に応じてベクトル埋め込みまたはグラフの三つ組(triplets)へと変換される。テストセットは2つのシナリオで構成され、一つは単一論文へのRAG適用を評価するもので、GPT-4o-miniを用いて生成された500組の質問・回答・コンテキストのセットからなり、訓練されたアノテーターによる検証を経て「Yes」と判定された高品質なデータのみが抽出されている。もう一つはデータベース全体へのRAG適用を評価するもので、より広範な論文群からGPT-4o-miniを用いて生成された60組のセットで構成され、こちらは専門家(subject matter expert)による評価を経て「Yes」の回答のみが保持されている。いずれのテストセットも、コンテキストの関連性、回答の導出可能性、および質問への完全な回答という3つの基準に基づいて品質管理が行われている。
本セクションでは、提案されたRAGシステムの性能評価結果が示されており、まずテストセットの評価として、GPT-4o-miniが生成した回答の正確性(Accuracy)を専門家によるラベル付け(正解を1、不正解を0)に基づき算出している。次に、チャットボットの評価として、ベクトル型、グラフ型、およびハイブリッド型の各RAG設定に対し、回答の質を測定する2つの指標、すなわち生成された回答と正解との意味的類似性を測るコサイン類似度(Cosine similarity)と、回答が提供されたコンテキストに忠実でありハルシネーションを抑制できているかを測る忠実度(Faithfulness)を用いている。評価には合成データセットが使用されており、最終的な精度算出には専門家によって承認された質問応答ペアが用いられている。実験結果は、GPT-4o-miniを用いた各RAG設定における回答の正確性、意味的一致性、およびコンテキストへの接地性を詳細に分析した表1および表2にまとめられている。
本研究では、VectorRAG、GraphRAG、および両者を組み合わせたHybrid RAGの3手法を用い、単一論文および複数論文データベースからの情報検索における応答の忠実度(faithfulness)とコサイン類似度を評価している。実験の結果、Hybrid RAGが平均コサイン類似度 $0.687$、忠実度 $0.845$ と最も高いスコアを記録し、ベクトルによる意味的類似性とグラフによる構造的知識表現を統合することで、検索精度と論理的一貫性の両立が可能であることが示された。単一論文のテストセットでは文脈の関連性が $94.2\%$、回答の網羅性が $92\%$ と高かったのに対し、複数論文では関連性が $81.6\%$、網羅性が $85\%$ に低下しており、多文書検索における曖昧さの解消が課題として浮き彫りになった。手法別の比較では、VectorRAGがコサイン類似度($0.670$)と忠実度($0.841$)においてGraphRAG(それぞれ $0.654$、$0.785$)を僅かに上回ったが、GraphRAGは概念間の関係性を扱う複雑なクエリに対して構造的で論理的な応答を提供する特性を持つ。今後の展望として、クエリの複雑さに応じた適応的検索戦略の導入や、ドメイン特化型のプロパティグラフの統合、および人間による評価を含むベンチマークの拡充が提案されている。