現代のRAGシステムはテキストからマルチモーダルな情報へと進化しているが、企業文書における複雑なレイアウトや構造情報の扱いに課題がある。既存のMM-RAG手法は、検索と生成の両方にページ画像のみを用いる「ミニマルなパース手法」に依存しており、構造的な理解をVLMに丸投げしている。しかし、MLLMは学習データに含まれない複雑な文書構造を暗黙的に捉えることが困難であり、標準化されたインジェクション設計も欠如している。本研究は、これらの構造的理解の欠如を解消するためのフレームワークを対象としている。
本研究の主な貢献は、異種混合な企業文書に対応するMM-BizRAGの提案である。第一に、文書を垂直構造(レポート等)と水平構造(スライド等)に分類し、それぞれに最適なパース手法を適用する動的ルーティングを導入した。第二に、LLM駆動のアーティファクト変換パイプラインにより、プレースホルダーを用いた位置合わせを行い、自然な読解順序を維持する手法を確立した。第三に、検索用表現と生成用コンテキストを分離する「推論時マルチモーダル・アセンブリ」により、追加のファインチューニングなしで高精度な回答を実現した。さらに、人間との一致度が高くコストを半減させたLLM Judge「FastRAGEval」を提案している。
MM-BizRAGは、文書構造を認識する分割手法に基づき、垂直構造にはレイアウト認識型パースを、水平構造にはページ単位の包括的表現を適用する。アーティファクト変換においては、表や画像に対してプレースホルダーを用いた位置合わせ(placeholder-based positional alignment)を行い、LLMを用いて一貫した変換を行う。推論プロセスでは、検索時に使用するアーティファクト表現と、回答生成時に使用する表現を分離(decouple)する設計を採用している。これにより、インデックスの肥大化を防ぎつつ、生成時に文脈に即した豊かなコンテキストを構築する「推論時マルチモーダル・アセンブリ」を実現している。
提案手法の有効性は、大規模な企業データセットおよび2つの公開ベンチマークであるSLIDEVQAとFINRAGBENCH-Vを用いて検証された。実験では、推論スタックを固定し、インジェクション工程のバリエーションのみを変化させる制御されたバリアントを用いて、各戦略が精度に与える影響を厳密に分析している。結果として、既存のビジョン中心のベースラインと比較して、特にレポート形式のレイアウトにおいて最大32ポイントの性能向上を記録した。また、評価指標の検証において、FastRAGEvalはRAGCheckerのコストを半減させつつ、人間による評価と高い一致度を示すことが確認された。
MM-BizRAGは、追加のファインチューニングを必要としないコーダーモデル(coder models)を用いることで、既存のビジョン中心アプローチを凌駕する性能を示した。本研究の設計思想は、構造情報の理解をモデルの暗黙的な能力に依存するのではなく、明示的なインジェクション設計によって補完することにある。これにより、検索インデックスの効率性と、生成時のコンテキストの豊かさを両立させている。今後の課題や検討事項として、インジェクション手法の違いが生成結果に与える影響のさらなる詳細な特定が挙げられている。
MM-BizRAGは、複雑な構造を持つ企業文書において、既存のページレベル画像に依存する手法が構造情報の明示的な扱いを欠いているという課題に対し、文書構造を意識した動的なインジェクション・パイプラインを提案する。具体的には、文書を垂直構造(レポート等)と水平構造(スライド等)に分類してルーティングし、前者はレイアウトを意識したパースを、後者は包括的なページレベル表現を適用する。また、プレースホルダーを用いた位置合わせを行うLLM駆動のアーティファクト変換パイプラインにより、自然な読解順序を維持しつつ、推論時に検索表現と生成コンテキストを分離することで、追加のファインチューニングなしで精度の高い回答を可能にする。大規模な企業データセットおよび2つの公開ベンチマーク(SLIDEVQA, FINRAGBENCH-V)を用いた実験では、既存のビジョン中心のベースラインに対し、特にレポート形式のレイアウトにおいて最大32ポイントの性能向上を達成した。さらに、RAGCheckerのコストを半減させつつ人間との高い一致度を実現する、単一コール型のLLM Judge指標であるFastRAGEvalを導入している。
現代のRAGシステムは、テキスト入力のみに留まらず、画像、動画、および複雑なドキュメントグラフを含むマルチモーダルな情報を統合するように進化している。具体的には、Abootorabi et al. (2025) や Mei et al. (2025) などの研究に示されるように、多様なモダリティを扱う能力が求められている。本セクションでは、従来のテキストベースの枠組みを超えた、より広範な入力形式への対応が現在の研究動向であることを示唆している。
提供されたテキストは極めて断片的であり、手法の詳細や実験結果に関する具体的な情報は含まれていませんが、文脈から、多様なデータ型にわたる検索(retrieval)および推論(reasoning)を可能にする能力について言及されています。具体的には、Gao et al. (2025) や Edge et al. (2024) といった先行研究を引用しつつ、マルチモーダルな文脈における検索と推論の統合的な実現について述べています。このセクションの範囲内では、具体的なアルゴリズムや数値結果、数式などの詳細は記述されていません。
RAGパイプラインの進化は、ドキュメントのパース(解析)やレイアウト解析といった各コンポーネントにおける技術的進歩によって推進されている。
Han et al. (2025) は、テキストと画像が交互に配置された(interleaved)入力を処理し、それらに基づいて応答を生成することが可能なマルチモーダル大規模言語モデル(MLLM)について述べている。
企業向けドキュメントは、PDF、DOCX、PPTX、HTMLページなど多岐にわたるファイル形式に及び、テキスト、表、画像が複雑なレイアウト内で混在している。これらのドキュメントは、単一の形式ではなく、多様な要素が相互に配置された構造を持つことが特徴である。
既存のMM-RAG手法は、検索用の埋め込みとVLMへの回答生成入力の両方にページ画像のみを利用する、ミニマルなパース手法へと移行している。このアプローチは、複雑なレイアウト解析を排除し、構造的理解の役割をVLMやマルチモーダル埋め込みにオフロードすることで、効率性と簡潔さを実現している。しかし、画像のみに依存する手法には、構造情報の理解に関する課題が潜在している。
既存のマルチモーダル大規模言語モデルは、複雑な企業ドキュメントに埋め込まれた豊かで構造化された情報を、暗黙的に捉えることに苦慮している。これらの構造化された情報は、モデルの学習データには通常含まれていないため、モデルが事前学習を通じて習得していることは困難である。
既存のマルチモーダルRAGパイプラインは、ドキュメントの表現形式やインジェクション(取り込み)設計において標準化が欠如しているという課題がある。具体的には、ドキュメントをどのように表現するかという点や、データの取り込みプロセスをどのように設計するかという設計指針において、先行研究(Sarthi et al., 2024; Jin et al., 2025; Yu et al., 2024a; Xiong et al., 2024; Asai et al., 2023)の間で一貫性が保たれていないことが指摘されている。
MM-BizRAGは、エンタープライズ向けQ&Aを目的とした、5つの主要な貢献からなる新規性の高いマルチモーダルRAGフレームワークである。まず、ドキュメントの構造を認識する分割手法により、垂直方向(レポート形式)または水平方向(スライド形式)の構造に応じて、ドキュメントを動的に異なるインジェクション・パイプラインへとルーティングする。次に、LLM駆動の統合的なアーティファクト変換パイプラインを採用しており、表や画像に対してプレースホルダーを用いた位置合わせを行うことで、後続の推論プロセスにおける自然な読解順序を維持する。さらに、検索時に使用するアーティファクト表現と、回答生成時に使用する表現を、推論時のマルチモーダル・アセンブリを通じて分離(decouple)することで、冗長なインデックス作成を避けつつ、より豊かなコンテキスト構築を可能にしている。これらのコンポーネントを統合することで、既存のLLMをそのまま利用可能な単一のシステムとして構築されている。
本セクションでは、追加のファインチューニングを必要としないコーダーモデル(coder models)を用いた手法が、ビジョン中心のベースライン(vision-centric baselines)と比較して、最大で 32% ポイント上回る性能を示すことが報告されている。
本セクションでは、提案するパイプラインの有効性を検証するため、インジェスチョン(取り込み)工程におけるドキュメント表現のバリエーションおよび埋め込み生成戦略の変化が、ダウンストリームの性能に与える影響を調査している。具体的には、マルチモーダルなエンタープライズQ&Aにおいて、ドキュメントをどのように表現し、どのような戦略で埋め込みを生成するかが、最終的なRAGの精度にどのように寄与するかを分析の対象としている。
本研究では、推論スタックを固定した状態でインジェクション(データの取り込み)の選択肢のみを分離して評価する、制御されたバリアントを用いたBizRAGフレームワークを提案している。これにより、マルチモーダルなエンタープライズQ&Aにおいて、インジェクション手法の違いが生成結果に与える影響を厳密に特定することを目的としている。
本研究では、異種混合かつマルチドメインな企業文書に対応する、文書構造を考慮したMM-RAGシステム「MM-BizRAG」を提案している。本手法は3つの主要な設計革新に基づいており、第一に、垂直構造文書(レポート等)にはレイアウト認識型パースを、水平構造文書(スライド等)にはスライド単位の包括的表現を適用する、文書構造を考慮した動的なインジェクション・パイプラインを導入している。第二に、プレースホルダーを用いた位置合わせ(placeholder-based positional alignment)により、垂直構造文書の自然な読解順序を維持したまま、LLM駆動による一貫したアーティファクト変換を行う。第三に、推論時にアーティファクト表現を分離する「推論時マルチモーダル・アセンブリ」を採用しており、検索インデックスを肥大化させることなく、生成時に文脈に即した豊かなコンテキストを構築することを可能にしている。これにより、従来のビジョン中心のMM-RAGとは異なる、文書構造とマルチモーダルな整合性を重視したアーキテクチャを実現している。