従来のRAGシステムは、検索された文書が持つ専門用語やフォーマルな文体が、生成プロセスにおける指示よりも強くモデルに影響を与えるという構造的な問題を抱えています。これにより、事実は正確であっても、受信者の社会的・運用的文脈から乖離した回答が生成される「文脈的デカップリング」が発生します。この問題は、言語的、認知的、関係的な3つのコミュニケーションの失敗を引き起こしますが、既存の評価指標は事実の正確性に特化しているため、これらの失敗を検知できません。
トーンの制御を生成時のプロンプトのみに依存させるのではなく、検索から検証に至るパイプラインの全工程に組み込むアーキテクチャを提案しています。従来のRAGが事実の正確性のみを最適化対象としていたのに対し、事実の精度と通信パラメータの適合性を並列に扱う二重最適化アプローチを提示した点が新規性です。
TA-RAGは、以下の4つの制約をパイプラインの各フェーズに適用します。
1. スティグマのない言語:ドメイン固有の用語基準に従う。
2. 読みやすさの調整:受信者の読解レベルに合わせる。
3. 受信者への適応:受信者の属性や状況に合わせる。
4. 共感的フレーミング:適切な感情的表現を用いる。
処理の流れは以下の通りです。まずクエリ処理フェーズで、受信者のプロフィールと感情信号を抽出します。検索フェーズでは、意味的な関連性に加え、用語の適切さや読みやすさの観点から文書をランク付けします。文脈構築フェーズでは、不適切な用語の置換案や簡略化の指示を文脈に付与します。生成フェーズで制約に基づいた回答を作成した後、制約検証フェーズで回答を監査し、制約を満たさない場合は修正プロセスを実行します。
評価には、4つの制約に対応する指標と、情報の正確性を維持するための指標を組み合わせて用います。読みやすさは、音節数や文の長さに基づく指標やLLMによる自動評価で測定します。受信者への適応は、専門家によるルーブリック評価やドメイン固有のガイドラインを用いて評価します。また、トーンの修正が内容を歪めていないかを検証するため、埋め込みベースの類似度やBERTScoreを用いて、修正前後の回答間における意味の保存性を評価します。
情報の正確性とコミュニケーションの整合性の間にはトレードオフが存在します。例えば、説明を簡略化することで重要なニュアンスが失われたり、共感を優先することで情報の緊急性が弱まったりする可能性があります。TA-RAGは、ドメイン固有の閾値を設定することで、このトレードオフを明示的に管理することを目指しています。今後の課題として、言語スタイルや読解レベルを考慮できる検索メカニズムの開発、専門家の判断を反映できる自動分類器の構築、および正確性と整合性を同時に評価できるベンチマークの確立が挙げられます。
従来のRAGシステムは、検索された文書が持つ専門用語やフォーマルな文体といった通信スタイルに影響を受け、ユーザーが指定したトーンの指示を無視してしまう「文脈的デカップリング(contextual decoupling)」という構造的な限界を抱えています。これは、システムが事実の正確性を最適化する一方で、受信者の社会的または運用的文脈から乖離してしまう現象であり、言語的、認知的、関係的な3つのコミュニケーションの不一致を引き起こします。これらは、正確性のみを重視する従来の評価指標では検知が困難な「コミュニケーション変換の失敗」として定義されます。本論文は、事実の正確性とコミュニケーションの整合性を並列に扱う概念的フレームワークであるTA-RAGを提案しています。TA-RAGは、検索、文脈構築、生成、制約検証の各フェーズにおいて、スティグマのない言語、読みやすさの調整、受信者に配慮した適応、共感的なフレーミングという4つの制約を運用します。これにより、社会的感度が高く重要な文脈におけるRAGの設計指針を示しています。
従来のRAG(検索拡張生成)は、検索された文書が持つ特有の文体や専門用語といったコミュニケーション上の規範が、生成プロセスに強く影響を与えるという構造的な課題を抱えています。検索された文書は中立的な情報ではなく、臨床プロトコルの形式的なトーンや専門的な言語分布を内包しており、これらがプロンプトの文脈として組み込まれることで、生成段階で与えられる「共感的に」といった指示の効果を弱めてしまいます。この現象は、事実は正確であっても社会的な文脈や利用者の状況に適合しない「文脈のデカップリング(乖離)」を引き起こします。具体的には、不適切な用語の使用による言語的不一致、専門知識レベルの差による認知的不一致、および感情的な配慮の欠如による関係的な不一致という3つの失敗モードが存在します。既存のRAG評価指標は、忠実性や回答の関連性といった事実に基づく評価に特化しているため、これらのコミュニケーション上の失敗を検出することが困難です。本研究では、検索された文書のスタイルが固定される前に、検索と生成のインターフェースにおいてコミュニケーションの整合性を強制する制約レイヤーを導入するTA-RAGという枠組みを提案します。
TA-RAGは、従来のRAGが事実の正確性のみを最適化対象としていたのに対し、事実の精度と通信パラメータの適合性を同時に満たすことを目的とした二重最適化アプローチを提案する。本手法は、トーンの制御を生成段階のプロンプトのみに依存せず、検索から検証に至る全工程に組み込むアーキテクチャを採用している。具体的には、スティグマのない言語、読みやすさの調整、受信者への適応、共感的フレーミングという4つの通信制約を定義し、これらをパイプライン全体で制御する。
システムは5つのフェーズで構成される。第1フェーズのクエリ処理では、受信者の属性を示すプロファイルと、感情的な緊急度を示す感情信号を抽出する。第2フェーズの検索では、意味的な類似性に加え、用語の適切さ、読みやすさ、役割への関連性に基づく3つの信号を用いて文書をランク付けする。第3フェーズの文脈構築は本アーキテクチャの核心であり、不適切な用語の置換案や簡略化の指示を付与し、受信者メタデータを付加することで、生成のための文脈を形成する。第4フェーズの生成では、構築された文脈と制約指示に基づき、適切な用語、読みやすさ、説明の深さ、感情への配慮を適用する。最終的な第5フェーズの制約検証では、生成された回答を監査し、用語や読みやすさが基準を満たさない場合は、最大3サイクルまでの反復的な修正、あるいは人間によるレビューへと繋げる。
TA-RAGは、コミュニケーションの整合性をアーキテクチャ上の制約として強制するために、その検証を可能にする測定指標が不可欠であると主張しています。評価基準として、スティグマのない言語、読みやすさ、受信者への適応、共感的フレーミングの4つの制約を検討しており、スティグマのない言語は既存の用語集との比較で判定可能ですが、文脈に応じた語彙の使い分けが課題となります。読みやすさは、音節数や文の長さに基づく決定論的な指標や、LLMによる自動評価が有効であり、受信者への適応は専門家によるルーブリック評価やドメイン固有のガイドラインに基づく構造化された基準を用いることが提案されています。共感的フレーミングについては、AIの感情の真実性ではなく、状況に応じた感情表現の適切さを評価対象とします。さらに、これらの制約を満たすための修正が事実の正確性を損なわないよう、埋め込みベースの類似度やBERTScoreを用いた意味保存性の評価を、制約固有の指標と組み合わせて共同で行う必要があります。
TA-RAGは、情報の正確性とコミュニケーションの整合性(トーンの適切さ)の間に生じるトレードオフを、システムのデフォルトの挙動に任せるのではなく、明示的かつ測定可能なものとして管理することを目指している。例えば、制約検証フェーズにおいてドメイン固有の閾値を設定することで、ピアサポートにおける差別的な用語の排除や、緊急時における共感よりも情報の迅速性を優先するといった、専門知識に基づいた調整が可能になる。今後の研究課題として、意味的な関連性に加えて言語スタイルや読解レベルにも対応できる検索メカニズムの開発、専門家の判断を反映できる堅牢な自動分類器の構築、および正確性と整合性の両方を同時に評価できる共同ベンチマークの確立が挙げられる。さらに、閾値の設定や見直しを行うためのガバナンス体制の確立には、自然言語処理の研究者とドメインの専門家、および当事者コミュニティとの連携が不可欠である。本手法は、プロンプトや後処理のみに頼るのではなく、RAGのアーキテクチャ自体にコミュニケーションの制約を統合することで、情報の伝え方が受容性に大きく影響するヘルスケアや教育などの領域における課題解決への道筋を提示している。
本研究は、オーストラリア政府のARC(Australian Research Council)を通じて資金提供される、ADM+S(Automated Decision-Making and Society)センターの支援を受けて実施されました。著者貢献として、Y.K.が論文の概念化、文献調査、概念的アーキテクチャの開発、および原稿の作成と全体的な枠組みの構築を主導しました。A.M.は理論的な枠組みの構築、解釈、および原稿の改訂に寄与しました。両著者は最終的な原稿を確認し、承認しています。なお、倫理承認、参加への同意、出版への同意、および臨床試験登録に関する事項は、本研究においては該当しません。