インドなどの低・中所得国(LMIC)における臨床現場を対象とした、文脈特化型の検索拡張生成(RAG)システムの性能評価を目的としている。入力は英語による臨床的な質問であり、出力はそれに対する回答である。従来の汎用的な大規模言語モデルは、特定の地域特有の疾患ガイドラインや資源制約のある医療環境に即した正確な情報提供が困難であるという課題がある。
特定の地域や臨床状況に最適化されたコーパスを用いることが、RAGベースの臨床AIにおける根拠の正確性を向上させる有効な設計変数であることを示した。汎用モデルが優位とされるベンチマークにおいて、専門特化したシステムが臨床的な正確性、網羅性、文脈への適応性において最先端の汎用モデルを凌駕、あるいは匹敵できることを示した点が新規である。
VITAは、疾患別のガイドライン、インド固有の薬剤耐性データ、国の医薬品集の制約、および資源制約下でのケアプロトコルから構成される、精査されたコーパスから情報を検索する仕組みを持つ。検索された専門的な情報を基に回答を生成するRAGアーキテクチャを採用している。評価では、医師が作成したルーブリックに基づき、臨床的な価値を考慮したポイント加重スコアや、単独で最高スコアを獲得した回数を用いて多角的に測定している。
4,023件の英語のHealthBench質問を用いた評価では、VITAはルーブリックの獲得率で51.9%を記録し、GPT-5.4(46.1%)、o4-mini(44.3%)、Gemini 3.1 Pro(42.6%)、Claude Sonnet 4.6(37.3%)を上回り、45.4%の質問で最高スコアを獲得した。また、最新モデルと中立的な評価者を用いた500問の感度分析では、VITAの平均スコア51.0%はGPT-5.5の52.0%と統計的に区別がつかないレベルに達したが、ポイント加重スコアおよび単独での最高回答回数ではVITAが優位であった。
コーパスの専門性を高めることで臨床的な正確性や網羅性は向上するが、コミュニケーションの洗練度や指示への追従性においては汎用モデルに劣るというトレードオフが存在する。本研究の限界として、評価指標や評価者が主に西洋の臨床文脈に基づいて設計されており、低・中所得国の状況を過小評価する可能性があること、および評価が英語のみに限定されていることが挙げられる。今後の課題として、文脈に応じた継続的かつ層別化された評価フレームワークの構築が必要である。
インドの特定の臨床文脈に特化した検索拡張生成(RAG)システムであるVITAの性能を、HealthBenchベンチマークを用いて評価した研究である。VITAは、疾患別のガイドライン、インド固有の薬剤耐性データ、国の医薬品集、および資源制約下でのケアプロトコルから情報を検索する。4,023件の英語の質問を用いた評価において、VITAはルーブリックに基づく合計得点で51.9%を獲得し、GPT-5.4(46.1%)やClaude Sonnet 4.6(37.3%)などの汎用LLMを上回る総合1位の結果を示した。特に、臨床的な正確性、回答の網羅性、および文脈への適応性において汎用モデルよりも高いスコアを記録し、個別の質問比較においても次点のモデルの2.6倍にあたる1,827問で最高スコアを獲得した。検証として、より新しいモデル群と中立的な評価モデルを用いた500問のサブセット評価においても、VITAは臨床的な価値を重視した加重スコアや、単独で最高回答を出した回数において優位性を維持した。一方で、汎用LLMはコミュニケーションの質や指示への追従性においてVITAを上回る結果となった。
臨床特化型RAGシステムであるVITAは、4,023問の英語によるHealthBenchを用いた評価において51.9%のスコアを獲得し、GPT-5.4の46.1%などの最新の汎用大規模言語モデルを上回る性能を示しました。医師による評価では、VITAは根拠の質、正確性、および情報の網羅性において利点がある一方、コミュニケーションの洗練度には課題があることが示されています。中立的な評価者による感度分析では、VITAの平均スコアは51.0%となり、GPT-5.5の52.0%との差は統計的な有意差がなく、最先端モデルと同等の性能であることが確認されました。本研究の限界として、評価指標や評価者が主に西洋の臨床文脈に基づいて作成されているため、低中所得国(LMIC)の状況を過小評価する可能性や、英語のみの評価であるため多言語能力が十分に検証されていない点が挙げられます。結論として、特定の臨床コンテキストや評価基準に依存するものの、専用設計された臨床AIシステムが汎用モデルと同等以上の性能を発揮し得ることを示しています。