自動運転システムの検証において、物理的な走行試験では網羅できないエッジケースを扱うための仮想的なシナリオ生成が不可欠である。既存のDSLを用いた生成手法には、既存コードを組み合わせる方式が未知のシナリオへの汎用性に欠け、スクリプトをゼロから生成する方式がコンパイル成功率において低いというトレードオフが存在する。本研究は、複雑な規制仕様に基づいた正確なシナリオスクリプトの自動生成を対象としている。
従来の「Retrieval-Assemble」方式や「Direct Generation」方式の限界を克服するため、RAGと高度なプロンプティング技術を統合した反復的な生成フレームワークを提案している。コンポーネント単位で逐次的に生成を行うアプローチにより、既存の検索・組み立て手法やフルスクリプト生成手法を大幅に上回る性能を達成した。また、NHTSAや国連の車両規制を含む123のシナリオで構成される、体系的な評価のための新しいオープンベンチマークを導入している。
Chat2Scenicは、対話型モジュール、RAGモジュール、生成モジュールの3要素で構成される。対話型モジュールは、ユーザーの自然言語入力をグローバル設定 $\mathcal{C}$ と、空間関係 $\mathcal{R}$、自車挙動 $\mathcal{E}$、物体 $\mathcal{O}$、制約 $\mathcal{T}$ からなるシナリオ構成要素 $\mathcal{S} = \{ \mathcal{R}, \mathcal{E}, \mathcal{O}, \mathcal{T} \}$ へと解釈し、LangGraphを用いて対話状態を保持する。RAGモジュールは、意味検索を用いるコードリトリーバーと、BM25および埋め込みモデルによるハイブリッド検索とReciprocal Rank Fusion (RRF) を用いたドキュメントリトリーバーの二重構成を採用している。生成モジュールは、設定検出器とヘッダー生成器を用いて $\mathcal{C}$ を作成した後、依存関係に従って $\mathcal{R}, \mathcal{E}, \mathcal{O}, \mathcal{T}$ を順次生成し、最終的なScenicプログラム $\mathcal{P}$ を構築する。この過程では、文脈的プロンプティング、Chain of Thought (CoT)、In-Context Learning (ICL)、およびRetrieval-Augmented In-Context Learning (RAG-ICL) が用いられる。
CARLA 0.9.15およびScenic 3.1.0を用い、CARLA Leaderboard、NHTSA、および国連の車両規制から抽出した123個のシナリオ仕様で評価を行った。評価指標には、コンパイル成功率($CSR$)、応答時間($RT$)、トークン使用量、人間による評価に基づくシナリオ品質($SQ$)、および $FA = CSR \times SQ$ で定義されるフレームワーク精度($FA$)を用いた。Gemini-1.5-Flashを用いた実験では、高度なプロンプティングを組み合わせた構成において、$CSR=76.42\%$、$SQ=76.12\%$、$FA=58.17\%$ を達成した。これは、既存の「Retrieval Assemble」手法($CSR=30.08\%$、$FA=11.03\%$)や「Retrieval full script generation」手法($CSR=16.26\%$、$FA=10.86\%$)を大幅に上回る結果である。
アブレーション研究により、ドキュメントを用いたIn-Context Learning (DocICL) の追加は、性能向上に寄与せず、むしろ時間とトークンコストを増大させることが判明している。今後の課題として、シナリオの仕様策定と生成精度をさらに高めるための、画像やスケッチなどのマルチモーダル入力への対応が挙げられる。また、シミュレーション・イン・ザ・ループによるフィードバック機構を統合することも、今後の展望として示されている。
Chat2Scenicは、自動運転の規制記述から実行可能なドメイン固有言語(DSL)のシナリオスクリプトを自動生成するための、反復的な検索拡張生成(RAG)フレームワークである。本手法は、チャットボットインターフェースを通じて対話的なシナリオの洗練を可能にし、RAGを用いることで規制知識とDSLの構文に基づいた正確な生成を実現している。評価には、NHTSAや国連車両規制を含む123のシナリオで構成される新たに提案されたオープンベンチマークが用いられた。実験の結果、Chat2Scenicはコンパイル成功率(CSR)で $76.42\%$、フレームワーク精度(FA)で $58.17\%$ を達成し、既存の「Retrieval Assemble」手法(CSR $30.08\%$、FA $11.03\%$)や「Retrieval full script generation」手法(CSR $16.26\%$、FA $10.86\%$)を大幅に上回る性能を示した。
自動運転システムの検証において、従来の物理的な走行試験は多様なエッジケースを網羅できないため、仮想的なシナリオベースのテストが重要視されている。既存のドメイン固有言語(DSL)を用いたシナリオ生成手法には、既存のコード断片を組み合わせて構築する「Retrieval-Assemble」方式と、スクリプトをゼロから生成する「Direct Generation」方式があるが、前者は未知のシナリオに対する汎用性に欠け、後者はコンパイル成功率が低いというトレードオフが存在する。本研究では、複雑な規制仕様に基づいたシナリオ生成を可能にするため、RAG(Retrieval-Augmented Generation)と高度なプロンプティング技術を活用し、DSLのブロックを反復的に生成するフレームワークであるChat2Scenicを提案する。Chat2Scenicは、ユーザーのクエリを論理的な構成要素へと解釈するインタラクティブ・モジュール、ドメイン知識を検索するRAGモジュール、およびそれらに基づいてDSLスニペットを合成する生成モジュールの3つで構成される。評価においては、CARLA Leaderboard、NHTSA、および国連車両規則から収集した120以上のシナリオ記述を用い、コンパイル成功率、フレームワークの正確性、および意味的な正確性(semantic accuracy)を指標として、既存の最先端手法を上回る性能を実証している。
Chat2Scenicは、対話型モジュール、RAGモジュール、生成モジュールの3要素から構成される、自動運転シナリオ生成のための反復的なフレームワークである。対話型モジュールは、ユーザーの自然言語入力を、グローバル設定 $\mathcal{C}$ とシナリオ構成要素 $\mathcal{S} = \{ \mathcal{R}, \mathcal{E}, \mathcal{O}, \mathcal{T} \}$($\mathcal{R}$ は空間関係、$\mathcal{E}$ は自車挙動、$\mathcal{O}$ は物体、$\mathcal{T}$ は制約)からなる論理構造へと解釈し、LangGraphを用いて対話状態を保持することで逐次的な修正を可能にする。RAGモジュールは、Scenicのコードスニペットとドキュメントから知識を抽出する二重リトリーバー構成を採用しており、コードリトリーバーは $\text{all-MiniLM-L6-v2}$ を用いた意味検索により上位3件のスニペットを、ドキュメントリトリーバーはBM25と埋め込みモデルによるハイブリッド検索とReciprocal Rank Fusion (RRF) を用いて、API定義と背景知識を同時に取得する。生成モジュールは、まず設定検出器とヘッダー生成器を用いて $\mathcal{C}$ を作成し、次に依存関係に従って $\mathcal{R}, \mathcal{E}, \mathcal{O}, \mathcal{T}$ を順次生成して最終的なScenicプログラム $\mathcal{P}$ を構築する。この生成プロセスでは、文脈的プロンプティング、Chain of Thought (CoT)、In-Context Learning (ICL)、および動的な知識注入を行うRetrieval-Augmented In-Context Learning (RAG-ICL) を組み合わせた高度なプロンプティング戦略が用いられる。
本研究では、自動運転シナリオ生成のための反復的RAGベースのフレームワークであるChat2Scenicを提案し、CARLA 0.9.15およびScenic 3.1.0を用いた実験を行っている。評価用ベンチマークとして、CARLA Leaderboard、NHTSAの衝突データセット、および国連の車両規制(UN R152, R157, R171)から抽出された123個のシナリオ仕様を構築した。評価指標には、コンパイル成功率($CSR$)、応答時間($RT$)、トークン使用量に加え、人間によるレイヤー別評価に基づくシナリオ品質($SQ$)と、それらを掛け合わせたフレームワーク精度($FA = CSR \times SQ$)を用いている。アブレーション研究の結果、Contextual Prompting ($CP$)、Chain-of-Thought ($CoT$)、In-Context Learning ($ICL$)、およびCodeICLを組み合わせた構成(C11)が、Gemini-3-Flashにおいて$CSR=76.42\%$、$SQ=76.12\%$、$FA=58.17\%$という最高性能を達成した。また、既存手法であるChatSceneやNL2Scenicと比較して、コンポーネント単位の反復的な生成手法が$CSR$において大幅な向上を示した。一方で、DocICLの追加は性能向上に寄与せず、むしろ時間とトークンコストを増大させることが示された。
本研究では、自動運転シナリオ生成のための初となる反復的な検索拡張生成(RAG)フレームワークであるChat2Scenicを提案した。体系的な評価を実現するために、複数のソースから派生した123個のシナリオで構成される、交通規制に基づいたベンチマークと包括的な評価指標を導入している。アブレーション研究およびモデル間比較の結果、高度なプロンプティング技術(CP、CoT、ICL、およびCodeICLの組み合わせ)を用いることで、Gemini-1.5-Flashを用いた場合に、シナリオの整合性を示すCSRが76.42%、品質を示すSQが76.12%、および実行可能性を示すFAが58.17%を達成し、既存の検索・組み立て手法やフルスクリプト生成手法を大幅に上回る性能を示した。今後の展望として、シナリオの仕様策定と生成精度の向上を目指し、画像やスケッチなどのマルチモーダル入力への対応や、シミュレーション・イン・ザ・ループによるフィードバック機構の統合が挙げられる。