Multi-agent Path Finding for Mixed Autonomy Traffic Coordination

Han Zheng, Zhongxia Yan, Cathy Wu
採択先: IEEE/RJS International Conference on Intelligent RObots and Systems 2024 ・ 2024-09-05 ・ source: arxiv
補充候補採択先 IEEE/RJS International Conference on Intelligent RObots and Systems 2024公開日 2024-09-05キーワード一致 2被引用 3関連度 5本文(arXiv)読む価値 4/5
MAPFを混合自律走行に適用し、HDVの反応を予測モデルで組み込む手法は新規性が高い。実験も多角的に行われており、実用的な課題解決への貢献が期待できる。
本文取得済み: 本文(arXiv)を根拠に要約しています。
Multi-Agent Path FindingMAPF
一言で: 自動運転車(CAV)と手動運転車(HDV)が混在する環境において、HDVの反応を予測してCAVの経路を計画するBK-PBSを提案し、衝突回避と走行遅延の低減を実現した。

どんなもの?

制御可能なCAVと、周囲の車両に反応して動く制御不能なHDVが混在する高速道路の交通協調を対象とする。従来のマルチエージェント経路探索(MAPF)アルゴリズムは、すべてのエージェントの挙動を完全に制御できることを前提としており、予測不可能なHDVが存在する混合交通環境には適用できないという課題がある。本研究では、CAVが目標地点の集合に到達するまでの総走行遅延を最小化しつつ、衝突を回避する経路計画を目的とする。

先行研究と比べてどこがすごい?

混合自律走行の研究において、従来のモデルベースの制御や強化学習とは異なり、探索ベースのプランニングにHDVの挙動予測を統合した点が新規である。HDVを単なる動的な障害物として扱うのではなく、CAVの動きに対するHDVの反応を予測する条件付き予測モデルを戦略的な意思決定プロセスに組み込むことで、混合交通におけるMAPFを実現した。

技術や手法のキモはどこ?

優先度に基づく探索(PBS)を拡張したBK-PBSを用いる。衝突が発生した場合、優先度ツリーを用いて車両間の優先順位を決定する。HDVに低い優先度を割り当てた場合は、グラフ畳み込みネットワーク(GCN)を用いた条件付き予測モデルにより、CAVの計画軌道に応じたHDVの将来の車線変更行動を予測し、制約として利用する。低レベルの経路計画には、自転車モデルに基づく運動学的制約を満たすため、加速、減減速、待機、車線変更、緊急ブレーキなどの動作プリミティブを用いた多段階A*探索(M-A*)を用いる。

どうやって有効だと検証した?

高速道路の合流シナリオのシミュレーションにおいて、分散型計画のBK-M-A*、ルールベースのIDM+MOBIL、強化学習のRL-PPOと比較した。評価指標は、CAVが関与する衝突率(controllable collision rate)と、衝突せずに終端に到達した車両の平均走行遅延である。実験の結果、高密度な交通条件下において、BK-PBSはIDM+MOBILと比較して総走行遅延を15%から20%削減した。

議論はある?(限界・課題)

予測モデルの精度において、合流路(ランプ)に比べ本線での車線変更予測に限界がある。また、極めて高密度な交通条件下では、頻繁な車線変更を避けるルールベース手法の方が衝突率が低くなる場合がある。今後の課題として、より高度な行動予測手法の統合、制御バリア関数による安全性の強化、大規模ネットワークへの適用拡大が挙げられる。また、衝突による連鎖反応を考慮した実環境での検証も必要である。

セクション別の詳細要約

Multi-agent Path Finding for Mixed Autonomy Traffic Coordination

本研究では、制御不能な人間運転車両(HDV)と制御可能な自動運転車両(CAV)が混在する交通環境に対応するため、BK-PBS(Behavior Prediction Kinematic Priority Based Search)を提案している。この手法は、CAVの挙動に対するHDVの反応を予測する、オフライン学習済みの条件付き予測モデルを活用している。探索アルゴリズムには、優先度に基づく探索(PBS)を拡張した仕組みを採用しており、運動学的制約を考慮するために、動作プリミティブを用いたA*探索を行うことで車両の動きを考慮した経路計画を実現している。高速道路の合流シナリオを用いたシミュレーションにおいて、CAVの普及率や交通密度を変化させた条件下で評価を行った結果、ルールベースの車間距離モデルや強化学習を用いた手法と比較して、衝突率の低減およびシステム全体の走行遅延の改善において優れた性能を示した。

I Introduction

自動運転車(CAV)と手動運転車(HDV)が混在する交通環境において、HDVの予測不可能な挙動に対応するための新手法であるBehavior Prediction Kinematic Priority Based Search(BK-PBS)を提案する。従来のPriority Based Search(PBS)は、エージェント間の優先順位を割り当てて衝突を回避する手法だが、すべてのエージェントを完全に制御できることを前提としており、制御不能なHDVが存在する混合交通には適さないという課題がある。BK-PBSは、まずオフラインでHDVがCAVの動きに対してどのように反応するかを予測する条件付き予測モデルを学習させ、CAVに高い優先順位が割り当てられた際に、その予測モデルを用いてHDVの将来の軌道を推定することで、CAVがHDVの反応を考慮した能動的な調整を行う。また、CAVの経路計画には、車両の現実的な動きを特徴付ける運動学的制約を考慮するため、モーションプリミティブを用いた低レベルのA*探索を組み込んでいる。高速道路の合流車線を用いたシミュレーション実験の結果、BK-PBSはCAVの普及率や交通密度が変化する条件下において、衝突率の低減およびシステム全体の走行遅延の抑制において、ベースライン手法を上回る性能を示した。

II Related Work

混合自律走行環境における交通協調の研究は、自動運転車(CAV)と手動運転車(HDV)が混在する設定においては未だ限定的であり、既存手法はモデルベースの制御による車間距離維持や、衝突回避を明示的に考慮しない強化学習による制御に留まっている。本研究は、混合自律走行において探索ベースのプランニング手法を検討し、さらに周囲のHDVの挙動を既知の特性として扱うのではなく、その挙動予測を組み込んでいる点が特徴である。挙動予測の分野では深層学習を用いた将来位置の予測が主流であるが、本研究は予測モデル自体の設計ではなく、既存の予測モデルをCAV群の戦略的プランニングに統合し、動的な意思決定と安全性を両立させることに焦点を当てている。マルチエージェント経路探索(MAPF)は、離散グラフ上で衝突を回避する最短経路を求めるNP困難な問題であり、計算量の爆発を避けるためにA*探索などの単一エージェント用プランナーを繰り返し呼び出し、他者の経路を制約として扱う手法が一般的である。代表的なアルゴリズムとして、個別の最短経路を求めた後にバックトラッキングを用いて衝突を解消するConflict-based Search(CBS)や、エージェント間の優先順位を探索することでスケーラビリティを高めたPriority-based Search(PBS)が存在する。連続空間においては、サンプリングベースの手法とMAPFを組み合わせる、あるいは空間を離散化するアプローチが取られているが、混合自律走行環境にMAPFを適用した研究は、著者らの知る限り存在しない。

III Problem Formulation

本研究では、高速道路における混合交通の調整問題を、エージェントの移動をグラフ上のノード遷移として扱うマルチエージェント経路探索(MAPF)の枠組みで定式化しています。制御対象となるCAV(接続自動運転車)に対し、HDV(手動運転車)は周囲の車両の状態に反応して動く非制御エージェントとして扱います。CAVの目標は単一の地点ではなく、走行車線や合流車線の状況に応じた一定距離以上の前方地点、あるいは合流ゾーン終了前の隣接車線上の地点を含む目標集合として定義されます。アクションには、加速や車線変更などの高レベルな操作を包含するモーションプリミティブを採用しており、CAVの次時刻の遷移は決定論的なモデルに従う一方、HDVの遷移は周囲の車両の速度や加速度などの状態に依存します。解の条件は、すべてのCAVが衝突を回避しながらそれぞれの目標集合に到達することであり、目的関数は、車両が他の車両を無視して最大速度で走行した場合の理想的な到着時刻と、計画後の実際の到着時刻の差である総遅延コストの最小化として定義されます。車両の運動学モデルには、計算効率と精度のバランスに優れた自転車モデルを採用しており、制御入力として加速度と前輪の操舵角を用います。

IV Method

提案手法であるBK-PBSは、自動運転車(CAV)と手動運転車(HDV)が混在する交通環境において、優先度ベース探索(PBS)に学習済みの条件付き予測モデルを統合した集中型経路計画アルゴリズムである。低レベルの経路計画には、車両の運動学的制約を満たすために、加速、減速、停止、車線変更、緊急ブレーキといった動作プリミティブを用いる多段階A*探索(M-A*)を採用している。M-A*は、まず目標地点への最短経路を探索し、失敗した場合には安全な減速を優先する第2段階の探索を行うことで、計画の実現可能性を高めている。BK-PBSは優先度ツリーを深さ優先探索し、CAVとHDVの衝突が発生した場合、HDVに高い優先度を与えるか、あるいはCAVの動きに応じてHDVの挙動を予測し直すかという2つの分岐を行う。この予測にはグラフ畳み込みネットワーク(GCN)を用いた条件付き予測モデルが使用され、周囲の車両の状態と、より高い優先度を持つCAVの計画済み軌道をグラフ構造として入力することで、HDVの将来の車線変更行動を予測する。これにより、HDVの動きを単なる動的障害物として扱うだけでなく、CAVの動きに反応する主体として捉えた、先見的な協調制御を実現している。

V Experimental Setup

HighwayEnvを拡張したシミュレーション環境を用い、自動運転車(CAV)と手動運転車(HDV)が混在する高速道路の交通をモデル化しています。HDVの挙動はIDMおよびMOBILモデルに基づき、ランプ路からの合流には確率的な合流モデルが適用されます。提案手法のBK-PBSおよびBK-M-A*で使用する予測モデルは、グラフ畳み込みネットワーク(GCN)と全結合層を用い、3万件のサンプルを用いてHDVの車線変更確率を予測するように教師あり学習で訓練されています。比較対象には、分散型計画アルゴリズムであるBK-M-A*、ルールベースのIDM+MOBIL、強化学習を用いたRL-PPO、およびBK-A*が設定されています。RL-PPOは、目標速度の維持と最大14台の周囲車両との衝突回避を報酬として、単一車両環境で1e8ステップの学習を経て訓練されます。評価指標には、衝突した車両数と、衝突せずに高速道路の終端に到達した車両の走行遅延が用いられます。

VI Experimental Results

予測モデルのオフライン評価では、ランプと本線の2つのデータセット(各4000サンプル)を用いて、人間運転者(HDV)の車線変更の有無を二値で予測する精度を検証しており、全体として高い精度を得ているものの、本線における予測精度はランプと比較して限定的であることが示されている。制御可能な衝突率の評価では、自動運転車(CAV)が関与する衝突のみを対象としており、提案手法であるBK-PBSは、強化学習を用いたRL-PPOよりも低い衝突率を達成している。ルールベースのIDM+MOBILは交通密度に対する堅牢性を示す一方で、高密度条件下ではMOBILモデルによる車線変更の抑制により、最短経路を優先して頻繁に車線変更を行うBK-PBSよりも衝突率が低くなる傾向がある。また、BK-M-A*はCAV同士の衝突を解決できないため、BK-PBSと比較して衝突率が高く、CAVの普及率が高まるにつれて衝突率が上昇する。走行遅延の比較において、IDM+MOBILやBK-M-A*がBK-PBSより低い遅延を示すケースがあるが、これは衝突した車両がシナリオから除去されることで交通流が人工的に緩和される影響によるものである。衝突率が同程度であることを考慮して比較した場合、高密度な交通条件下では、BK-PBSはIDM+MOBILに対して総走行遅延を15%から20%削減しており、交通流を円滑化する有効性が確認されている。

VII Conclusions and Future Work

本研究では、自動運転車(CAV)の行動に対する人間が運転する車両(HDV)の反応を予測するために、オフラインで学習された条件付き予測モデルを活用するBK-PBSという新しいフレームワークを提案している。この手法は、運動学的制約を考慮したモーションプリミティブを用いる多段階のA*探索を、優先度ベース探索(PBS)に統合したものである。高速道路の合流シナリオを用いたシミュレーション実験において、交通密度や自動運転車の普及率が異なる条件下で、BK-PBSは既存のルールベース手法や強化学習アルゴリズムよりも衝突回数と走行遅延を低減させた。今後の展望として、より高度な行動予測手法の統合や、制御バリア関数のような安全エンベロープを用いた安全性の強化、さらにはより大規模で一般的なネットワークへの適用拡大が挙げられる。また、衝突による連鎖反応への再計画を考慮するため、シミュレーション上の車両除去ではなく、物理的なテストベッドを用いた検証が実世界への適用に向けた重要な課題である。