IteraSim RAG: A Multi-Stage Retrieval-Augmented Agentic Back-End for OpenFOAM-Based Computational Fluid Dynamics

Pratyush Kumar
採択先: 未取得 ・ 2026-07-22 ・ source: arxiv
補充候補公開日 2026-07-22キーワード一致 2被引用 0関連度 5本文(arXiv)読む価値 4/5
RAGの検索精度向上に向けた多段階パイプライン(RRF/MMR)や、役割分担型エージェントによる自己修正ループの設計が具体的で、実用性が高い。
本文取得済み: 本文(arXiv)を根拠に要約しています。
Retrieval-Augmented GenerationRAG
一言で: OpenFOAMを用いた数値流体力学(CFD)の設定自動化において、単一クエリによる検索の語彙不一致や、設計とレビューの混同によるハルシネーションといった課題を解決する、マルチステージの検索拡張生成(RAG)エージェント・バックエンドを提案する。

どんなもの?

数値流体力学(CFD)のセットアップおよびデバッグを支援するためのシステムを対象としている。従来のLLMベースの支援システムでは、単一クエリによる検索における語彙の不一致や冗長性、クエリ種別に応じたルーティングの欠如、および設計プロセスとレビュープロセスが混在することによるハルシネーションが困難であった。本研究は、OpenFOAMのケース構築におけるこれらの課題を解決するための、マルチステージのRAGバックエンドの構築を目指している。

先行研究と比べてどこがすごい?

従来の単一クエリによるフラットな検索や一律な検索戦略、および生成と自己レビューが混在する構成に対し、3段階の検索パイプラインと役割分担されたエージェント構成を導入した点が新規である。具体的には、LLMによるクエリ拡張、Reciprocal Rank Fusion(RRF)による統合、およびMaximal Marginal Relevance(MMR)による再ランキングを組み合わせた検索プロセスを実現している。また、決定論的なキーワード駆動型分類器によるデュアルモード・ルーターと、Architect、InputWriter、Reviewerという3つの役割を持つエージェント構成により、専門的な知見の欠落を防いでいる。

技術や手法のキモはどこ?

検索プロセスは、LLMがクエリを物理、ソルバーキーワード、トラブルシューティングの3側面へ拡張し、RRFを用いてランキングを統合した後、MMRを用いて多様性と関連性のトレードオフを制御する3段階の構成をとる。RRFのスコアは $\sum_{l \in L} \frac{1}{\text{rank}(d, l) + k}$ ($L$ はリストの集合、$k=60$)で計算され、MMRは $\text{arg max}_{d \in \mathcal{D} \setminus S} [\lambda \cdot \text{sim}(d, q) - (1-\lambda) \cdot \max_{s \in S} \text{sim}(d, s)]$ によって制御される。システムは、決定論的な分類器により、ツール依存の「Workflow mode」と広範な物理知識を扱う「Expert mode」を切り替える。生成フェーズでは、Architect、InputWriter、Reviewerの3エージェントが協調し、Reviewerがログからエラーを特定してInputWriterにフィードバックする修正ループを最大10回まで繰り返す。

どうやって有効だと検証した?

4つの難易度層からなる28ケースのベンチマークを用いて評価を行った。検索段階の評価指標 $S$ は、期待されるタグの集合 $\mathcal{T}$ と、検索結果に含まれるタグの集合 $\text{op}(C)$ およびターゲットとなるソルバー名 $\text{solver}(i)$ を用いて $S = \frac{|\text{op}(C) \cap \mathcal{T}|}{|\mathcal{T}|} + \mathbb{I}(\text{solver}(i) \in \text{op}(C))$ と定義される。実験の結果、検索カバレッジの平均は $0.85$(中央値 $0.88$)に達し、パラメータ変更カテゴリでは $0.95$ を超える性能を示した。また、OpenFOAM v2506において全28構成が正常にメッシュ生成および計算完了に到達し、合成的に破損させたケースの診断と修復にも成功した。

議論はある?(限界・課題)

本手法は、クエリ拡張により計算負荷が4倍に増大するものの、エンドツーエンドの遅延を3秒未満に抑えるというトレードオフを実現している。今後の課題として、よりニッチなソルバー群へのコーパス拡張、各コンポーネントの要因解析、および物理的な妥当性を直接評価するための物理忠実度評価器の追加が挙げられている。

セクション別の詳細要約

IteraSim RAG: A Multi-Stage Retrieval-Augmented Agentic Back-End for OpenFOAM-Based Computational Fluid Dynamics

IteraSim RAGは、OpenFOAMを用いた数値流体力学(CFD)の設定自動化を目的とした、マルチステージの検索拡張生成(RAG)バックエンドである。検索プロセスは、LLMによるクエリの物理・ソルバーキーワード・トラブルシューティングへの拡張、Reciprocal Rank Fusionによるランキングリストの統合、そしてHNSWインデックス化された高密度ベクトルストアに対するMaximal Marginal Relevanceを用いた再ランキングという3段階で構成される。システムは、決定論的なキーワードルーターによって、ツール条件付きのワークフロークエリとコーパス全体の物理クエリを分離して処理し、さらにArchitect、InputWriter、Reviewerという役割の異なる複数のエージェントと、ソルバー選択や境界条件をカバーする静的な標準知識層を用いて生成を行う。28ケースのベンチマークを用いた評価では、平均検索カバレッジが $0.85$(中央値 $0.88$)に達し、特にパラメータ変更カテゴリでは $0.95$ を超える性能を示した。また、OpenFOAM v2506において全6件のリファレンス構成が正常に完了したほか、ソルバーログと標準知識層のみを用いて、合成的に破損させた2件のケースの診断と修復に成功している。

1 Introduction

IteraSim RAGは、OpenFOAMを用いた数値流体力学(CFD)のセットアップおよびデバッグを支援するために設計された、マルチステージの検索拡張生成(RAG)エージェント・バックエンドである。既存のLLMベースのCFD支援システムにおける、単一クエリによる検索の語彙不一致や冗長性(L1)、クエリ種別に応じたルーティングの欠如(L2)、および設計とレビューの混同によるハルシネーション(L3)という3つの課題を解決することを目的としている。手法として、まずクエリを物理、ソルバーキーワード、トラブルシューティングの3つの側面へ再構成し、Reciprocal Rank Fusion(RRF)による統合とMaximal Marginal Relevance(MMR)による再ランク付けを行う3段階の検索パイプラインを導入している。次に、18カテゴリのCFDオントロジーに基づく決定論的なキーワード駆動型分類器を用い、ツール依存のワークフローモードと広範な物理知識を扱うエキスパートモードを切り替えるデュアルモード・ルーターを実装している。エージェント構成においては、Architect、InputWriter、Reviewerの3者による役割分担に加え、ソルバーの構文や境界条件の選択ルールを保持する正準知識層(canonical-knowledge layer)をコンテキストに注入することで、専門的な知見の欠落を防いでいる。このシステムは、OpenFOAMだけでなく、snappyHexMeshやGmshなどのツールとも結合可能な、ソルバーに依存しない拡張性を備えている。

2 Methodology

IteraSim RAGは、OpenFOAMを用いた数値流体力学(CFD)のケース構築を支援する、マルチステージの検索拡張生成(RAG)エージェント・バックエンドである。知識コーパスは、専門家のノート、フォーラムのFAQ、OpenFOAMのチュートリアル、FoamGPTのQA、およびSandia国立研究所のWEC拡張ドキュメントの5つのソースから構成され、セクション単位のチャンク分割とHNSWグラフインデックスを用いたベクトル検索が行われる。検索パイプラインは、LLMによる3つの異なる側面(物理、OpenFOAMキーワード、トラブルシューティング)へのクエリ拡張、Reciprocal Rank Fusion(RRF)を用いた多重クエリ検索、およびMaximal Marginal Relevance(MMR)による再ランキングの3段階で構成される。RRFのスコアは $\sum_{l \in L} \frac{1}{\text{rank}(d, l) + k}$ (ここで $L$ はリストの集合、$k=60$)で計算され、MMRは $\text{arg max}_{d \in \mathcal{D} \setminus S} [\lambda \cdot \text{sim}(d, q) - (1-\lambda) \cdot \max_{s \in S} \text{sim}(d, s)]$ によって、ワークフローモード($\lambda=0.7$)またはエキスパートモード($\lambda=0.3$)に応じて多様性と関連性のトレードオフを制御する。システムは、決定論的な意図分類器により、特定のツールに特化した「Workflow mode」と、物理的概念を扱う「Expert mode」の2つの検索モードを使い分ける。生成フェーズでは、Architect(シミュレーション設計)、InputWriter(設定ファイル作成)、Reviewer(実行とエラー解析)の3つのエージェントが協調し、Reviewerがログからエラーを特定してInputWriterにフィードバックする修正ループを最大10回まで繰り返すことで、検証済みのOpenFOAMケースを出力する。

3 Results and Discussion

IteraSim RAGの性能評価は、4つの難易度層(Category A: ゼロショット設定、B: Few-shot、C: パラメータ変更、D: 物理モデル変更)からなる28ケースのベンチマークを用いて行われた。評価指標として、まず検索段階(Retrieval tier)において、期待される物理タグの集合 $\mathcal{T}$ が検索されたコンテキストブロック $C$ に含まれる割合を測るスコア $S$ を定義している。このスコアは、期待されるタグの集合 $\mathcal{T}$ と、ターゲットとなるソルバー名 $\text{solver}(i)$ を含む、検索結果に含まれるタグの集合 $\text{op}(C)$ を用いて、以下のように算出される。
$$S = \frac{|\text{op}(C) \cap \mathcal{T}|}{|\mathcal{T}|} + \mathbb{I}(\text{solver}(i) \in \text{op}(C))$$
ここで $\mathbb{I}$ は指示関数である。検索段階の実験結果では、中央値で $0.92$ という高いスコアを記録し、特にパラメータ変更を伴うCategory Cでは中央値 $1.0$ を達成した。アブレーション研究の結果、マルチクエリによるクエリ拡張(L1)と、定型知識層(canonical-knowledge layer)の導入が、検索品質の向上に最も大きく寄与していることが示された。また、エンドツーエンドの実行可能性(Executability tier)については、メッシュ生成からソルバーの収束、および指定パラメータの正確性までを0から4の5段階で評価するルーブリックが設定されている。

4 Conclusion

IteraSim RAGは、OpenFOAMを用いた数値流体力学(CFD)において、単一クエリによるフラットな検索、一律な検索戦略、および生成と自己レビューの混在という従来手法の課題を解決する、マルチステージの検索拡張エージェント・バックエンドである。本手法は、LLMによるクエリ拡張、Reciprocal Rank Fusionによるリスト統合、およびMaximal Marginal Relevanceによる再ランキングからなる3段階の検索パイプライン、ツール利用を目的としたクエリと知識検索を分ける決定論的ルーター、そしてArchitect–InputWriter–Reviewerからなる3エージェント構成のオーケストレーターを統合している。28ケースのベンチマークにおいて、検索層の評価では期待される物理・ソルバー・キーワードのタグに対する平均カバレッジが $0.86$ に達し、パラメータ変更カテゴリでは $0.93$、few-shotカテゴリでは $1.0$ を記録した。また、乱流モデルの入れ替えカテゴリでも平均 $0.89$(最小 $0.75$)という高い性能を示し、end-to-endの遅延もクエリ拡張による4倍の負荷増にもかかわらず3秒未満に抑えられている。実行可能性の観点では、全28構成がOpenFOAM v2506上で正常にメッシュ生成および計算完了に到達し、ソルバーログのみからエラーを診断・修復できる能力が確認された。今後の展望として、ニッチなソルバー群へのコーパス拡張、各コンポーネントの要因解析(ablation study)、および物理的な妥当性を評価する物理忠実度評価器の追加が挙げられている。

CRediT authorship contribution statement

本研究は Pratyush Kumar によって単独で行われ、概念化、手法の設計、ソフトウェアの実装、調査、データキュレーション、形式的な分析、可視化、資金獲得、および論文の執筆(初稿作成および校閲・編集)を含む、研究のあらゆる側面を同氏が担当している。

Declaration of competing interest

著者は、本論文で記述されている独自の検索エンジンを開発している IteraSim 社に対して金銭的な利害関係を有している。一方で、公開されたベンチマーク、採点ルーブリック、および図作成用のスクリプトについては、当該のプロプライエタリなコンポーネントとは独立しており、オープンに提供されている。著者は、これら以外の競合する金銭的または個人的な利害関係はないことを宣言している。

Data availability

本研究で用いられた28ケースのベンチマーク仕様、機械判読可能なベンチマーククエリ、および査読ループにおけるOpenFOAMの致命的エラー(FATAL error)のプローブ結果は、MITライセンスの下で公開されている。また、検索層のスコアリング基準、leave-one-outによるアブレーション解析の記録(30個のクエリと各構成におけるクエリごとのスコア)、参照ケースの実行可能性記録、および図の再生成用スクリプトも、GitHubおよびZenodoを通じて利用可能である。一方で、IteraSim RAGの検索エンジン、Architect–InputWriter–Reviewerからなるオーケストレーター、標準的な知識層、およびデータ取り込みパイプラインは、IteraSim社の商用知的財産であり、著者へのリクエストを通じて学術的共同研究または商用ライセンスの提供が行われる。

Declaration of generative AI and AI-assisted technologies in the manuscript preparation process

本論文の作成過程において、著者は原稿のテキスト編集および校閲、$\text{LaTeX}$ によるフォーマット調整、ならびに参考文献リストの完全性と一貫性の確認を目的として、Anthropic 社の Claude を使用した。AI ツールの使用後、著者は必要に応じて内容の確認と修正を行い、出版される論文の内容に関する全責任を著者が負うことが明記されている。