従来のユークリッド空間を用いた密ベクトル検索では、半径 $r$ の球の体積が多項式的にしか増加しないため、意味的に異なる階層的文書が近接してしまう「混雑現象」が発生する。本研究は、エッジデバイスというリソース制約下において、自然言語の持つ階層的な分岐構造を適切に表現しつつ、リアルタイムな検索を行うことを目的としている。対象は中規模の文書集合であり、入力としてクエリと文書チャンク、出力として再ランキングされた文書候補を扱う。
先行研究のHypRAGなどが高度なプーリング演算子を用いるのに対し、本研究は既存のBGE-small埋め込みを軽量な2層の非線形変換によって双曲空間へ写像するHyTE-H投影モジュールを導入している。これにより、エンコーダ自体の微調整やGPU推論を必要とせずに、単語埋め込みのみで階層的な表現を獲得できる。また、BM25による語彙検索とローレンツ内積による密ベクトル検索を組み合わせた、エッジ向けに最適化されたハイブリッドな検索パイプラインを構築した点に新規性がある。
システムは、オフラインのインデックス作成とオンラインの2段階検索で構成される。インデックス作成では、文書をチャンク化し、BGE-smallから得た384次元の埋め込み $x$ を、HyTE-H投影モジュール $f(x) = W_2 \text{ReLU}(W_1 x)$ を通じてローレンツ双曲面へ写像する。この際、時間座標 $x_0$ は $\cosh(\sqrt{-\kappa} x_0) = \sqrt{1 + \sum_{i=1}^d x_i^2}$ の制約に基づき決定される。検索フェーズでは、まずBM25で候補を抽出した後、語彙スコア $S_{\text{lex}}$ と、ローレンツ内積をロジスティック関数で $[0, 1]$ に写像したスコア $S_{\text{hyp}}$ を用いて、式 $S = \alpha \cdot S_{\text{lex}} + (1 - \alpha) \cdot S_{\text{hyp}}$ により再ランキングを行う。
BEIRベンチマークの5つのデータセットを用いて評価を行った。NDCG@10において、SciFactで0.654、NFCorpusで0.304、ArguAnaで0.342、SciDocsで0.150、FiQAで0.217を達成した。最大59,216チャンクのFiQAではクエリあたり29 msのレイテンシであったが、Android端末での実装では、1,500チャンクのインデックスを10 ms未満でロードし、全検索プロセスを約3 msで完了するリアルタイム性を確認した。また、概念の具体性が増すにつれてローレンツ埋め込みの動径座標が原点から遠ざかるという、期待通りの放射状階層特性も検証された。
本手法は、検索品質がランキングメカニズムよりも単語埋め込み自体に強く依存することを示しており、今後はHyTE-FHのような微調整済み双曲エンコーダへの置換が課題となる。また、現在はコーパスサイズに対してレイテンシが線形に増加するため、百万規模のコーパスへスケールさせるには、双曲ランダム投影やグラフベースのナビゲーションを用いた近似最近傍探索の導入が必要である。さらに、原点からの距離を利用した検索深度の適応や、双曲LLMとの統合による幾何学的な整合性の確保も今後の展望として挙げられる。
本研究は、エッジデバイス上でのRAG(Retrieval-Augmented Generation)を想定し、ローレンツ・モデルに基づく双曲幾何空間内で完結するハイブリッド文書検索システムを提案している。手法として、事前学習済みの単語埋め込みを学習済みのHyTE-H変換を用いて双曲空間へ投影し、自然言語の階層構造に適した指数関数的な体積成長を利用して文書をインデックス化する。検索プロセスは、まずBM25による語彙的スコアリングを行い、次に候補をローレンツ内積類似度を用いて再ランキングする2段階のパイプラインで構成され、調整可能なパラメータによって両スコアを混合する。BEIRベンチマークのSciFact、NFCorpus、ArguAna、SciDocs、FiQAの5つのデータセットを用いた評価では、微調整されたニューラルエンコーダやクロスアテンションを用いたリランカーを使用せずに、単語埋め込みのみでNDCG@10においてそれぞれ0.654、0.304、0.342、0.150、0.217を達成した。本システムは、数万件規模の中規模文書に対してリソース効率の高いクエリ実行を可能にし、エッジデバイス上でのインタラクティブな遅延での動作を実現している。
現代のRAG(Retrieval-Augmented Generation)において、従来のユークリッド空間を用いた密ベクトル検索は、自然言語の階層構造を表現する際に、半径 $r$ の球の体積が多項式的にしか増加しないために生じる「混雑現象(crowding phenomenon)」により、意味的に異なる階層的文書が近接してしまう課題がある。これに対し、定曲率 $\kappa < 0$ のローレンツ双曲面モデルを用いることで、球の体積が半径に対して指数関数的に増加するため、自然言語の階層的な分岐構造を効率的に表現でき、原点からの距離によって概念の具体性を表現することが可能となる。本研究では、エッジデバイス向けに最適化された、以下の4つのコンポーネントからなるハイブリッドな双曲空間検索システムを提案する。まず、既存のBGE-small埋め込みを、MS MARCOの文書ペアを用いた対照学習に基づく2層の非線形変換によってローレンツ双曲面へ写像するHyTE-H投影モジュール、次に、float32のローレンツベクトルとして文書チャンクを格納し、内積最大化により全探索を行うローレンツインデックス、さらに、BM25による語彙スコアとローレンツ類似度を $\alpha$ によって混合して再ランキングを行うハイブリッドBM25-Lorentzリランキングパイプライン、そしてこれら全ての処理を自己完結的なC++共有ライブラリとしてパッケージ化したエンドツーエンドのランタイムである。本システムは、BEIRの5つのデータセットを用いた評価を通じて、その有効性とエッジデバイスへの実装における工学的課題が検討される。
双曲幾何を用いた表現学習は、階層構造を持つデータを低歪度で埋め込めるポアンカレ球モデルから、数値的安定性に優れたローレンツ(双曲面)モデルへと発展しており、後者は内積を用いた測地線距離の計算が可能なため、ニューラル双曲学習の主流となっている。先行研究のHypRAGでは、トークンレベルの点を集約する際に、単純なユークリッド的な平均では階層情報が消失する問題を解決するため、Outward Einstein Midpoint (OEM) というプーリング演算子が導入されている。OEMは、ミンコフスキー空間における重み付き和 $s = \sum_{i=1}^{n} w_{\tau_i} x_i$ を計算した後、半径方向の再スケーリング $x_{\text{agg}} = \frac{s}{\sqrt{\langle s, s \rangle_{\mathcal{L}} + 1}}$ によって双曲面上へ再投影する手法であり、重み $w_{\tau_i} = \exp(\alpha \tau_i)$ によって時間座標 $\tau_i$ が大きい(より具体的な)概念を強調する。この $\alpha$ の値により、標準的なアインシュタイン中点($\alpha=0$)、緩やかな特異性バイアス($\alpha=1$)、あるいは最大値プーリング($\alpha \to \infty$)へと挙動が変化し、HypRAGはこれを用いてMTEB等のベンチマークでユークリッド基盤手法に対し最大29%の精度向上を達成している。本研究のシステムは、エッジデバイスの制約下で、BM25による疎な語彙検索で候補集合を抽出した後、ローレンツ内積を用いた類似度計算によって再ランキングを行う、疎・密ハイブリッド検索の構成を採用している。
本手法は、エッジデバイス上での動作を想定した、双曲空間におけるハイブリッド検索システムである。システムは、オフラインでのインデックス作成フェーズと、オンラインでの2段階検索フェーズで構成される。インデックス作成では、ドキュメントをスライディングウィンドウを用いてチャンク化し、BGE-small-en-v1.5から抽出した384次元の単語埋め込みを、2層の非線形変換を行うHyTE-H投影モジュールを用いて、定曲率 $\kappa < 0$ のローレンツ双曲モデル上の点へと写像する。この投影は、入力 $x$ に対して $f(x) = W_2 \text{ReLU}(W_1 x)$ という形式で計算され、得られた空間座標から時間座標 $x_0$ を $\cosh(\sqrt{-\kappa} x_0) = \sqrt{1 + \sum_{i=1}^d x_i^2}$ の制約に基づき決定することで、双曲空間内の点を得る。検索フェーズでは、まずBM25による語彙検索で候補を絞り込み、次にクエリのローレンツ埋め込みと候補のローレンツ内積を用いた類似度スコアを線形補間する式 $S = \alpha \cdot S_{\text{lex}} + (1 - \alpha) \cdot S_{\text{hyp}}$ によって再ランキングを行う。ここで $S_{\text{hyp}}$ は、計算コストの高い測地線距離の代わりに、ロジスティック関数を用いてローレンツ内積を $[0, 1]$ の範囲に写像したものである。HyTE-Hの投影重みはMS MARCO v1.1を用いて対照学習されており、学習パラメータ数は196,608個と極めて軽量であるため、エッジデバイスへの展開に適している。
BEIRベンチマークに含まれるSciFact、NFCorpus、ArguAna、SciDocs、FiQAの5つのデータセットを用い、BGE-small-en-v1.5の単語埋め込みをHyTE-H投影(曲率 $\kappa$、OEM電力)を用いて評価した。実験では500単語のウィンドウと90単語のオーバーラップを持つチャンク分割を使用し、評価指標としてNDCG@10、MAP@100、Recall@100を用いた。結果として、$\alpha$ の値やセクションタイトルを用いたチャンク分割、BM25とLorentzを用いた2段階リランキングの有無にかかわらず、NDCG@10の変化は0.001未満であり、検索品質はランキングメカニズムよりも単語埋め込み自体に依存することが示された。検索レイテンシはコーパスサイズに対して線形に増加し、最大のFiQA(59,216チャンク)ではクエリあたり29 msを要したが、SciFactではNDCG@10 = 0.654という高い性能を示し、HyTE-H投影がドメイン固有の用語を保持できることが確認された。また、HyTE-H投影が期待通りの放射状階層を生成するかを検証したところ、概念ペアの多くで、より具体的な用語のLorentz埋め込みの動径座標が、より一般的な用語よりも原点から遠くなるという特性が確認された。Android端末(Samsung SM-S721)への実装では、1,500チャンクのインデックスを10 ms未満でロードでき、BM25検索とLorentzによるリランキングを含む全検索プロセスをクエリあたり約3 msで完了するリアルタイム性を実現している。
本研究は、エッジデバイス向けに設計された、双曲空間におけるハイブリッドな検索システムを提案している。この手法は、凍結された BGE-small 単語埋め込み、ローレンツ双曲面への HyTE-H による学習済み投影、BM25 による語彙スコアリング、および調整可能なローレンツ再ランキングを組み合わせたものである。わずか $200\text{K}$ 個のパラメータを持つ軽量な学習済み投影を用いることで、エンコーダの微調整や GPU 推論を必要とせず、5 つの BEIR データセットにおいて競争力のあるゼロショット検索を実現しており、クエリあたり $3\text{ms}$ 未満というインタラクティブな遅延で動作する。今後の展望として、埋め込みの品質向上に向けた HyTE-FH のような微調整済み双曲エンコーダへの置換、双曲ランダム投影やグラフベースのナビゲーションを用いた近似ローレンツ最近傍探索による百万規模のコーパスへのスケールアップ、原点からの距離が特異性を表す放射状階層を利用した検索深度の適応、そして HELM のような双曲 LLM との統合による幾何学的な整合性の確保が挙げられている。