OmniSeek:多ターン音声視覚推論のためのネイティブツール統合エージェント

Published · AI Daily — AI-assisted deep research, methodology & disclosure

OmniSeekは、全モーダル大規模言語モデル(Omni-LLM)を、音声や映像全体を一度に処理するのではなく、必要に応じて「見る」「聴く」をツール呼び出しとして能動的に行う多ターン推論エージェントへと変換するフレームワークである。推論の過程で疎だが重要な証拠区間を動的に取得し、文脈に再結合して続きの推論を行う。多段思考連鎖を含む17万件規模の合成軌跡データでコールドスタートし、検証可能な報酬による二段階強化学習と、単一モダリティへの近道を抑制する「音声視覚必要性」目標で方策を最適化し、複数ベンチマークで一貫した性能向上を達成した。

背景と課題の所在

音声・映像・テキストを統合的に扱う全モーダル大規模言語モデル(Omni-LLM)の多くは、依然として音声視覚シーケンス全体を一度のフォワードパスで処理する受動的な方式に依っている。この方式は長時間の録音や映像を扱う際に二つの構造的な問題を抱える。第一に情報の希薄化である。実際に答えを決定づける証拠は全体のごく一部の区間に集中しているにもかかわらず、計算コストは証拠の位置とは無関係に全シーケンス長に対して増大する。

第二に、モデルには自己検証の仕組みがない。最初の一回のパスで証拠の取り込みが不十分であったり、正解が音声と映像の両モダリティの組み合わせを本当に必要とする場合でも、単一パスのモデルは不完全な証拠のまま回答を確定せざるを得ず、やり直しや再検証の余地がない。OmniSeekはこの問題を、能動的な証拠獲得の問題として再定義する。モデルはまず仮説を立て、不足している証拠を見極め、どの時間窓を「見る」べきか「聴く」べきかを決定し、証拠が十分になるまでこれを繰り返すべきであり、入力全体を一括で受動的に消費するべきではない、という立場である。

コアアーキテクチャと技術原理

OmniSeekは、Omni-LLMをネイティブなツール呼び出し能力を持つ多ターン推論エージェントとして再構成する。推論は単一のフォワードパスではなく反復的なプロトコルとして進行する。各ターンでモデルは現在の文脈に基づいて推論し、「見る」または「聴く」ツールを呼び出すべきかを判断し、取得したい区間の時間窓を具体的に指定する。取得された生の音声または映像セグメントは文脈に再び連結され、モデルが証拠を十分と判断するまでこの循環が続く。

この多ターンのツール利用行動をコールドスタートさせるため、著者らはデータ合成エンジンを構築し、音声と映像の証拠取得と推論ステップが交錯する多段思考連鎖の軌跡を17万件規模で合成したOmniTraj-170Kというコーパスを作成した。学習は二段階で行われる。まずこの合成軌跡で教師あり微調整を行い、「推論し、何を取得すべきか決定し、証拠を文脈に接続し、さらに推論する」という行動パターンを植え付ける。続いて検証可能な報酬を用いた二段階の強化学習によって、模倣だけでなくタスクレベルの正解信号に対して検索・推論方策を精緻化する。最も特徴的な設計は「音声視覚必要性」目標であり、正解に至る過程が音声と映像の両方の証拠に本当に依存している軌跡を明示的に報酬として与え、単一モダリティの近道で偶然正解してしまう挙動を抑制する。

実用性と検証結果

この仕組みが実現するのは、適応的な異モダリティ証拠探索である。モデルは入力全体を均一に扱うのではなく、問いの難易度や証拠の分布に応じて、何回検索するか、どの時間窓を対象にするか、音声と映像のどちらを優先するかを柔軟に決定する。

多様な音声視覚推論ベンチマーク群での広範な実験において、OmniSeekは全体を一括で処理するベースライン手法を一貫して上回った。重要なのは、その改善が単一モダリティの強化による偶発的な結果ではなく、音声と映像の両方の証拠を組み合わせることが本質的に必要な事例に集中して現れている点であり、これは「音声視覚必要性」目標が意図した通りの経験的シグナルであり、モデルが単一モダリティの近道ではなく本物の検索型推論能力を学習したことを裏付けている。

業界への影響と今後の展望

OmniSeekは、テキスト専用エージェントでは既に成熟しているネイティブツール利用のパラダイムを音声視覚理解の領域に導入するという、マルチモーダルエージェント工学における重要な方向転換を示している。モデル自身が追加の知覚入力をいつ必要とするかを判断できるようになり、長い録音や映像を事前に固定的な外部パイプラインで切り出したり要約したりする必要がなくなる。

これは長時間動画理解、会議録分析、監視・セキュリティ審査、そして異モダリティ間の裏付けを要する事実確認業務に直接関連する。今後の発展としては、ツールの種類を「見る・聴く」からより豊富な知覚・検索操作(外部検索拡張の呼び出し、専用の物体追跡や音声認識サブモデルの呼び出しなど)へ拡張すること、そしてこの多ターン証拠探索の仕組みをより長いリアルタイムストリーミング入力と組み合わせ、現場での音声視覚オンライン推論に対応させることが考えられる。

Sources

FAQ

OmniSeekが従来の全モーダルモデルと最も異なる点は何か。

従来は音声視覚全体を一度に符号化して単一パスで推論するが、OmniSeekはモデルが多ターンの推論の中でどの時間窓の音声または映像証拠を取得すべきかを能動的に決定し、取得後に文脈へ再結合して推論を続ける反復的な証拠取得プロセスである点が異なる。

OmniTraj-170Kはどのような用途で使われるデータセットか。

音声と映像の証拠取得と推論ステップが交錯する多段思考連鎖の軌跡を約17万件含む合成コーパスであり、教師あり微調整の段階で多ターンのツール利用行動をコールドスタートさせるために使われる。

音声視覚必要性目標はどのような問題を解決するか。

正解に至る過程が音声と映像の両方の証拠に本当に依存している軌跡を明示的に報酬として与えることで、単一モダリティの手がかりだけで偶然正解してしまう近道的な挙動を抑制する。