Skild AIがNVIDIA物理AIと連携:スマホ動画1本から汎用ロボットに器用な動作を教示

Published · AI Daily — AI-assisted deep research, methodology & disclosure

身体性AI基底モデルのスタートアップSkild AIは、NVIDIAとの広範な協業を発表しました。世界基底モデル「NVIDIA Cosmos」とRTX GPUクラスタ上で動作するIsaac Sim合成データパイプラインを統合。キャリブレーションされていないスマートフォンの日常動画が1本あれば、わずか数時間で多様な異種ロボットに高精度な手先操作スキルを習得させる技術を確立しました。

背景と技術的概要

ロボット工学および具身知能(Embodied AI)の発展において、高品質な実世界インタラクションデータの不足は長年にわたる最大の障壁でした。自然言語処理のようにインターネット上の膨大なテキストデータを活用できる分野とは異なり、ロボットが物体を操作する物理データは極めて希少です。ケーブルの配線やボトルの開栓といった繊細な手先操作をロボットに習得させるには、これまで高価なモーションキャプチャスタジオを構築するか、専門オペレータがVRゴーグルを用いて何千回も遠隔操作(テレオペレーション)を行う必要があり、多大なコストと時間が普及を阻んできました。

この構造的なデータボトルネックを解消するため、身体性AI基底モデルを手掛けるSkild AIは、半導体大手NVIDIAとの戦略的協業を発表しました。両社は、世界基底モデル「NVIDIA Cosmos」とRTX GPUクラスタ上で動作するIsaac Sim合成データ基盤を結合。一般的なスマートフォンで撮影したわずか1本の未校正ビデオから、数時間のうちに異種ロボットハードウェアへ高度な手先操作スキルをゼロショットで転移・習得させる革新的パイプラインを確立しました。

アーキテクチャと詳細分析

単一視点のスマートフォン動画から実機ロボットの確実な接触制御を実現するプロセスは、「神経物理的ビデオ逆推定」「大規模ドメインランダム化シミュレーション」「基底ポリシーの蒸留」という3つのフェーズで構成されています。 最初のフェーズでは、撮影された動画がNVIDIA Cosmos基底モデルに入力されます。Cosmosは動画を単なるピクセル列としてではなく、ニュートン力学に基づいた物理世界として解釈します。深層ニューラルネットワークが物体の3次元幾何学形状、手先の骨格運動、接触点、摩擦係数、重力ベクトルを自動的に推定します。手ブレや部分的な遮蔽が存在する日常的な撮影環境であっても、頑健な3次元物理インタラクションの事前分布が抽出されます。

第2フェーズでは、再構築された物理事前情報がNVIDIA Isaac Simへと投入されます。BlackwellおよびRTX GPUクラスタによる強力な並列計算能力を活かし、数分間で数万もの並列シミュレーション環境が立ち上がります。これらの仮想空間では激しいドメインランダム化が適用され、物体の摩擦力や重量バランス、表面のテクスチャがランダムに変化します。さらに、一般的な平行グリッパーから多自由度の人間型ロボットハンドまで、様々なロボット形態へと動作が自動リターゲティングされます。 最終フェーズにおいて、Skild AIの基底頭脳である「Skild Brain(S1)」がこの合成データストリームを用いて強化学習を実施します。シミュレーション空間での無数の試行錯誤を通じて、S1は視覚的外見に惑わされず物理的接触の本質のみを学習し、実機への追加微調を行うことなく一度で動作を成功させる「Sim-to-Real」の完全な転移を実現します。

業界への影響と実務革新

このブレイクスルーは、製造業、物流倉庫、サービスロボット市場に計り知れない変革をもたらします。これまで工場の自動化ラインを新設する際には、専門のロボットエンジニアが数週間かけてティーチングペンダントを操作し、動作軌道を一歩ずつプログラミングしていました。しかし今後は、現場の作業員がスマートフォンで熟練の作業手順を一度撮影するだけで、工場内の複数台のロボットへ即座に適応制御ポリシーを配信できるようになります。

また、ロボットハードウェアの断片化という長年の課題も解決に向かいます。Skild Brainは接触力学の原理に基づいて学習するため、2本指のアームロボットでも5本指のヒューマノイドでも、同一の動画からそれぞれの機構に最適な把持戦略を自動生成できます。これにより、ハードウェアとソフトウェアの分離が進み、ロボット開発のプラットフォーム化が急速に進展します。

今後の課題と展望

一方で、極めて柔軟な布地や配線、あるいは粘性の高い液体を扱うような複雑な変形物体の操作においては、シミュレータ内の物理モデルと現実の物性との間に微小な乖離(リアリティギャップ)が生じる懸念が依然として残ります。今後の進化においては、微小な接触変形を高精度に捉える流体・弾性シミュレーション技術の向上が重要となります。

また、大規模なGPUシミュレーション環境を中小企業が利用しやすい形で提供することも課題の一つです。NVIDIAとSkild AIは、本パイプラインを「NVIDIA NIM」マイクロサービスとしてパッケージ化し、世界中の開発者がクラウドAPI経由で日常動画をロボットスキルへ変換できるエコシステムの構築を急いでいます。

Sources

FAQ

Skild AIとNVIDIAの提携における最大の特徴は?

NVIDIA CosmosとIsaac Simを統合し、スマホ動画1本から異種ロボットへ高度な手先操作を数時間で教示可能にした点です。

動画から実機への確実な転移はどのように実現されますか?

Cosmosが3次元接触物理を逆推定し、GPU上で大規模なドメインランダム化シミュレーションを展開して汎用ポリシーを蒸留します。

実用化に向けて残されている技術的課題は何ですか?

柔軟な布地や液体の微小変形におけるシミュレーション誤差の克服、および大規模GPU並列シミュレーションの運用コスト低減が課題です。