Skild AI、NVIDIAの技術を活用して1本の動画からロボットに新タスクを学習させる基盤モデル「S1」を発表
米ピッツバーグ拠点のSkild AIは、1本のデモ動画からロボットが複雑な作業を習得できる物理AI基盤モデル「S1」を実稼働させ、年換算売上高(ARR)1億ドルを達成した。

1本のデモ動画からロボットに複雑なタスクを習得させる
米ピッツバーグを拠点とするロボティクス系スタートアップのSkild AIは、1本のデモ動画から複雑なマルチステップのタスクを学習できる物理AI基盤モデル「S1」を発表した。NVIDIAの支援を受ける同社は、自動化システムを研究開発から実生産環境へと移行させる際に必要な時間とプログラミングを大幅に削減することで、汎用ロボティクスの実現を目指している。
今回の商用展開は、Skild AIが最初の商用導入からわずか10カ月で年換算売上高(ARR)1億ドルという財務上の節目を達成する中で行われた。
ヒューストン工場での導入と「S1」のアーキテクチャ
Skildの技術はすでに生産現場で稼働している。ヒューストンにあるNVIDIAの製造施設では、Skild、NVIDIA、そして電子機器製造大手のFoxconnが、多様なボディに対応する基盤モデル「Skild Brain」(omni-bodied foundation model)を搭載した双腕ロボットを用い、NVIDIA Blackwell GPUシステムの組み立てを行っている。
S1モデルはNVIDIAのソフトウェアおよびコンピューティング基盤上で開発され、Cosmos、Isaac Sim、Isaac Lab、Omniverseを活用してデータ生成、シミュレーション、モデル学習、展開を一貫して処理している。一度現場に導入されれば、システムは移動された物体に自律的に適応し、動作エラーから自己復旧し、明示的にプログラムされていない手順であっても複数のスキルを組み合わせて実行できる。
ある試験運用では、人間が植物を植木鉢に植え替える様子を撮影してから、ロボットがその作業を自律的に再現するまでに要した時間はわずか11分だったという。
NVIDIAで自律マシン担当プロダクトマネジメントディレクターを務めるAmit Goel氏は、「S1は、オペレーターがどれほど迅速にロボットへ新しい作業を教えられるかを示している。製造業者にとっては、製品や部品、工程が変化しても、自動化をより柔軟に適応させられる機会となる」と述べている。
物理AIにおけるデータと身体性の課題解決
基盤モデルの急速な進歩にもかかわらず、物理AIは実世界のトレーニングデータを収集する難しさに依然として制約されている。インターネット上のテキストやコードを取り込むデジタルAIシステムとは異なり、ロボットシステムは照明の変化、物体の配置、触覚フィードバック、そして予測不能なエッジケースにも対応できなければならない。
Goel氏は「実機のロボットでそうした経験データを収集するのは時間がかかり、コストも極めて高い」と指摘し、Cosmosによる合成データ生成に加え、Isaac LabやOmniverseのようなシミュレーションプラットフォームが極めて重要な打開策であるとしている。目下の課題は、シミュレーション上でのテストが工場の現場において確実に安定したパフォーマンスを発揮できるようにすることだ。
今後の展望として、開発者たちは多様な形態のロボットを駆動できる共通の基盤モデルを目指している。Skild AIはすでにロボットアーム、四足歩行ロボット、ヒューマノイドプラットフォームなどでモデルを運用してきた。Goel氏によると、さまざまな機械的ボディや工場のタスクにまたがって再利用可能なマシンインテリジェンスを確立することが、物理的な自動化における次の決定的なマイルストーンになるという。



