Reka AI、動画生成とロボット制御を統合した190億パラメータのオムニモデル「Rho-1」を発表
Reka AIは、単一のニューラルネットワークでテキスト、画像、動画、および直接的なロボット動作を処理できる、190億パラメータの統合モデル「Rho-1」のリサーチプレビューを公開した。

マルチモーダルAIスタートアップのReka AIは、単一の統合ニューラルネットワーク内でテキスト、画像、動画、およびロボット動作を処理・生成できる190億パラメータのオムニモデル「Rho-1」のリサーチプレビューを発表した。
同アーキテクチャは、複数の専門システム間でリクエストをルーティングするという業界で一般的な設計とは一線を画している。Rho-1は、すべての入力と出力を単一の共有コンテキストウィンドウ内のトークンとして扱い、外部モデルやツール呼び出しを介さずに動作する。
視覚とロボット動作の直接統合
Rho-1はリアルタイムでのインタラクションをサポートするよう設計されている。コンテキストのリセットや再起動を必要とせず、その場で新たな指示に適応しながら、連続的な動画をリアルタイムで生成できる。
極めて重要な点として、カメラ映像の予測を担うニューラルネットワークの重みそのものが、物理的なロボット動作の計算と駆動も行っている。知覚と行動を1つのモデルに統合することで、Rho-1は視覚的理解を物理的な操作へと直接結びつけている。
逆ダイナミクスによるデータボトルネックの克服
エンボディドAI(身体性を持つAI)システムのトレーニングにおける長年の障害は、実世界のロボット制御データセットの不足である。この制約を回避するため、Reka AIはインターネット上の一般的な動画フッテージから潜在的な制御信号を直接抽出できる逆ダイナミクスモデルを開発した。
このアプローチにより、開発チームは専用のロボット遠隔操作ログのみに依存することなく、広く利用可能なWeb動画を用いてRho-1をトレーニングすることが可能になった。トレーニングプロセスには320基のNvidia H100 GPUが使用され、約3カ月にわたって実行された。
「世界モデル」への前進
今回の発表は、環境をシミュレートし、物理的なダイナミクスを理解し、リアルタイムの感覚入力に基づいて物理的なアクションを起こすことができるシステムである「世界モデル(World Models)」に向けた、AI研究の現在進行中の移行を浮き彫りにしている。
Reka AIはこれ以前にも、2024年4月にOpenAIのGPT-4、AnthropicのClaude 3、GoogleのGemini Ultraといった最先端システムに対抗するよう設計されたマルチモーダル言語モデル「Reka Core」のリリースで話題を集めた。Rho-1により、同社は中核となるマルチモーダル技術を、物理ロボティクスや生成的視覚環境へとさらに深く拡張している。



