Reka AI 推出 190 億參數全能模型 Rho-1,整合影片生成與機器人控制
Reka AI 發布 Rho-1 研究預覽版,這款統一架構的 190 億參數模型可在單一神經網路中處理文字、影像、影片並直接執行機器人控制動作。

多模態人工智慧新創公司 Reka AI 發表了 Rho-1 的研究預覽版(research preview),這是一款擁有 190 億參數的全能模型(omni-model),能夠在單一且統一的神經網路中處理並生成文字、影像、影片以及機器人動作。
該架構打破了業界常見的設計方式——以往通常會將請求分派給多個專門系統。相反地,Rho-1 將所有輸入與輸出皆視為單一共用上下文視窗(context window)內的 Token,完全不需依賴外部模型或工具呼叫即可運作。
直接整合視覺與機器人動作
Rho-1 專為支援即時互動而設計。該模型能即時生成連續影片,並隨時因應新指令做出即時調整,無需重設或重新啟動其上下文。
關鍵在於,負責預測攝影機影像的神經網路權重,完全同樣用來計算並驅動實體機器人的動作。藉由將感知與行動整合於單一模型之中,Rho-1 直接將視覺理解與實體操控連結在一起。
運用逆向動力學突破資料瓶頸
訓練具身人工智慧(Embodied AI)系統長期以來的障礙之一,就是缺乏真實世界的機器人控制資料集。為突破這項限制,Reka AI 開發了一套逆向動力學(inverse dynamics)模型,能直接從標準的網路影片素材中提取底層控制訊號。
這種方法讓團隊得以利用隨處可得的網路影片來訓練 Rho-1,而無需僅依賴專門的機器人遠端操控記錄。整個訓練過程動用了 320 顆 Nvidia H100 GPU,運算時間約達三個月。
邁向世界模型
此次發布凸顯了人工智慧研究正持續轉向「世界模型」(world models)——這類系統能夠模擬環境、理解物理動態,並根據即時感官輸入採取實體行動。
Reka AI 先前曾在 2024 年 4 月因推出 Reka Core 受到高度關注,該多模態語言模型旨在與包括 OpenAI 的 GPT-4、Anthropic 的 Claude 3 以及 Google 的 Gemini Ultra 等前沿系統競爭。隨著 Rho-1 的問世,該公司正將其核心多模態技術進一步延伸至實體機器人技術與生成式視覺環境中。



