Reka AI, 영상 생성 및 로봇 제어 결합한 190억 파라미터 옴니 모델 'Rho-1' 공개
Reka AI가 단일 신경망 내에서 텍스트, 이미지, 비디오 및 직접적인 로봇 제어 동작을 모두 처리할 수 있는 190억 파라미터 규모의 통합 모델 'Rho-1' 연구 프리뷰를 공개했다.

멀티모달 AI 스타트업 Reka AI가 단일 통합 신경망 내에서 텍스트, 이미지, 영상, 로봇 제어 동작을 처리 및 생성할 수 있는 190억 파라미터 규모의 옴니 모델 'Rho-1' 연구 프리뷰를 공개했다.
이 아키텍처는 여러 특화된 시스템으로 요청을 분기 처리하는 기존 업계의 일반적인 설계 방식에서 벗어났다. 대신 Rho-1은 모든 입력과 출력을 단일 공유 컨텍스트 윈도우 내의 토큰으로 취급하며, 외부 모델이나 툴 호출(tool calls) 없이 동작한다.
시각과 로봇 동작의 직접적인 통합
Rho-1은 실시간 상호작용을 지원하도록 설계되었다. 이 모델은 컨텍스트를 재설정하거나 재시작할 필요 없이 즉각적으로 새로운 지시 사항에 적응하면서 실시간으로 연속적인 비디오를 생성할 수 있다.
특히 카메라 영상 예측을 담당하는 동일한 신경망 가중치가 물리적인 로봇 동작까지 직접 계산하고 구동한다는 점이 핵심이다. 인식과 행동을 단일 모델로 결합함으로써, Rho-1은 시각적 이해를 물리적 조작과 직접 연결한다.
역동역학을 통한 데이터 병목 현상 해결
체화된 AI(Embodied AI) 시스템 학습에 있어 오랜 걸림돌은 실제 환경의 로봇 제어 데이터셋이 부족하다는 점이었다. Reka AI는 이러한 한계를 극복하기 위해 일반 인터넷 비디오 영상에서 직접 기저 제어 신호를 추출할 수 있는 역동역학(inverse dynamics) 모델을 개발했다.
연구진은 이러한 접근 방식을 통해 전용 로봇 원격 조작 로그에만 의존하지 않고, 널리 활용 가능한 웹 비디오를 사용해 Rho-1을 훈련할 수 있었다. 이 학습 과정에는 320대의 Nvidia H100 GPU가 약 3개월간 투입되었다.
'월드 모델'을 향한 진전
이번 발표는 환경을 시뮬레이션하고 물리적 역학을 이해하며 실시간 감각 입력을 기반으로 물리적 행동을 취할 수 있는 시스템인 '월드 모델(world models)'로 향하는 AI 연구의 전환 흐름을 잘 보여준다.
Reka AI는 앞서 2024년 4월 OpenAI의 GPT-4, Anthropic의 Claude 3, Google의 Gemini Ultra 등 최첨단 프론티어 시스템과 경쟁하도록 설계된 멀티모달 언어 모델 'Reka Core'를 공개하며 주목을 받은 바 있다. 이번 Rho-1 출시를 통해 Reka AI는 자사의 핵심 멀티모달 기술을 물리적 로봇 공학과 생성형 시각 환경 영역으로 한층 더 확장하고 있다.



