Reka AI revela Rho-1, um modelo omni de 19 bilhões de parâmetros que combina vídeo e controle robótico
A Reka AI lançou uma prévia de pesquisa do Rho-1, um modelo unificado de 19 bilhões de parâmetros capaz de processar texto, imagens, vídeo e ações robóticas diretas em uma única rede neural.

A startup de IA multimodal Reka AI revelou uma prévia de pesquisa do Rho-1, um modelo omni de 19 bilhões de parâmetros capaz de processar e gerar texto, imagens, vídeo e ações robóticas dentro de uma única rede neural unificada.
A arquitetura se afasta dos designs comuns da indústria, que direcionam solicitações entre múltiplos sistemas especializados. Em vez disso, o Rho-1 trata todas as entradas e saídas como tokens dentro de uma única janela de contexto compartilhada, operando sem modelos externos ou chamadas de ferramentas.
Integração direta entre visão e movimento robótico
O Rho-1 foi projetado para suportar interação em tempo real. O modelo pode gerar vídeo contínuo em tempo real enquanto se adapta dinamicamente a novas instruções, sem a necessidade de redefinir ou reiniciar seu contexto.
O ponto crucial é que exatamente os mesmos pesos da rede neural responsáveis por prever as imagens da câmera também calculam e comandam os movimentos físicos do robô. Ao unir percepção e ação em um único modelo, o Rho-1 conecta a compreensão visual diretamente à manipulação física.
Superando gargalos de dados com dinâmica inversa
Um obstáculo histórico no treinamento de sistemas de IA incorporada é a escassez de conjuntos de dados de controle robótico no mundo real. Para contornar essa limitação, a Reka AI desenvolveu um modelo de dinâmica inversa capaz de extrair sinais de controle subjacentes diretamente de vídeos comuns da internet.
Essa abordagem permitiu que a equipe treinasse o Rho-1 utilizando vídeos amplamente disponíveis na web, em vez de depender exclusivamente de registros dedicados de teleoperação robótica. O processo de treinamento exigiu 320 GPUs Nvidia H100 operando durante cerca de três meses.
Avançando rumo aos modelos de mundo
O lançamento destaca uma transição em andamento na pesquisa de IA em direção aos "modelos de mundo" — sistemas capazes de simular ambientes, compreender dinâmicas físicas e executar ações físicas com base em dados sensoriais em tempo real.
A Reka AI já havia chamado a atenção em abril de 2024 com o lançamento do Reka Core, um modelo de linguagem multimodal desenvolvido para competir com sistemas de ponta, incluindo o GPT-4 da OpenAI, o Claude 3 da Anthropic e o Gemini Ultra do Google. Com o Rho-1, a empresa expande sua tecnologia multimodal essencial de forma ainda mais profunda na robótica física e em ambientes visuais generativos.



