AI RACE— La carrera de la IA
New Models

Reka AI presenta Rho-1, un omnimodelo de 19.000 millones de parámetros que combina video y control robótico

Reka AI ha lanzado una versión preliminar de investigación de Rho-1, un modelo unificado de 19.000 millones de parámetros capaz de procesar texto, imágenes, video y acciones robóticas directas en una sola red neuronal.

06/10/2026, 01:26
Reka AI ra mắt Rho-1: Mô hình omni 19 tỷ tham số kết hợp tạo video và điều khiển robot

La startup de IA multimodal Reka AI ha presentado una versión preliminar de investigación de Rho-1, un omnimodelo de 19.000 millones de parámetros capaz de procesar y generar texto, imágenes, video y acciones robóticas dentro de una única red neuronal unificada.

La arquitectura se aparta de los diseños habituales de la industria que distribuyen las solicitudes entre múltiples sistemas especializados. En su lugar, Rho-1 procesa todas las entradas y salidas como tokens dentro de una única ventana de contexto compartida, operando sin modelos externos ni llamadas a herramientas.

Integración directa de visión y movimiento robótico

Rho-1 está diseñado para admitir la interacción en tiempo real. El modelo puede generar video continuo en tiempo real mientras se adapta sobre la marcha a nuevas instrucciones, sin necesidad de reiniciar ni restablecer su contexto.

Un aspecto crucial es que exactamente los mismos pesos de la red neuronal responsables de predecir las imágenes de la cámara también calculan y dirigen los movimientos físicos del robot. Al acoplar percepción y acción en un solo modelo, Rho-1 conecta la comprensión visual directamente con la manipulación física.

Superando los cuellos de botella de datos con dinámica inversa

Un obstáculo histórico en el entrenamiento de sistemas de IA corporizada es la escasez de conjuntos de datos de control robótico del mundo real. Para superar esta limitación, Reka AI diseñó un modelo de dinámica inversa capaz de extraer señales de control subyacentes directamente a partir de secuencias de video estándar de internet.

Este enfoque permitió al equipo entrenar a Rho-1 utilizando videos ampliamente disponibles en la web, en lugar de depender únicamente de registros dedicados de teleoperación robótica. El proceso de entrenamiento requirió 320 GPU Nvidia H100 funcionando durante aproximadamente tres meses.

Avances hacia los modelos de mundo

El lanzamiento pone de relieve una transición en curso dentro de la investigación en IA hacia los "modelos de mundo": sistemas capaces de simular entornos, comprender dinámicas físicas y ejecutar acciones físicas a partir de información sensorial en tiempo real.

Reka AI ya había acaparado titulares en abril de 2024 con la presentación de Reka Core, un modelo de lenguaje multimodal desarrollado para competir con sistemas de primera línea como GPT-4 de OpenAI, Claude 3 de Anthropic y Gemini Ultra de Google. Con Rho-1, la compañía profundiza su tecnología multimodal central para llevarla de lleno al terreno de la robótica física y los entornos visuales generativos.

◗ Fuentes

The Decoder6/10

Historias relacionadas