Reka AI ra mắt Rho-1: Mô hình omni 19 tỷ tham số kết hợp tạo video và điều khiển robot
Reka AI vừa phát hành bản thử nghiệm của Rho-1, mô hình hợp nhất 19 tỷ tham số có khả năng xử lý văn bản, hình ảnh, video và điều khiển trực tiếp hoạt động của robot trong một mạng nơ-ron duy nhất.

Reka AI, startup tiên phong trong lĩnh vực AI đa phương thức, vừa trình làng bản thử nghiệm nghiên cứu của Rho-1. Đây là mô hình omni với 19 tỷ tham số, sở hữu khả năng xử lý và tạo lập văn bản, hình ảnh, video cũng như điều khiển các thao tác của robot ngay trong một mạng nơ-ron hợp nhất duy nhất.
Kiến trúc của Rho-1 tạo ra sự khác biệt lớn so với các thiết kế phổ biến hiện nay trong ngành — vốn thường phân bổ tác vụ qua nhiều hệ thống chuyên biệt. Thay vào đó, Rho-1 xử lý toàn bộ đầu vào và đầu ra dưới dạng các token trong cùng một cửa sổ ngữ cảnh chung, vận hành hoàn toàn độc lập mà không cần dựa vào các mô hình bên ngoài hay lệnh gọi công cụ (tool call).
Tích hợp trực tiếp thị giác và chuyển động của robot
Rho-1 được thiết kế tối ưu cho các tương tác theo thời gian thực. Mô hình có thể tạo video liên tục trong thời gian thực, đồng thời lập tức thích ứng với các chỉ dẫn mới mà không cần phải đặt lại (reset) hay khởi động lại ngữ cảnh.
Điểm mấu chốt nằm ở chỗ: chính tập trọng số mạng nơ-ron đảm nhận việc dự đoán hình ảnh từ camera cũng đồng thời tính toán và điều khiển các chuyển động vật lý của robot. Bằng cách tích hợp chặt chẽ khả năng nhận thức và hành động vào một khối duy nhất, Rho-1 đã kết nối thẳng năng lực hiểu biết thị giác với các thao tác vật lý ngoài đời thực.
Vượt qua nút thắt dữ liệu nhờ mô hình động lực học nghịch đảo
Một rào cản nan giải từ lâu trong việc huấn luyện các hệ thống AI hiện thân (embodied AI) là sự thiếu hụt nghiêm trọng các bộ dữ liệu điều khiển robot thực tế. Để tháo gỡ nút thắt này, Reka AI đã phát triển một mô hình động lực học nghịch đảo (inverse dynamics model) có khả năng trích xuất trực tiếp các tín hiệu điều khiển ẩn từ các đoạn video thông thường trên internet.
Cách tiếp cận này cho phép đội ngũ kỹ sư huấn luyện Rho-1 bằng nguồn tài nguyên video phong phú trên web, thay vì phụ thuộc hoàn toàn vào dữ liệu điều khiển robot từ xa chuyên dụng vốn rất tốn kém. Quá trình huấn luyện tiêu tốn tài nguyên của 320 GPU Nvidia H100 chạy liên tục trong khoảng ba tháng.
Bước tiến mới hướng tới "mô hình thế giới"
Đợt phát hành lần này cho thấy bước chuyển dịch rõ rệt trong giới nghiên cứu AI hướng tới các "mô hình thế giới" (world models) — những hệ thống có khả năng mô phỏng môi trường xung quanh, hiểu các quy luật vật lý và đưa ra hành động thực tế dựa trên dữ liệu cảm biến tức thời.
Trước đó vào tháng 4/2024, Reka AI từng gây tiếng vang lớn khi ra mắt Reka Core, mô hình ngôn ngữ đa phương thức được định vị để cạnh tranh sòng phẳng với các hệ thống hàng đầu như GPT-4 của OpenAI, Claude 3 của Anthropic và Gemini Ultra của Google. Với Rho-1, công ty đang tiếp tục đưa công nghệ đa phương thức cốt lõi của mình tiến sâu hơn vào lĩnh vực robot và các môi trường thị giác tạo sinh.



