AI RACE— Cuộc đua AI
Mô hình ngôn ngữ

NVIDIA Vera Rubin NVL72 màn chào sân áp đảo tại MLPerf Inference v6.1: Nhanh gấp 3,7 lần thế hệ trước

Trong đợt thử nghiệm MLPerf Inference v6.1, hệ thống NVIDIA Vera Rubin NVL72 ghi nhận thông lượng suy luận vượt trội gấp tới 3,7 lần so với GB300 NVL72 trên mô hình thị giác ngôn ngữ Qwen3-VL và gấp 2,5 lần trên DeepSeek-R1.

22:00 16/09/2026
NVIDIA Vera Rubin NVL72 màn chào sân áp đảo tại MLPerf Inference v6.1: Nhanh gấp 3,7 lần thế hệ trước

Màn chào sân ấn tượng của kiến trúc Vera Rubin NVL72

NVIDIA vừa công bố kết quả tham gia MLPerf Inference v6.1 (Closed Division) với sự xuất hiện lần đầu tiên của hệ thống Vera Rubin NVL72. Bản gửi kết quả xem trước (preview) này lập tức tạo dấu ấn mạnh mẽ khi cho thấy bước nhảy vọt về hiệu năng tính toán suy luận so với kiến trúc Blackwell (GB300 NVL72).

Trong bài thử nghiệm với hai mô hình đòi hỏi tài nguyên khắt khe nhất hiện nay là Qwen3-VL và DeepSeek-R1, hệ thống Vera Rubin NVL72 đã đạt mức thông lượng (throughput) cao hơn đáng kể. Đồng thời, nền tảng GB300 NVL72 hiện hữu cũng chứng minh hiệu quả mở rộng gần như tuyến tính khi kết hợp đa cụm rack, khẳng định lợi thế đồng thiết kế phần cứng và phần mềm của NVIDIA.

Bứt phá hiệu năng DeepSeek-R1, Qwen3-VL và tác vụ AI Agent

Dữ liệu chính thức từ MLCommons ghi nhận Vera Rubin NVL72 đạt hiệu năng vượt trội trên nhiều kịch bản:

  • Qwen3-VL: Khi kết hợp vLLM và bộ khung suy luận mã nguồn mở NVIDIA Dynamo, Vera Rubin NVL72 cho thông lượng cao hơn tới 3,7 lần so với GB300 NVL72 trên toàn bộ các kịch bản offline, server và tương tác thực tế.
  • DeepSeek-R1: Sử dụng thư viện tăng tốc NVIDIA TensorRT-LLM, hệ thống đạt hiệu năng gấp 2,5 lần thế hệ GB300 NVL72.
  • Tác vụ AI Agent (SemiAnalysis AgentX): Với các workload suy luận nhiều bước, lập kế hoạch và hành động phức tạp, Vera Rubin NVL72 đạt hiệu năng thử nghiệm nhanh hơn tới 30 lần so với GB300 NVL72.

Sự bứt phá này đến từ các cải tiến sâu trong kiến trúc: nhân Tensor Core nâng cấp và Transformer Engine mới giúp tăng tốc cả hai giai đoạn prefill lẫn decode. Bên cạnh đó, định dạng số học NVFP4 giúp giảm dung lượng bộ nhớ cho trọng số mô hình, cơ chế attention và KV cache mà gần như không ảnh hưởng chất lượng đầu ra. Hệ thống cũng triển khai kỹ thuật "disaggregated serving" (tách biệt máy chủ prefill và decode) cùng khả năng xử lý song song chuyên gia (expert parallelism) quy mô lớn cho các mô hình Mixture-of-Experts (MoE). Toàn bộ được kết nối qua hạ tầng NVLink thế hệ thứ 6 cùng NVLink Switch, mang lại tốc độ truyền gói tin gấp 10 lần và độ trễ thấp hơn 3 lần so với mạng Ethernet tiêu chuẩn.

Song song với Rubin, NVIDIA cũng trình diễn khả năng mở rộng của GB300 NVL72:

  • Khi nâng quy mô từ 1 rack (72 GPU) lên 4 rack (288 GPU) chạy DeepSeek-R1 ở kịch bản offline, hệ thống đạt hiệu suất mở rộng (scaling efficiency) lên tới 99% — thông lượng tăng tỉ lệ thuận gần như hoàn hảo với lượng phần cứng bổ sung.
  • Trên benchmark tạo video WAN 2.2 text-to-video, cụm rack GB300 NVL72 đạt tốc độ 0,65 video chuẩn 720p mỗi giây (5,7 giây/video), tương đương thông lượng gấp 9 lần và độ trễ giảm 7,5 lần so với cấu hình một node đơn lẻ.
  • Tối ưu phần mềm đơn thuần cũng giúp GB300 NVL72 tăng 1,6 lần hiệu năng trên Qwen3-VL so với kỳ benchmark v6.0 trước đó.

Ở phân khúc biên (edge), NVIDIA cũng gửi kết quả vi xử lý Jetson AGX Thor chạy thư viện TensorRT Edge-LLM trên bài thử nghiệm mới Edge-Agentic với mô hình Qwen3.6-27B.

Bài toán kinh tế hạ tầng AI khi bước sang kỷ nguyên suy luận

Kết quả benchmark MLPerf Inference v6.1 phản ánh sự chuyển dịch trọng tâm của ngành công nghiệp AI: từ cuộc đua huấn luyện thuần túy sang tối ưu hóa chi phí suy luận (inference economics). Đối với các trung tâm dữ liệu và nhà cung cấp dịch vụ đám mây, thông lượng cao hơn trên mỗi rack trực tiếp hạ thấp chi phí tạo mỗi token (cost per token), phục vụ được nhiều người dùng đồng thời hơn và rút ngắn thời gian hoàn vốn.

Sự tham gia của 19 đối tác phần cứng và đám mây lớn (như ASUS, Dell, Azure, CoreWeave, Nebius, OCI, Supermicro...) trong đợt công bố kết quả lần này cho thấy hệ sinh thái xoay quanh kiến trúc máy chủ NVL72 đang phát triển rất nhanh, tạo áp lực cạnh tranh khốc liệt lên các giải pháp chip AI tùy biến (ASIC) và đối thủ trên thị trường máy chủ AI quy mô siêu lớn.

◗ Nguồn

NVIDIA Blog16-09

Tin liên quan