AI RACE— Cuộc đua AI
Doanh nghiệp

NVIDIA trình làng loạt nâng cấp cho kiến trúc Vera Rubin và nền tảng DSX, tối ưu hóa năng lượng cho nhà máy AI

Tại AI Infra Summit, NVIDIA công bố kiến trúc Vera Rubin NVL72 cùng nền tảng DSX, giúp tăng thông lượng xử lý AI trên mỗi megawatt điện lên tới 30-35 lần nhằm đáp ứng làn sóng agentic AI.

23:55 15/09/2026
NVIDIA trình làng loạt nâng cấp cho kiến trúc Vera Rubin và nền tảng DSX, tối ưu hóa năng lượng cho nhà máy AI

Chuyển dịch thước đo hạ tầng AI sang "token trên mỗi megawatt"

Tại sự kiện AI Infra Summit diễn ra ở Trung tâm Hội nghị Santa Clara với hơn 8.000 người tham dự, ông Ian Buck, Phó chủ tịch phụ trách mảng siêu quy mô và điện toán hiệu năng cao của NVIDIA, đã nhấn mạnh bước ngoặt mới của hạ tầng tính toán AI: thước đo không còn nằm ở hiệu năng đỉnh (peak performance) mà chuyển sang số lượng token tạo ra trên mỗi megawatt điện năng tiêu thụ (tokens per megawatt).

Sự bùng nổ của agentic AI (các hệ thống tác tử tự thực hiện chuỗi suy luận và gọi công cụ) đang tạo ra các khối lượng công việc đòi hỏi ngữ cảnh dài và độ trễ cực thấp. Để giải quyết nút thắt về nguồn điện của các trung tâm dữ liệu, NVIDIA giới thiệu giải pháp toàn diện bao gồm kiến trúc thế hệ mới Vera Rubin NVL72, nền tảng tối ưu hóa năng lượng NVIDIA DSX và kết nối mạng NVLink 6.

Chi tiết các cải tiến phần cứng và kết quả kiểm thử thực tế

Nền tảng quản lý năng lượng NVIDIA DSX MaxLPS đóng vai trò giám sát liên tục mức tiêu thụ điện trên từng GPU và từng tủ rack để điều phối linh hoạt. Đơn vị cung cấp hạ tầng đám mây Lambda đã đưa ra những số liệu kiểm chứng đầu tiên của DSX MaxLPS trên các máy chủ NVIDIA Blackwell: vận hành thành công 19 node điện toán trong cùng một hạn mức nguồn vốn chỉ dành cho 16 node đầy tải trước đây. Nhờ đó, tổng thông lượng token của toàn cụm tăng 24% (từ 4 triệu lên 5 triệu token/giây) và hiệu suất trên mỗi watt điện tăng 23%. Khi triển khai trên các hệ thống Vera Rubin NVL72, DSX MaxLPS có thể giúp tăng dung lượng GPU thêm tới 40% trong cùng một hạn mức điện năng.

Bên cạnh đó, NVIDIA giới thiệu bộ xử lý Groq 3 LPX bổ sung khả năng suy luận độ trễ siêu thấp cho Vera Rubin NVL72. Sự kết hợp này mang lại thông lượng token trên mỗi megawatt cao gấp 35 lần so với hệ thống GB200 NVL72 khi xử lý các mô hình hơn 2.000 tỷ tham số ở ngữ cảnh dài. Thử nghiệm trên mô hình Qwen 3.8 27B với ngữ cảnh 100K token đạt 2.529 token đầu ra mỗi giây cho mỗi người dùng.

Theo bảng đánh giá AgentX từ SemiAnalysis—công cụ đo lường hiệu năng agentic AI qua các phiên lập trình thực tế—hệ thống Vera Rubin NVL72 đạt thông lượng trên mỗi megawatt cao gấp 30 lần và chi phí trên mỗi triệu token thấp hơn 45 lần so với GB300 NVL72 khi chạy mô hình DeepSeek V4 Pro.

Về phần CPU, dòng chip NVIDIA Vera cũng ghi nhận kết quả tích cực từ các đối tác:

  • Perplexity ghi nhận tốc độ khởi chạy môi trường sandbox SPACE cho AI tác tử nhanh hơn 1,9 lần.
  • DeepInfra đạt độ trễ điều phối (orchestration step latency) nhanh hơn 2,2 lần.
  • ClickHouse đo đạc hiệu năng phân tích dữ liệu trên ClickBench cho thấy Vera là hệ thống nhanh nhất từng ghi nhận.
  • Redpanda công bố độ trễ giảm 5,5 lần và thông lượng tăng 73%.
  • Starburst và Kinetica ghi nhận tốc độ xử lý truy vấn phân tích nhanh hơn lần lượt 3 lần và 2,7 lần so với các CPU truyền thống.

Nhằm đảm bảo tính liên tục cho các cụm máy chủ hàng trăm nghìn GPU, chuẩn kết nối thế hệ mới NVIDIA NVLink 6 tích hợp cơ chế sửa lỗi trực tiếp (FEC), định tuyến động và cân bằng lại liên kết, giúp cách ly sự cố cục bộ và ngăn chặn nguy cơ ngưng trệ toàn hệ thống.

Hợp tác mở rộng hệ sinh thái và giải bài toán điện lưới

Bên cạnh tối ưu nội bộ trung tâm dữ liệu, NVIDIA phối hợp với Emerald AI và đơn vị điện lực Silicon Valley Power triển khai phần mềm DSX Flex và Conductor. Giải pháp này cho phép nhà máy AI hoạt động như một nguồn tải linh hoạt: tự động giảm công suất của các tác vụ huấn luyện ưu tiên thấp khi nhận tín hiệu quá tải từ lưới điện mà không làm gián đoạn các tác vụ AI quan trọng.

Nhiều đối tác công nghệ lớn cũng công bố các hợp tác sâu rộng: Annapurna Labs của Amazon bắt tay cùng NVIDIA phát triển công nghệ bộ nhớ băng thông cao tùy biến NVHBM; d-Matrix tích hợp nền tảng NVLink Fusion vào bộ xử lý Raptor XPU; trong khi Pinterest ứng dụng kiến trúc NVIDIA Blackwell và phần mềm Dynamo để đưa AI hội thoại vào tính năng khám phá hình ảnh.

◗ Nguồn

NVIDIA Blog15-09

Tin liên quan