Bài toán hoàn vốn cho các siêu nhà máy AI: Vì sao GPU cũ vẫn hái ra tiền?
Với chi phí đầu tư lên tới 60 triệu USD cho mỗi megawatt điện, NVIDIA công bố công thức tối ưu hóa lợi nhuận cho các "nhà máy AI" dựa trên ba trụ cột: hiệu năng trên mỗi watt điện, tuổi thọ khai thác phần cứng và tính linh hoạt của hệ sinh thái CUDA.

Bài toán sinh lời của những hạ tầng tiêu tốn 60 triệu USD mỗi megawatt
Khi các trung tâm dữ liệu AI bước vào kỷ nguyên quy mô gigawatt, khái niệm "nhà máy AI" (AI factory) đã trở thành trọng tâm đầu tư của các tập đoàn công nghệ. Tuy nhiên, với mức chi phí xây dựng trung bình khoảng 60 triệu USD cho mỗi megawatt (MW) công suất điện, việc rót vốn ở quy mô này đòi hỏi bài toán lợi nhuận trên vốn đầu tư (ROI) phải cực kỳ rõ ràng.
Theo phân tích từ NVIDIA, tỷ suất hoàn vốn của một nhà máy AI phụ thuộc vào ba biến số then chốt không thể tách rời: năng lực tạo doanh thu (tổng lượng token tối đa có thể sản xuất và bán ra mỗi năm), vòng đời hữu ích (thời gian phần cứng duy trì khả năng sinh lời) và nhu cầu thị trường đối với lượng token đó. Nếu hiệu năng cao nhưng không tìm được khách mua, hoặc nhu cầu lớn nhưng máy móc nhanh chóng lỗi thời sau 1-2 năm, bài toán kinh tế sẽ đổ vỡ.
Ba trụ cột định hình lợi nhuận: Năng suất, vòng đời và tính linh hoạt
Năng lượng hiện là rào cản vật lý lớn nhất của các trung tâm dữ liệu, khiến chỉ số "số lượng token trên mỗi giây trên mỗi megawatt" trở thành thước đo trực tiếp cho doanh thu. Báo cáo từ SemiAnalysis AgentX cho thấy hệ thống NVIDIA Vera Rubin NVL72 đem lại thông lượng trên mỗi MW cao hơn 30 lần so với GB300 NVL72 tiền nhiệm, đồng thời giúp hạ chi phí cho mỗi triệu token tới 45 lần khi chạy mô hình DeepSeek V4 Pro. Đáng chú ý, chi phí tạo token giảm không làm suy giảm thị trường tính toán mà ngược lại còn kích hoạt hiệu ứng bùng nổ nhu cầu mới, khi các bài toán ứng dụng trước đây quá đắt đỏ nay đã trở nên khả thi về mặt kinh tế.
Bên cạnh năng suất thô, tuổi thọ phần cứng là yếu tố quyết định tốc độ hoàn vốn. Không phải khối lượng công việc nào cũng đòi hỏi kiến trúc mới nhất. Thực tế thị trường cho thấy mẫu GPU NVIDIA A100 ra mắt từ năm 2020 vẫn đang hoạt động thương mại ổn định sau 6 năm; đơn vị vận hành CoreWeave thậm chí đã gia hạn hợp đồng cho thuê các cụm A100 này đến tận năm 2029. Dữ liệu từ Sprout chỉ ra các nhà mạng điện toán đám mây lớn đều liên tục kéo dài chu kỳ khấu hao máy chủ. Cụ thể, đội máy chủ NVIDIA V100 của Microsoft đã vận hành thực tế 8,4 năm, vượt xa mức khấu hao sổ sách 6 năm ban đầu. Khảo sát của Barkr ước tính tuổi thọ kinh tế đạt 5-6 năm đối với hệ thống H100 8-GPU và 9-10 năm cho GB300 NVL72; trong khi Silicon Data ghi nhận A100 6 năm tuổi vẫn giữ được 25% giá trị ban đầu dù trên sổ sách kế toán đã về 0.
Trụ cột thứ ba nằm ở tính linh hoạt (fungibility) của hạ tầng. Nhờ lớp phần mềm và hơn 1.000 thư viện CUDA-X phục vụ hơn 10 triệu lập trình viên, một cụm GPU không bị "chết bờ chết bụi" như các dòng chip chuyên dụng ASIC khi xu hướng mô hình thay đổi. Một kiến trúc duy nhất có thể luân chuyển mượt mà giữa tiền huấn luyện (pretraining), tinh chỉnh sau huấn luyện (post-training), suy luận (inference), mô phỏng vật lý hay đồ họa.
Thực tế khai thác: Từ dược phẩm, tài chính đến mô phỏng số
Tính linh hoạt của kiến trúc tính toán đang giúp các doanh nghiệp duy trì tỷ lệ lấp đầy tài nguyên ở mức tối đa. Hãng dược phẩm Lilly hiện vận hành cụm 1.016 GPU tại chỗ vừa để chạy các mô hình phân tử, protein, vừa triển khai chatbot và luồng công việc AI đại lý (agentic workflow) nội bộ. Mạng xã hội Pinterest kết hợp hơn 14.000 GPU trải dài qua nhiều thế hệ từ Hopper, Blackwell đến các dòng cũ hơn để huấn luyện và triển khai mô hình thị giác-ngôn ngữ.
Trong lĩnh vực tài chính, Revolut tận dụng NVIDIA cuDF để xử lý hàng tỷ bản ghi giao dịch trước khi huấn luyện mô hình nền tảng. Runway huấn luyện các mô hình thế giới (world model) trên thế hệ Hopper và phục vụ suy luận trên nền tảng Blackwell, còn siêu máy tính của Đại học Texas A&M đạt tỷ lệ sử dụng thực tế lên tới 95-98% khi chia sẻ tài nguyên cho 26 dự án nghiên cứu.
Ngoài phạm vi AI thuần túy, Dassault Systèmes sử dụng cùng nền tảng phần cứng này để chạy mô phỏng bản sao số (digital twin) phục vụ cấp chứng chỉ máy bay tại Wichita State và thiết kế xe hơi tại Lucid Motors; Unilever cũng chuyển đổi quy trình chụp ảnh sản phẩm sang tạo hình ảnh từ bản sao số, giúp giảm một nửa chi phí sản xuất. Khả năng biến đổi linh hoạt theo mọi giai đoạn công nghệ chính là "chốt chặn" an toàn tài chính lớn nhất cho các nhà đầu tư vào hạ tầng AI quy mô lớn.



