Chi phí hiệu năng AI đang lao dốc với tốc độ chưa từng có trong lịch sử công nghệ
Theo các phân tích mới từ Epoch AI và MIT, chi phí để đạt cùng một mức năng lực AI đang giảm từ 5 đến 13 lần mỗi năm, tốc độ nhanh hơn bất kỳ làn sóng công nghệ đột phá nào trước đây.

Tốc độ giảm chi phí vượt xa mọi tiền lệ công nghệ
Theo báo cáo từ tổ chức nghiên cứu xu hướng AI Epoch AI, mức chi phí để mô hình đạt được một ngưỡng điểm chuẩn cố định trên các bài kiểm tra đánh giá chuẩn (benchmark) đã sụt giảm trung bình khoảng 47% mỗi quý kể từ năm 2023. Tốc độ này tương đương mức giảm giá khoảng 13 lần mỗi năm – một biên độ chưa từng được ghi nhận ở bất kỳ công nghệ mang tính chuyển đổi nào trong lịch sử.
Tuy nhiên, các nhà nghiên cứu từ Viện Công nghệ Massachusetts (MIT) lưu ý rằng con số này phản ánh giá thị trường tính trên điểm benchmark, chứ chưa bóc tách riêng sự tiến bộ về thuật toán hay chi phí hiệu năng trong thực tế. Khi xem xét dữ liệu tương đương từ tháng 4/2024 đến tháng 11/2025 trên nền tảng Artificial Analysis, nhóm nghiên cứu tại MIT ước tính chi phí thực tế giảm từ 5 đến 10 lần mỗi năm.
Bóc tách nguyên nhân: Thuật toán, phần cứng hay cuộc đua dìm giá?
Để làm rõ điều gì thực sự thúc đẩy sự sụt giảm này, Epoch AI đã đưa ra một ví dụ trực quan với mô hình o3 của OpenAI. Vào đầu năm 2025, o3 đạt 75% trong bài kiểm tra khoa học cấp độ tiến sĩ GPQA Diamond với chi phí ước tính khoảng 30 cent cho mỗi câu hỏi. Chỉ 18 tháng sau, một mô hình thuộc họ GPT-5.6 đã chạm mốc điểm số tương tự nhưng chỉ tốn 0,04 cent – tức mức giá đã giảm tới 725 lần. Để dễ hình dung, nếu giá ô tô giảm với tốc độ tương tự, một chiếc xe trị giá 50.000 euro sẽ chỉ còn giá dưới 70 euro.
Dẫu vậy, nhà nghiên cứu Hans Gundlach và các đồng nghiệp tại MIT chỉ ra rằng mức tăng trưởng thuật toán thuần túy chỉ đóng góp một phần. Khi loại bỏ yếu tố phần cứng rẻ hơn và áp lực cạnh tranh thị trường (bằng cách phân tích riêng các mô hình mã nguồn mở), hiệu quả từ cải tiến thuật toán thực chất tăng khoảng 3 lần mỗi năm. Con số 13 lần của Epoch AI cao hơn do gộp chung cả tác động giảm giá từ phần cứng và cuộc đua cạnh tranh khốc liệt giữa các nhà cung cấp dịch vụ AI.
Bên cạnh đó, điểm benchmark cao hơn không phải lúc nào cũng đồng nghĩa với việc mô hình chạy hiệu quả hơn. Các mô hình suy luận (reasoning model) mới thường dồn thêm tài nguyên tính toán ở thời điểm xử lý (test-time compute) để giải các bài toán khó. Điều này khiến chi phí cho mỗi câu trả lời đúng tăng lên, ngay cả khi đơn giá trên từng token tiếp tục giảm. Nhóm nghiên cứu MIT nhận thấy một phần lớn bước tiến trên GPQA Diamond thực chất đến từ việc "đốt" nhiều tài nguyên tính toán hơn cho mỗi truy vấn thay vì tối ưu hóa kiến trúc.
Bài toán chọn mô hình và áp lực "luyện thi" benchmark
Một vấn đề kỹ thuật khác được các nhà nghiên cứu chỉ ra là hiện tượng "benchmaxxing" – trong đó các công ty AI tìm cách tối ưu hóa mô hình riêng cho các bài kiểm tra phổ biến nhằm thổi phồng điểm số tiếp thị mà không mang lại giá trị thực tế tương xứng. Nhằm hạn chế điều này, Epoch AI đã đưa vào thử nghiệm một bài kiểm tra bí mật mang tên "Mystery Game Puzzles". Đáng chú ý, đây chính là bài kiểm tra ghi nhận tốc độ giảm chi phí chậm nhất trong nhóm khảo sát.
Nghiên cứu cũng đưa ra khuyến nghị thực tế cho người dùng và doanh nghiệp: giá rẻ trên lý thuyết không thể là yếu tố duy nhất để chọn mô hình. Trên các bảng xếp hạng như Artificial Analysis, hiệu quả của một mô hình được đo bằng sự kết hợp giữa chất lượng, giá cả, độ trễ phản hồi, độ dài cửa sổ ngữ cảnh và tốc độ xuất văn bản.
Một mô hình siêu rẻ nhưng độ trễ cao sẽ không thể vận hành chatbot thời gian thực, trong khi một mô hình suy luận mạnh mẽ có thể quá chậm chạp cho các quy trình tự động hóa. Ngược lại, một mô hình hàng đầu (frontier model) có giá thành cao vẫn có thể tiết kiệm chi phí tổng thể cho doanh nghiệp nếu nó đưa ra kết quả chính xác ngay từ lần đầu tiên, giúp giảm thiểu số lần phải sửa sai và chạy lại truy vấn.
