AI RACE— Cuộc đua AI
Model mới

xAI ra mắt Grok 4.7 với giá rẻ bất ngờ, nhưng benchmark lập trình hụt hơi trước GPT-6 và Claude

xAI vừa giới thiệu Grok 4.7 với chi phí cạnh tranh nhằm vào tác vụ lập trình và xử lý tri thức, song các điểm chuẩn benchmark độc lập cho thấy mô hình vẫn bị Claude và GPT-6 bỏ xa.

23:56 21/09/2026
xAI ra mắt Grok 4.7 với giá rẻ bất ngờ, nhưng benchmark lập trình hụt hơi trước GPT-6 và Claude

xAI trình làng Grok 4.7 tập trung vào lập trình với mức giá cạnh tranh

Công ty xAI của Elon Musk vừa chính thức công bố Grok 4.7, phiên bản được giới thiệu là mô hình mạnh nhất từ trước đến nay của hãng dành cho các tác vụ lập trình và công việc xử lý tri thức. Theo thông tin từ xAI, Grok 4.7 được xây dựng trên một mô hình nền tảng (base model) quy mô lớn hơn, áp dụng chu kỳ đào tạo bằng học tăng cường (reinforcement learning) kéo dài hơn, đồng thời thiết kế thêm khả năng tự kiểm chứng kết quả đầu ra.

Người dùng hiện có thể tiếp cận và triển khai Grok 4.7 thông qua Grok API, môi trường lập trình Cursor và nền tảng Grok Build.

Tối ưu chi phí nhưng hiệu năng tổng thể chỉ dừng ở nhóm giữa

Điểm gây chú ý lớn của Grok 4.7 nằm ở biểu phí sử dụng: mô hình có giá 2 USD cho mỗi triệu token đầu vào (input) và 6 USD cho mỗi triệu token đầu ra (output). Mức giá này thấp hơn đáng kể so với mặt bằng chung của các mô hình biên giới (frontier model) phương Tây và tiệm cận với chi phí của các dòng mô hình AI đến từ Trung Quốc.

Tuy vậy, kết quả thử nghiệm độc lập đã lý giải vì sao mức giá lại mềm như vậy. Trên bảng xếp hạng Artificial Analysis Intelligence Index (phiên bản 4.3.2) — hệ thống tổng hợp từ 10 bài đo benchmark tiêu chuẩn — Grok 4.7 chỉ đạt 46 điểm, dừng chân ở nhóm giữa. Để so sánh, hai mô hình dẫn đầu bảng hiện nay là Claude Fable 5.1 và GPT-6 đều đạt mốc 53 điểm. Ngoài ra, phân tích cũng chỉ ra rằng hai cấp độ suy luận cao nhất của Grok 4.7 dường như cho ra hiệu năng gần như tương đương nhau, chưa cho thấy sự bứt phá khi nâng mức suy luận.

Thua xa ở mảng agentic coding trước GPT-6, Claude và cả DeepSeek

Khoảng cách năng lực lộ rõ nhất ở khả năng tự hành lập trình (agentic coding). Trong bài kiểm tra Terminal-Bench 4.0, Grok 4.7 chỉ ghi nhận kết quả 26%. Con số này kém rất xa so với mức 60% của GPT-6 Astra và 55% của Claude Fable 5.1.

Đáng chú ý, ngay cả khi so với DeepSeek V4.1 Flash — một mô hình thậm chí còn có mức giá rẻ hơn — Grok 4.7 vẫn chịu xếp sau khi đối thủ này đạt 27%. Những số liệu trên cho thấy dù xAI đã nỗ lực hạ thấp rào cản chi phí để thu hút lập trình viên, khoảng cách về năng lực giải quyết tác vụ phức tạp giữa Grok và các đối thủ lớn trong ngành vẫn còn rất đáng kể.

◗ Nguồn

The Decoder21-09

Tin liên quan