Bảng xếp hạng Toán học: GPT-5.2 ra mắt đã soán ngôi #1 ngay lập tức, OpenAI áp đảo top 8
Tân binh GPT-5.2 của OpenAI vừa trình làng đã đăng quang vị trí số 1 bảng xếp hạng Toán học với 95,4 điểm, đẩy dàn model cũ lùi lại phía sau trong khi OpenAI củng cố sự áp đảo với 3 đại diện trong top 8.
Ngôi vương bảng xếp hạng Toán học vừa đổi chủ theo cách không ai kịp trở tay. Chỉ vừa xuất hiện, GPT-5.2 của OpenAI đã vươn thẳng lên hạng #1 với 95,4 điểm — một cú ra mắt kiểu "chiếm ngôi ngay từ trận đầu" hiếm khi xảy ra trên bất kỳ bảng xếp hạng nào.
Toán học
| # | Mô hình | AIMcách #1 | Biến động |
|---|---|---|---|
| 1 | OpenAI | 95.4 | MỚI |
| 2 | Google | 93.8−1.6 | |
| 3 | OpenAI | 93.6−1.8 | |
| 4 | DeepSeek | 93.3−2.1 | |
| 5 | Xiaomi | 93.2−2.2 | |
| 6 | Z AI | 92.2−3.2 | |
| 7 | Google | 92.1−3.3 | |
| 8 | OpenAI | 92.0−3.4 |
Điều làm nên cú soán ngôi này không phải may mắn. Theo dữ liệu từ Artificial Analysis, GPT-5.2 đạt điểm năng lực (benchmark) tuyệt đối 100/100 — mức cao nhất có thể — trong khi điểm mới cũng lên tới 70, phản ánh đúng việc model vừa trình làng. Điểm phổ biến hiện ở mức 56, cho thấy cộng đồng vẫn đang trong giai đoạn làm quen chứ chưa kịp phổ cập rộng, nhưng năng lực thuần túy đã đủ để model này bỏ xa phần còn lại của bảng. Về điểm mạnh thực tế, GPT-5.2 được đánh giá vượt trội trong toán học và phép tính chính xác, lý tưởng cho các bài toán định lượng và phân tích dữ liệu, cùng khả năng suy luận logic mạnh mẽ khi xử lý những tình huống cần tư duy phân tích sâu — đúng trọng tâm của một bảng xếp hạng Toán học. Về giá, model được định giá 1,75 USD/1 triệu token đầu vào và 14 USD/1 triệu token đầu ra, mức giá thuộc phân khúc cao cấp tương xứng với vị trí dẫn đầu.
Cuộc đua giờ là của OpenAI, không chỉ của một model
Điều đáng chú ý hơn cả việc có một tân binh #1 là bức tranh tổng thể: OpenAI hiện nắm tới 3 vị trí trong top 8, gồm GPT-5.2 (#1), GPT-5 Codex giữ vững hạng #3 với 93,6 điểm, và GPT-5.1 Codex neo ở hạng #8 với 92,0 điểm. Đây không còn là câu chuyện một model đơn lẻ vượt lên, mà là một hãng đang phủ sóng gần một nửa phần trên của bảng xếp hạng Toán học — một sự áp đảo theo chiều rộng chứ không chỉ chiều sâu.
Ở phía đối trọng, Google cũng không hề lép vế khi giữ 2 vị trí: Gemini 3 Flash Preview tiếp tục bám hạng #2 với 93,8 điểm — chỉ kém GPT-5.2 vỏn vẹn 1,6 điểm, cho thấy khoảng cách giữa ngôi đầu mới và vị trí cũ không hề xa — trong khi Gemini 3 Pro Preview giữ nguyên hạng #7 với 92,1 điểm. Nếu nhìn theo khung cuộc đua giữa các hãng, tuần này là màn so kè rõ nét giữa OpenAI (áp đảo số lượng) và Google (giữ chắc vị trí cao ở cả hai đại diện).
Phần còn lại của bảng: ổn định nhưng không hề yên ắng
Phía dưới top 3, cục diện gần như đứng yên về thứ hạng nhưng vẫn có những cái tên đáng giữ chân. DeepSeek V3.2 Speciale của DeepSeek tiếp tục giữ hạng #4 với 93,3 điểm, bám sát nhóm dẫn đầu mà không để tụt hạng dù có tân binh chen ngang. MiMo-V2-Flash của Xiaomi giữ vững #5 với 93,2 điểm, và GLM-4.7 của Z AI giữ nguyên #6 với 92,2 điểm. Sự ổn định này, đặt cạnh cú vươn lên chớp nhoáng của GPT-5.2, cho thấy khoảng cách điểm số giữa hạng #2 và hạng #6 chỉ vỏn vẹn 1,7 điểm — một bảng xếp hạng đang cạnh tranh cực kỳ sít sao ở nhóm giữa, trong khi ngôi đầu lại bị một tân binh kéo giãn ra hẳn.
Câu chuyện tuần này vì thế có hai lớp: lớp bề mặt là một cú đăng quang ngoạn mục của GPT-5.2 ngay từ lần xuất hiện đầu tiên, và lớp sâu hơn là tín hiệu về việc OpenAI đang xây dựng một hàng ngũ nhiều tầng trong hạng mục Toán học thay vì đặt cược vào một model duy nhất. Với khoảng cách điểm mong manh ở nhóm giữa bảng, tuần cập nhật tới sẽ là phép thử xem liệu Google có tung ra phiên bản Gemini nào đủ mạnh để thu hẹp khoảng cách với ngôi đầu, hay DeepSeek và Xiaomi có tiếp tục giữ được vị trí trước sức ép ngày càng lớn từ dàn model OpenAI.


