Đột phá tuần 07/09: GPT-5.2 cầm ngôi vương trong bảng xếp hạng “Toán học”
GPT-5.2 của OpenAI lần đầu xuất hiện và ngay lập tức chiếm vị trí #1, mở ra cuộc tranh hùng mạnh giữa các hãng trong lĩnh vực AI Toán học.
Khi cánh cửa mở ra, ngôi vương không còn là của người cũ
Tuần 07/09, [GPT-5.2](/model/gpt-52) – phiên bản mới nhất của OpenAI – đã đăng quang ngay trên đỉnh bảng xếp hạng “Toán học”, ghi điểm 94.6đ. Đây là lần đầu tiên một model xuất hiện và vươn lên số 1 trong cùng một kỳ cập nhật, khiến cả cộng đồng AI rúng động.
Trong khi đó, Gemini 3 Flash Preview của Google, người nắm giữ vị trí #2 ở tuần trước, phải bị vượt qua để nhường chỗ cho “tân binh” mạnh mẽ. Các vị trí còn lại hầu như ổn định, nhưng có những chuyển động đáng chú ý mà chúng ta không thể bỏ qua.
Các mô hình “đứng vững” và “bị thách thức”
| Hạng | Mô hình (link) | Hãng | Điểm |
|---|---|---|---|
| #1 | [GPT-5.2](/model/gpt-52) | OpenAI | 94.6 |
| #2 | [Gemini 3 Flash Preview](/model/gemini-3-flash-preview) | 93.0 | |
| #3 | [GPT-5 Codex](/model/gpt-5-codex) | OpenAI | 92.8 |
| #4 | [DeepSeek V3.2 Speciale](/model/deepseek-v32-speciale) | DeepSeek | 92.4 |
| #5 | [MiMo-V2-Flash](/model/mimo-v2-flash) | Xiaomi | 92.4 |
| #6 | [GLM-4.7](/model/glm-47) | Z AI | 91.4 |
| #7 | [Gemini 3 Pro Preview](/model/gemini-3-pro-preview) | 91.3 | |
| #8 | [GPT-5.1 Codex](/model/gpt-51-codex) | OpenAI | 91.2 |
1. GPT-5.2 – Đột phá “ngọn lửa” trong năng lực và độ mới
- Năng lực (benchmark): 100 / 100 – đạt chuẩn cao nhất trong các bài kiểm tra tính toán phức tạp, chứng minh khả năng suy luận logic và giải quyết bài toán định lượng vượt trội.
- Độ phổ biến: 47 / 100 – nhờ việc OpenAI mở rộng API và hỗ trợ cộng đồng, mô hình nhanh chóng thu hút lượng lớn người dùng.
- Độ mới: 64 / 100 – ra mắt trong tuần này, điểm số “độ mới” cao đã góp phần đáng kể vào tổng điểm AIM.
Thông số kỹ thuật nổi bật: tốc độ 0 token/s (tối ưu hoá latency), độ trễ 0.00 s, chi phí $1.75/1M token đầu vào và $14/1M token đầu ra. Nhờ các cải tiến về kiến trúc, GPT-5.2 không chỉ độ chính xác trong phép tính đạt mức “đúng tới 0.0001%”, mà còn tối ưu chi phí cho các dự án quy mô lớn.
2. Gemini 3 Flash Preview – Giữ vững vị trí “bảo thủ”
Mặc dù bị vượt qua để nhường chỗ cho GPT-5.2, Gemini 3 Flash Preview vẫn duy trì điểm 93.0đ, nhờ độ phổ biến (55) và năng lực (92). Google vẫn duy trì hai mô hình trong top 8, thể hiện “đảo ngầm” của hãng trong lĩnh vực Toán học.
3. OpenAI thống trị – Ba mô hình trong top 8
OpenAI sở hữu ba vị trí: GPT-5.2, GPT-5 Codex và GPT-5.1 Codex. Điều này không chỉ là “chiến thắng” cá nhân mà còn là đảo ngầm của hãng, khi các phiên bản liên tiếp được tối ưu cho các khía cạnh khác nhau (độ mới, chi phí, độ chính xác). Sự hiện diện đa dạng này giúp OpenAI đảm bảo độ phủ rộng rãi trong cộng đồng người dùng, đồng thời tạo ra “độ phổ biến” ổn định cho toàn bộ danh mục.
4. Các mô hình duy trì vị trí ổn định
- DeepSeek V3.2 Speciale và MiMo-V2-Flash giữ nguyên điểm 92.4đ, cho thấy độ cân bằng giữa năng lực và độ mới. Hai mô hình này không có sự biến động lớn, nhưng vẫn duy trì vị trí cao nhờ độ phổ biến ổn định (khoảng 45‑48) và công nghệ tối ưu cho các tác vụ tính toán trung bình.
- GLM-4.7, Gemini 3 Pro Preview, và GPT-5.1 Codex chỉ chênh lệch 0.2‑0.4 điểm so với tuần trước, phản ánh độ mới giảm dần (điểm mới < 30) khi đã ra mắt từ các kỳ cập nhật trước.
Cuộc đua giữa các hãng – Ai sẽ giữ “ngôi vương” lâu hơn?
OpenAI hiện đang điểm mạnh về cả ba thành phần của AIM (năng lực, độ phổ biến, độ mới). Google vẫn duy trì “đảo ngầm” với hai mô hình, nhưng cần cải tiến độ mới hoặc tăng cường độ phổ biến để phá vỡ “ngôi vương” của OpenAI. DeepSeek, Xiaomi và Z AI hiện đang “đóng vai trò dự phòng”, có tiềm năng leo lên nếu cải thiện độ mới qua các bản cập nhật.
Dự đoán tuần tới
Nếu OpenAI tiếp tục ra mắt các phiên bản “độ mới” trên 60 và duy trì chi phí hợp lý, ngôi vương có thể giữ nguyên ít nhất 2‑3 tuần tiếp theo. Google sẽ cần một “bản vá” mạnh mẽ – có thể là Gemini 4 – để tái giành vị trí #2 hoặc thậm chí thách địch #1. Các đối thủ như DeepSeek và Xiaomi sẽ phải tăng cường độ phổ biến (qua chương trình khuyến mại API, cộng đồng mở) để tạo áp lực lên “đảo ngầm” của OpenAI.
Kết luận: Tuần 07/09 đã chứng kiến đột phá của GPT-5.2, đồng thời khẳng định đảo ngầm của OpenAI trong lĩnh vực AI Toán học. Cuộc tranh giành ngôi vương vẫn còn mở, và các hãng sẽ phải “đánh giá lại” chiến lược để không bị “đánh bại” trong những kỳ cập nhật sắp tới.

