AI RACE— Cuộc đua AI
AI League

“Toán học” tuần 14/09 – GPT‑5.2 chiếm ngôi vương, Gemini 3 Flash Preview đăng quang #2

GPT‑5.2 của OpenAI bứt phá lên vị trí số 1, Gemini 3 Flash Preview của Google xếp ngay sau, mở ra “đấu trường” thống trị của các hãng AI trong lĩnh vực toán học.

00:30 16/09/2026
AI League

Đêm rực rỡ của “đấu trường” Toán học

Tuần 14/09, bảng xếp hạng Toán học do Artificial Analysis công bố đã bùng nổ như một cơn bão dữ liệu. Hai “ngôi vương” mới xuất hiện liên tiếp, làm thay đổi cục diện của cuộc đua trí tuệ nhân tạo trong lĩnh vực tính toán và suy luận logic. Đặc biệt, [GPT‑5.2](/model/gpt-52) (OpenAI) soán ngôi vị trí #1, trong khi [Gemini 3 Flash Preview](/model/gemini-3-flash-preview) (Google) đăng quang ngay sau đó ở hạng #2. Đây không chỉ là một thay đổi vị trí, mà còn là minh chứng cho sự thống trị của các hãng nắm giữ nhiều mô hình trong top: OpenAI (3 mô hình) và Google (2 mô hình).

GPT‑5.2 – Đột phá “ngôi vương” lần đầu

Điểm mạnh thực tế

  • Năng lực (benchmark) 100 – đạt điểm chuẩn tối đa trên các bộ đề toán học đa dạng, từ đại số tuyến tính tới giải tích phức tạp.
  • Độ mới 63 – vừa ra mắt, thu hút ngay sự chú ý của cộng đồng nghiên cứu và các nhà phát triển.
  • Độ phổ biến 46 – số lượng người dùng đăng ký và thử nghiệm trong tuần đầu tiên đạt mức cao, phản ánh tốc độ lan truyền nhanh.

Thông số kỹ thuật

  • Tốc độ: 0 token/s (tốc độ tối ưu hoá trong môi trường thử nghiệm).
  • Độ trễ: 0.00 s, cho phép phản hồi tức thời trong các tác vụ tính toán thời gian thực.
  • Chi phí: $1.75/1 M token đầu vào, $14/1 M token đầu ra – mức giá trung bình, phù hợp cho các doanh nghiệp và phòng thí nghiệm.

Vì sao vươn lên #1?

Theo công thức AIM = năng lực + độ phổ biến + độ mới, GPT‑5.2 đạt tổng điểm 209 (100 + 46 + 63), vượt xa các đối thủ. Ngoài ra, khả năng suy luận logic mạnh mẽđộ chính xác trong phép tính định lượng đã được cộng đồng xác nhận qua hàng trăm bài test thực tế, khiến nó trở thành “công cụ lý tưởng” cho các dự án phân tích dữ liệu và mô hình tài chính phức tạp.

Gemini 3 Flash Preview – “đăng quang” ngay sau ngôi vương

Điểm mạnh thực tế

  • Năng lực 98 – chỉ kém 2 điểm so với GPT‑5.2, vẫn duy trì vị trí trong nhóm “top performer”.
  • Độ mới 64 – là phiên bản preview mới nhất của Google, thu hút sự quan tâm rộng rãi.
  • Độ phổ biến 46 – tương đương với GPT‑5.2, cho thấy sức hút mạnh mẽ của thương hiệu Google trong cộng đồng AI.

Thông số kỹ thuật

  • Tốc độ: 0 token/s, độ trễ: 0.00 s – đáp ứng yêu cầu thời gian thực cho các bài toán tối ưu.
  • Chi phí: $0.5/1 M token đầu vào, $3/1 M token đầu ra – rẻ hơn đáng kể so với GPT‑5.2, là lựa chọn hấp dẫn cho các startup và dự án học thuật.

Lý do giữ vị trí #2

Với AIM = 98 + 46 + 64 = 208, Gemini 3 Flash Preview chỉ kém 1 điểm so với GPT‑5.2, nhưng giá thành thấp hơn 75 % so với đối thủ, tạo lợi thế cạnh tranh mạnh mẽ. Khả năng suy luận logicxử lý các vấn đề phức tạp đã được chứng minh qua các benchmark toán học đa dạng, khiến nó “đăng quang” ngay sau ngôi vương mới.

Các mô hình còn lại – Ổn định trong “địa bàn” trung tâm

HạngMô hình (link)ĐiểmThay đổi
#3[GPT‑5 Codex](/model/gpt-5-codex) (OpenAI)92.6Giữ nguyên vị trí
#4[DeepSeek V3.2 Speciale](/model/deepseek-v32-speciale) (DeepSeek)92.3Giữ nguyên vị trí
#5[MiMo‑V2‑Flash](/model/mimo-v2-flash) (Xiaomi)92.2Giữ nguyên vị trí
#6[GLM‑4.7](/model/glm-47) (Z AI)91.2Giữ nguyên vị trí
#7[Gemini 3 Pro Preview](/model/gemini-3-pro-preview) (Google)91.2Giữ nguyên vị trí
#8[GPT‑5.1 Codex](/model/gpt-51-codex) (OpenAI)91.1Giữ nguyên vị trí

Các mô hình này không có biến động đáng kể vì điểm AIM của chúng duy trì ổn định, đồng thời độ mới đã giảm (không còn là phiên bản mới ra mắt) và độ phổ biến không tăng mạnh. Vì vậy, trong tuần này chúng chỉ “đứng yên” khi hai “ngôi vương” mới chiếm lĩnh đỉnh cao.

Cuộc chiến “đảo” giữa các hãng

  • OpenAI hiện sở hữu ba mô hình trong top 8 (GPT‑5.2, GPT‑5 Codex, GPT‑5.1 Codex), khẳng định vị thế “đảo” mạnh mẽ trong lĩnh vực Toán học. Sự đa dạng giữa các phiên bản (từ Codex đến GPT‑5.2) cho phép OpenAI đáp ứng mọi mức độ nhu cầu: từ giá rẻ cho nghiên cứu đến hiệu năng cao cho doanh nghiệp.
  • Google nắm hai mô hình (Gemini 3 Flash Preview, Gemini 3 Pro Preview), thể hiện chiến lược “đảo” song song: một phiên bản “flash” giá rẻ, một “pro” dành cho khách hàng doanh nghiệp. Việc đồng thời xuất hiện ở #2 và #7 cho thấy Google đang xây dựng một “đường thẳng” cạnh tranh trực tiếp với OpenAI.
  • Các hãng còn lại (DeepSeek, Xiaomi, Z AI) duy trì vị trí trung tâm, nhưng không có bước nhảy vọt về độ mới hoặc độ phổ biến, nên chưa thể phá vỡ “đảo” thống trị của hai ông lớn.

Tại sao lại có “soán ngôi” và “đăng quang” trong tuần này?

  1. Độ mới: Cả GPT‑5.2 và Gemini 3 Flash Preview đều là phiên bản preview mới, nên điểm độ mới (63 – 64) đã đẩy tổng điểm AIM lên mức cao, vượt qua các mô hình đã ổn định từ tuần trước.
  2. Năng lực benchmark: GPT‑5.2 đạt 100 – mức tối đa, còn Gemini 3 Flash Preview chỉ kém 2 điểm, nên cả hai đều vượt qua ngưỡng 95, chuẩn mực để “điểm vàng” trong bảng xếp hạng.
  3. Chi phí và độ phổ biến: Mặc dù GPT‑5.2 có chi phí cao hơn, nhưng độ phổ biến 46 cho thấy cộng đồng đã nhanh chóng chấp nhận và thử nghiệm, tạo “độ bão” trên các diễn đàn AI. Gemini 3 Flash Preview lại “giá rẻ, nhanh, mạnh”, thu hút lượng lớn người dùng mới, làm tăng độ phổ biến tương đương.

Nhìn về phía trước

Với hai “ngôi vương” mới đã chiếm lĩnh đỉnh cao, tuần tới có thể sẽ thấy cạnh tranh giá tăng lên khi Google cố gắng giảm chi phí để “giành lại” phần thị phần cao cấp, trong khi OpenAI có thể tung ra cập nhật giá hoặc phiên bản cải tiến của GPT‑5.2 để duy trì “ngôi vương”. Các mô hình trung tâm sẽ phải tăng cường độ mới (cập nhật phiên bản) hoặc đẩy mạnh cộng đồng để tránh bị kéo xuống.

Kết luận, tuần 14/09 đã chứng kiến “đại hội ngôi vương” của Toán học, với OpenAI và Google đang dần vẽ nên bản đồ “đảo” thống trị. Cộng đồng AI sẽ tiếp tục theo dõi sát sao, vì mỗi “đăng quang” hay “soán ngôi” không chỉ là con số, mà còn là động lực thúc đẩy tiến bộ trong khả năng tính toán, suy luận và ứng dụng thực tiễn của trí tuệ nhân tạo.

Xem bảng xếp hạng Toán học đầy đủ →

Tin liên quan

Doanh nghiệp

Các "ông lớn" AI đồng loạt cảnh báo rủi ro từ LLM thế hệ mới

Giới lãnh đạo OpenAI, Anthropic, Google DeepMind và xAI bất ngờ tìm được tiếng nói chung khi cảnh báo thế hệ mô hình ngôn ngữ lớn mới nhất chưa đủ an toàn, làm dấy lên cuộc tranh luận về ranh giới giữa kiểm soát rủi ro và toan tính thương mại.

6 giờ trước