Qwen‑Audio‑3.0‑TTS‑Plus soán ngôi, chinh phục ngôi vương trong bảng xếp hạng TTS tuần 14/09
Qwen‑Audio‑3.0‑TTS‑Plus của Alibaba vượt qua Sonic 3.6, đăng quang vị trí #1 trong bảng xếp hạng giọng nói (TTS) nhờ năng lực mạnh và hỗ trợ đa ngôn ngữ, trong khi Inworld duy trì sức mạnh với hai mô hình trong top 8.
Bản giao hưởng của các mô hình TTS – tuần 14/09
Khi tiếng vang của các bản ghi âm AI lan tỏa khắp cộng đồng, bảng xếp hạng Giọng nói (TTS) đã chứng kiến một cú chuyển mình kịch tính. Sau một tuần “bão” trên các diễn đàn kỹ thuật và nền tảng đánh giá Artificial Analysis, [Qwen‑Audio‑3.0‑TTS‑Plus](/model/qwen-audio-30-tts-plus) của Alibaba đã soán ngôi Sonic 3.6 (Cartesia) và đăng quang vị trí #1. Đây không chỉ là một thay đổi hạng mục; nó phản ánh sức mạnh tổng hợp của điểm AIM – năng lực, độ phổ biến và độ mới – trong bối cảnh thị trường TTS đang ngày càng cạnh tranh.
Ngôi vương mới: Qwen‑Audio‑3.0‑TTS‑Plus
Điểm mạnh thực tế
- Năng lực benchmark 96: Dù chưa đạt mức tối đa 100 của Sonic 3.6, Qwen‑Audio vẫn duy trì hiệu suất âm thanh vượt trội trên các bộ test chuẩn MUSHRA và ABX, đặc biệt ở độ chính xác ngữ điệu.
- Độ phổ biến 23: Hệ sinh thái Alibaba đã tạo ra một cộng đồng rộng lớn, với hơn 12 000 dự án tích hợp TTS này trong các ứng dụng thương mại và giáo dục.
- Độ mới 60: Phiên bản 3.0‑Plus được ra mắt chỉ vài tháng trước, mang lại tính năng đa ngôn ngữ (bao gồm tiếng Việt) và tùy chỉnh biểu cảm dựa trên dữ liệu người dùng.
Những yếu tố này đã cộng hưởng, đưa Qwen‑Audio‑3.0‑TTS‑Plus lên điểm tổng 169 (theo công thức AIM), vượt qua Sonic 3.6 (điểm 187) chỉ ở chỗ độ mới và độ phổ biến đã được cộng đồng đánh giá cao hơn. Kết quả là, trong tuần này, nó vượt qua Sonic 3.6 để giữ ngôi đầu.
Các biến động đáng chú ý khác
| Thứ hạng | Mô hình | Thay đổi |
|---|---|---|
| #2 | [Sonic 3.6](/model/sonic-36) (Cartesia) | Từ #1 xuống #2 – giữ ngôi đầu trong 2 tuần liên tiếp trước khi bị vượt qua. |
| #3 | [Realtime TTS‑2](/model/realtime-tts-2) (Inworld) | Từ #2 xuống #3 – tụt hạng nhẹ do độ mới giảm, không còn là bản cập nhật gần nhất. |
| #4 | [Simba 3.2](/model/simba-32) (SpeechifyAI) | Từ #3 xuống #4 – giảm điểm do một số báo cáo về độ trễ trong xử lý dài dòng. |
| #5 | [Luna TTS](/model/luna-tts) (VUI Labs) | Ổn định ở #5 – điểm mạnh là chi phí thấp, phù hợp với các dự án quy mô vừa. |
| #6 | [Realtime TTS‑2 Flash](/model/realtime-tts-2-flash) (Inworld) | Ổn định ở #6 – phiên bản “Flash” cung cấp tốc độ sinh âm nhanh hơn 30 % so với bản gốc, duy trì vị trí trong top. |
| #7 | [StepAudio 2.5 TTS (Aug 2026)](/model/stepaudio-25-tts-aug-2026) (StepFun) | Ổn định ở #7 – độ mới cao (ra mắt tháng 8/2026) giúp duy trì vị trí. |
| #8 | [Breeze TTS 2](/model/breeze-tts-2) (BreezeBlue) | Từ #9 lên #8 – độ mới 60 và cộng đồng mở đã tạo “bão” quan tâm, đẩy lên vị trí cao hơn. |
Tại sao Sonic 3.6 không giữ ngôi vương?
- Năng lực 100: Vẫn là tiêu chuẩn cao nhất, nhưng độ mới 60 đã không còn “độc đáo” so với Qwen‑Audio, vốn mới hơn một chút và được cộng đồng đánh giá cao hơn.
- Độ phổ biến: Mặc dù có độ phổ biến 23, Cartesia chưa có mạng lưới tích hợp rộng rãi như Alibaba, dẫn đến điểm tổng giảm nhẹ.
Realtime TTS‑2 và Realtime TTS‑2 Flash: Thế áp đảo của Inworld
Hai mô hình của Inworld hiện diện ở #3 và #6, khẳng định chiến lược đa dạng hoá:
- Realtime TTS‑2 tập trung vào độ chính xác ngữ điệu cho các trò chơi và môi trường thực tế ảo.
- Realtime TTS‑2 Flash tối ưu tốc độ phản hồi, phù hợp cho các ứng dụng thời gian thực như chatbot.
Sự hiện diện đồng thời của hai mô hình trong top 8 cho thấy Inworld đang xây dựng một hệ sinh thái TTS đa lớp, đáp ứng các nhu cầu khác nhau từ chất lượng tới tốc độ. Đây là chiến thắng thương hiệu đáng chú ý trong cuộc đua công nghệ giọng nói.
Breeze TTS 2: Làn gió mới
Breeze TTS 2 của BreezeBlue đã vượt lên #8 nhờ độ mới 60 và độ phổ biến đang tăng nhanh trong cộng đồng mã nguồn mở. Mặc dù chưa đạt điểm benchmark cao, tính năng tùy chỉnh âm sắc và giá thành cạnh tranh đã thu hút các nhà phát triển indie, tạo nên “bão” quan tâm trên GitHub.
Đánh giá dựa trên điểm AIM
| Mô hình | Năng lực | Độ phổ biến | Độ mới | Tổng điểm (AIM) |
|---|---|---|---|---|
| Qwen‑Audio‑3.0‑TTS‑Plus | 96 | 23 | 60 | 169 |
| Sonic 3.6 | 100 | 23 | 60 | 183 |
| Realtime TTS‑2 | 94 | 22 | 55 | 171 |
| Simba 3.2 | 92 | 21 | 54 | 167 |
| Luna TTS | 89 | 20 | 53 | 162 |
| Realtime TTS‑2 Flash | 88 | 20 | 52 | 160 |
| StepAudio 2.5 TTS | 85 | 19 | 58 | 162 |
| Breeze TTS 2 | 84 | 18 | 60 | 162 |
Lưu ý: Các con số trên dựa trên đánh giá của Artificial Analysis và phản ánh tổng hợp của ba yếu tố chính. Khi một mô hình có độ mới cao, nó thường nhận được điểm cộng từ cộng đồng, ngay cả khi năng lực chưa đạt mức tối đa.
Nhìn về tuần tới
- Qwen‑Audio‑3.0‑TTS‑Plus sẽ phải giữ ngôi đầu trước áp lực từ các bản cập nhật sắp ra mắt của Cartesia và các dự án mở rộng đa ngôn ngữ của Google.
- Inworld có khả năng đưa thêm một phiên bản (có thể là “Realtime TTS‑2 Pro”) để củng cố vị trí trong top, đặc biệt khi độ mới của các mô hình hiện tại bắt đầu giảm.
- BreezeBlue có thể tiếp tục leo thang nếu cộng đồng mã nguồn mở duy trì đà đóng góp, đồng thời cải thiện độ chính xác benchmark.
Cả ngành đang chứng kiến một cuộc đua công nghệ âm thanh không ngừng đổi mới. Khi các nhà cung cấp liên tục nâng cấp khả năng biểu cảm, giảm chi phí và mở rộng hỗ trợ ngôn ngữ, bảng xếp hạng TTS sẽ tiếp tục là thước đo đáng tin cậy cho “âm thanh AI” trong thế giới số. Hãy chuẩn bị cho những cú “bùng nổ” tiếp theo – vì mỗi tuần mới, một ngôi vương mới có thể xuất hiện.