NVIDIA ra mắt Magpie TTS đa ngôn ngữ, mở trọng lượng và kiểm soát triển khai cho trợ lý giọng nói thời gian thực
Magpie TTS của NVIDIA hỗ trợ 12 ngôn ngữ, cho phép triển khai trên hạ tầng riêng với độ trễ dưới 80 ms, đồng thời cung cấp trọng lượng mở để tùy chỉnh theo nhu cầu.
Tin tức nhanh
Vào ngày 10 tháng 8 năm 2026, NVIDIA công bố phiên bản mới nhất của mô hình chuyển văn bản thành giọng nói (Text‑to‑Speech – TTS) mang tên Magpie TTS Multilingual. Được phát triển dưới dạng trọng lượng mở (open‑weights) và tích hợp trong bộ giải pháp NIM (NVIDIA Inference Model) dành cho doanh nghiệp, Magpie hỗ trợ 12 ngôn ngữ, trong đó ba ngôn ngữ mới là Ả Rập Hiện Đại, Hàn Quốc và Bồ Đào Nha Brazil. Ngoài việc cho phép triển khai trên hạ tầng riêng, mô hình còn hứa hẹn độ trễ cực thấp, giúp các trợ lý giọng nói thời gian thực phản hồi nhanh hơn hẳn so với các giải pháp đám mây truyền thống.
Chi tiết kỹ thuật
Bản phát hành này được viết bởi nhóm nghiên cứu của NVIDIA, bao gồm Maryam Motamedi, Mikyas Desta, Jason Li và Jason Roche, và được đăng trên blog của Hugging Face. Magpie TTS là mô hình 364 triệu tham số với trọng lượng mở, cho phép các nhà phát triển tải về, tinh chỉnh và triển khai trên GPU của riêng mình. Đặc biệt, mô hình cung cấp hai giọng nam và nữ cho mỗi ngôn ngữ thông qua một biểu diễn đa ngôn ngữ chung, giúp giảm bớt nhu cầu duy trì nhiều mô hình riêng biệt cho từng khu vực.
Độ trễ và hiệu năng
Trong môi trường on‑premise, NVIDIA đo được Time to First Audio (TTFA) – thời gian từ khi bắt đầu sinh âm thanh tới khi người dùng nghe được âm thanh đầu tiên – ở mức 32 ms trên GPU B200, để lại đủ ngân sách độ trễ cho các bước ASR và LLM còn lại. Các chỉ số chi tiết:
| GPU | TTFA (ms) | RTFX |
|---|---|---|
| B200 (1‑stream) | 32 | 12.1× |
| B200 (64‑stream) | 239 | 319.81× |
| H100 (1‑stream) | 47 | 14.7× |
| H100 (64‑stream) | 275 | 290.79× |
| DGX Spark (1‑stream) | 53 | 9.8× |
| A100 (1‑stream) | 79 | 12.2× |
TTFA = latency to first audio; RTFX = throughput as a multiple of real‑time. Với độ trễ dưới 80 ms trên một luồng, Magpie đáp ứng yêu cầu sub‑200 ms cho toàn bộ chuỗi xử lý giọng nói, mang lại cảm giác hội thoại mượt mà cho người dùng.
Cải tiến kiến trúc
Magpie giảm thời gian suy luận bằng hai cải tiến:
- Frame stacking – bộ giải mã dự đoán đồng thời hai khung âm thanh ở mỗi bước, giảm một nửa số vòng lặp giải mã.
- Local transformer – để khắc phục giảm chất lượng do frame stacking, một transformer cục bộ mô hình hoá phụ thuộc giữa các token codebook đồng thời, giữ nguyên chất lượng âm thanh.
Hai kỹ thuật này được mô tả trong bài báo Frame‑Stacked Local Transformers for Efficient Multi‑Codebook Speech Generation (ICASSP 2026).
Chất lượng âm thanh
Phiên bản mới không chỉ mở rộng ngôn ngữ mà còn nâng cao chất lượng. So với bản trước, Magpie giảm Character Error Rate (CER) và tăng Speaker Similarity (SSIM) ở nhiều ngôn ngữ, nổi bật nhất là:
| Ngôn ngữ | CER (trước) | CER (hiện tại) | SSIM (trước) | SSIM (hiện tại) |
|---|---|---|---|---|
| Pháp | 2.70 % | 1.54 % | 0.703 | 0.747 |
| Tây Ban Nha | 1.14 % | 0.60 % | 0.715 | 0.793 |
| Đức | 0.66 % | 0.80 % | 0.626 | 0.742 |
Các ngôn ngữ mới như Ả Rập (CER = 1.62 %) cũng đạt kết quả khả quan, đồng thời hỗ trợ code‑switching cho Hindi và Japanese nhờ xử lý IPA grapheme‑to‑phoneme và từ điển phát âm tùy chỉnh, giúp đọc đúng tên riêng và thuật ngữ kỹ thuật trong nội dung hỗn hợp.
Khả năng tùy chỉnh và triển khai
Với trọng lượng mở và NIM được tối ưu sẵn, các doanh nghiệp có thể:
- Triển khai nơi dữ liệu tồn tại – đáp ứng yêu cầu tuân thủ pháp lý và bảo mật.
- Tùy chỉnh phát âm và giọng nói – phù hợp với ngữ cảnh ngành (y tế, tài chính, bán lẻ…).
- Dự đoán độ trễ trong môi trường sản xuất thực tế.
- Mở rộng quy mô trên hạ tầng GPU nội bộ, không phụ thuộc vào dịch vụ đám mây.
Bối cảnh và so sánh
Trong những năm gần đây, nhu cầu các ứng dụng giọng nói đa ngôn ngữ đã tăng mạnh, từ hỗ trợ khách hàng toàn cầu đến trợ lý y tế và hệ thống dịch thuật tự động. Các nhà cung cấp lớn như Google Cloud Speech, Amazon Polly hay Microsoft Azure Speech cung cấp API “all‑in‑one” – một cuộc gọi API, đầu vào âm thanh, đầu ra âm thanh – nhưng thường không cho phép tinh chỉnh từng thành phần (ASR, LLM, TTS) hoặc đáp ứng các yêu cầu về độ trễ và định vị dữ liệu.
NVIDIA hướng tới kiến trúc cascaded: ASR, LLM và TTS riêng biệt, mỗi lớp có thể tối ưu và triển khai độc lập trên GPU nội bộ. Magpie TTS là phần cốt lõi của kiến trúc này, cung cấp một nền tảng mở cho phép các nhà phát triển thay thế, cập nhật mô hình nhanh chóng và kiểm soát toàn bộ chuỗi xử lý. Điều này tạo lợi thế cạnh tranh đáng kể so với các giải pháp đóng, nơi người dùng phải chấp nhận độ trễ mạng và ít khả năng tùy biến.
Với việc mở trọng lượng và hỗ trợ 12 ngôn ngữ, Magpie không chỉ đáp ứng xu hướng “AI giọng nói đa ngôn ngữ mặc định” mà còn mở ra khả năng tùy chỉnh sâu cho các doanh nghiệp muốn xây dựng trợ lý giọng nói thực sự riêng biệt, nhanh chóng và an toàn. Đây là một bước tiến quan trọng trong cuộc đua công nghệ AI âm thanh, hứa hẹn thay đổi cách các tổ chức triển khai và vận hành các giải pháp thoại trong tương lai.
