AI RACE— Cuộc đua AI
Model mới

Google ra mắt Gemini 3.8 Flash TTS: Tạo và tùy biến giọng nói AI từ câu lệnh văn bản

Google vừa trình làng hai mô hình tạo giọng nói Gemini 3.8 Flash TTS và Flash-Lite TTS, cho phép người dùng thiết kế giọng nói hoàn toàn mới từ mô tả văn bản và hỗ trợ hơn 100 ngôn ngữ.

00:39 24/09/2026
Google ra mắt Gemini 3.8 Flash TTS: Tạo và tùy biến giọng nói AI từ câu lệnh văn bản

Bước tiến mới của Google trong công nghệ tổng hợp giọng nói

Google vừa chính thức công bố hai mô hình chuyển văn bản thành giọng nói (Text-to-Speech - TTS) thế hệ mới gồm Gemini 3.8 Flash TTS và Flash-Lite TTS. Cả hai đều hỗ trợ hơn 100 ngôn ngữ và cho phép nhúng trực tiếp các chỉ dẫn biểu cảm vào từng câu thoại.

Trong đó, Gemini 3.8 Flash TTS hướng đến các tác vụ sáng tạo đòi hỏi chất lượng cao như làm podcast, sách nói hay lồng tiếng nhân vật game. Ngược lại, Gemini 3.8 Flash-Lite TTS được tối ưu hóa cho bài toán tạo giọng nói quy mô lớn với chi phí thấp, phù hợp để thuyết minh tự động, sản xuất nội dung số hàng loạt hoặc tích hợp vào trợ lý ảo (voice agents).

Tạo giọng nói từ câu lệnh và nhân bản giọng nói chỉ với 30 giây

Điểm nổi bật nhất của Gemini 3.8 Flash TTS là khả năng thiết kế giọng nói hoàn toàn mới từ con số không thông qua câu lệnh mô tả (prompt). Người dùng có thể chỉ định vai diễn, chất giọng, đặc tính âm thanh và ngữ điệu vùng miền cụ thể. Với những ai không muốn thiết kế từ đầu, Google cung cấp thư viện sẵn có với hơn 2.000 giọng đọc, bao gồm nhiều biến thể địa phương như tiếng Tây Ban Nha chuẩn Mexico, tiếng Pháp Quebec hay tiếng Anh giọng Scotland.

Bên cạnh đó, mô hình tích hợp tính năng nhân bản giọng nói (voice cloning) từ một đoạn mẫu âm thanh chỉ dài 30 giây. Nhằm ngăn chặn nguy cơ mạo danh hay lạm dụng deepfake, Google đặt ra cơ chế kiểm soát nghiêm ngặt: chủ nhân của giọng nói bắt buộc phải thu âm một đoạn tuyên bố đồng thuận và hệ thống sẽ đối chiếu để đảm bảo âm sắc trong đoạn đồng thuận trùng khớp hoàn toàn với mẫu âm thanh cung cấp. Ngoài ra, mọi tệp âm thanh xuất ra từ các mô hình này đều được nhúng thủy vân âm thanh vô hình SynthID để phục vụ việc nhận diện nội dung AI.

Về khả năng kiểm soát kịch bản, cả hai mô hình đều cho phép người dùng đưa vào các chỉ dẫn diễn xuất chi tiết cho từng dòng thoại hoặc để AI tự diễn giải ngữ cảnh. Google cho biết mô hình duy trì tính ổn định rất cao khi đọc các đoạn văn bản dài mà gần như không gặp hiện tượng lệch giọng ("speaker drift"). Hệ thống cũng hỗ trợ chế độ hội thoại hai nhân vật từ một kịch bản duy nhất nhưng vẫn giữ được sự tách biệt rõ ràng giữa hai giọng, đồng thời có thể chèn các phản ứng tự nhiên như tiếng cười, tiếng thở dài hay tiếng đệm "mhm" vào đúng vị trí mong muốn.

Trong tương lai, hãng dự kiến bổ sung thêm tính năng "Voice Remixing", cho phép can thiệp sâu hơn vào âm sắc, cao độ, tốc độ đọc và trọng âm của các giọng có sẵn trong thư viện.

Mức giá cạnh tranh và hệ sinh thái triển khai rộng mở

Google khẳng định các mô hình mới đang dẫn đầu ở hầu hết hạng mục trong bài kiểm tra chuẩn TTS của Hume AI. Hiện tại, hai mô hình này đã bắt đầu được phân phối qua Gemini API và nền tảng Google AI Studio. Ngoài ra, Flash TTS đã được đưa vào Gemini Notebook, còn Flash-Lite TTS xuất hiện trên công cụ tạo video Google Vids. Cổng truy cập dành cho doanh nghiệp (Gemini Enterprise API) dự kiến sẽ sớm được kích hoạt, trong khi nhiều nền tảng lập trình như Agora, LiveKit, Pipecat và Vercel đã tích hợp sẵn API này.

Về mặt chi phí, Google tính cước dựa trên mỗi một triệu token (triệu token văn bản cho đầu vào và triệu token âm thanh cho đầu ra). Theo quy đổi của Google, một giây âm thanh tương đương 25 token, tức một giờ âm thanh đầu ra tiêu tốn khoảng 90.000 token.

  • Đến hết năm 2026: Flash TTS có giá 0,50 USD/triệu token văn bản đầu vào và 9,00 USD/triệu token âm thanh đầu ra (khoảng 0,81 USD cho mỗi giờ âm thanh). Flash-Lite TTS có giá 0,50 USD cho đầu vào và 6,00 USD cho đầu ra (khoảng 0,54 USD mỗi giờ âm thanh).
  • Từ ngày 1/1/2027: Mức giá sẽ được điều chỉnh tăng lên. Flash TTS sẽ có phí 1,00 USD đầu vào và 18,00 USD đầu ra (khoảng 1,62 USD/giờ âm thanh), còn Flash-Lite TTS là 1,00 USD đầu vào và 12,00 USD đầu ra (khoảng 1,08 USD/giờ âm thanh).

Google cũng nêu rõ chính sách dữ liệu: các yêu cầu sử dụng thông qua gói miễn phí có thể được tận dụng để cải thiện sản phẩm của hãng, trong khi dữ liệu từ các tài khoản trả phí sẽ được bảo mật và không dùng cho mục đích huấn luyện.

◗ Nguồn

The Decoder24-09

Tin liên quan