AI RACE— Cuộc đua AI
Model mới

Suno ra mắt tính năng ‘Speech’, cho phép tạo giọng đọc AI lồng ghép nhạc nền

Nền tảng âm nhạc AI Suno vừa tung ra công cụ thử nghiệm công khai mang tên Speech, cho phép người dùng tạo giọng đọc nhân tạo đi kèm nhạc nền ăn khớp trong cùng một bản ghi.

16:42 02/10/2026
Suno ra mắt tính năng ‘Speech’, cho phép tạo giọng đọc AI lồng ghép nhạc nền

Nền tảng âm thanh tạo sinh (generative audio) Suno đang mở rộng phạm vi hoạt động ra ngoài mảng sáng tác bài hát với việc trình làng "Speech" — công cụ mới được thiết kế để tạo giọng đọc dựa trên kịch bản văn bản hoặc mô tả bằng câu lệnh (prompt). Tính năng này hiện đã có mặt dưới dạng thử nghiệm công khai (public beta) trên cả ứng dụng web lẫn di động của Suno.

Khác với các công cụ chuyển văn bản thành giọng nói (text-to-speech) truyền thống, điểm khác biệt lớn nhất của Suno nằm ở khả năng tạo đồng thời giọng đọc nhân tạo và phần nhạc nền đi kèm, hòa quyện thành một tệp âm thanh đồng nhất.

Kết hợp giọng nói và nhạc nền

Theo Suno, công cụ mới hướng tới việc xóa nhòa ranh giới giữa lời đọc và phần đệm âm nhạc. Người dùng có thể trải nghiệm tính năng bằng cách chọn tab "Create" trên giao diện và điều hướng đến mục "Speech".

"Âm nhạc sẽ luôn là giá trị cốt lõi của Suno cũng như những gì chúng tôi đang xây dựng. Song song với đó, tầm nhìn của chúng tôi luôn mở rộng tới các hình thức biểu đạt khác của con người", Jack Brody, Giám đốc Sản phẩm của Suno, chia sẻ trong thông cáo ra mắt. "Hôm nay, chúng tôi tiếp tục nới rộng giới hạn những gì Suno có thể làm được với Speech: mô hình âm thanh đầu tiên có khả năng tạo giọng nói và âm nhạc cùng lúc thành một bản thu liền mạch."

Dù hệ thống được thiết kế để ghép nối giọng đọc với phần đệm âm nhạc — chẳng hạn như những giai điệu êm dịu làm nền cho bài thơ hay những bản nhạc sôi động đẩy cao kịch tính cho một bài phát biểu — người dùng vẫn có quyền lựa chọn không sử dụng nhạc nền. Những nhà sáng tạo nội dung chỉ cần bản thu giọng đọc mộc có thể dễ dàng tắt phần âm thanh đi kèm thông qua một nút gạt tích hợp sẵn.

Bước vào thị trường đầy tính cạnh tranh

Tổng hợp giọng nói thông qua học sâu (deep learning) vốn là một thị trường đã định hình và có nhiều tên tuổi lớn. Google DeepMind đã nghiên cứu lĩnh vực này trong khoảng một thập kỷ, Adobe cũng cung cấp các tính năng text-to-speech chuyên dụng, trong khi các nền tảng chuyên sâu như ElevenLabs đã nhanh chóng chiếm lĩnh thị trường kể từ khi ra mắt vào năm 2023.

Với việc bổ sung Speech, Suno đang từng bước mở rộng danh mục sản phẩm sang các lĩnh vực lồng tiếng, kể chuyện và thuyết minh. Động thái đa dạng hóa này diễn ra trong bối cảnh công ty vẫn đang phải đối mặt với nhiều áp lực pháp lý, khi công cụ tạo nhạc AI cốt lõi của họ liên tiếp vướng vào các vụ kiện bản quyền từ ngành công nghiệp thu âm.

◗ Nguồn

The Verge02-10

Tin liên quan