AI RACE— Cuộc đua AI
Model mới

Nvidia công bố Nemotron 3 Diarization: mô hình 100 triệu tham số miễn phí, nhận dạng tới 8 người nói trong thời gian thực

Mô hình mới Nemotron 3 Diarization của Nvidia, với 100 triệu tham số và mã nguồn mở, cho phép phân biệt tối đa tám giọng nói đồng thời và đạt DER 14,7 % trên chuẩn VoiceArena.

18:01 27/09/2026
Model mới

Mở đầu

Vào ngày 27 tháng 9 năm 2026, Nvidia công bố phiên bản mới nhất trong dòng sản phẩm AI của mình – Nemotron 3 Diarization. Đây là mô hình có khoảng 100 triệu tham số, trọng số được phát hành hoàn toàn miễn phí, chuyên thực hiện nhận dạng người nói (speaker diarization) trong các cuộc hội thoại, kể cả khi có nhiều người nói cùng lúc.

Chi tiết cụ thể

  • Quy mô và truy cập: Nemotron 3 Diarization sở hữu khoảng 100 triệu tham số; trọng số của mô hình được cung cấp công khai trên Hugging Face, cho phép các nhà phát triển tải về và tích hợp ngay.
  • Khả năng nhận dạng: Mô hình có thể phân biệt tối đa tám người nói đồng thời và phát hiện trường hợp nhiều người nói chồng lên nhau. Khi số lượng người tham gia tăng, tiếng ồn nền mạnh hoặc có hiện tượng vang âm (reverb), tỷ lệ lỗi sẽ cao hơn.
  • Kết hợp với hệ thống nhận dạng lời nói: Khi ghép với công cụ chuyển giọng nói thành văn bản như Parakeet, Nemotron 3 có thể tạo ra bản ghi có nhãn người nói, tuy nhiên các nhãn chỉ mang tính ẩn danh (ví dụ “speaker_2”).
  • Áp dụng đa dạng: Mô hình hoạt động tốt trên cả file âm thanh đã ghi và luồng âm thanh thời gian thực.
  • Hiệu năng trên chuẩn Benchmark: Trong cuộc thi VoiceArena Diarization Benchmark v1, Nemotron 3 đạt tỷ lệ lỗi tổng hợp (DER) 14,7 %, vượt trội hơn phiên bản trước – Streaming Sortformer – tới 41 %. Trên Diarization‑Bench của VoiceArena, mô hình đứng đầu với DER 14,72 %, trong khi hệ thống kế tiếp đạt 19,3 %. Các tiêu chuẩn đánh giá rất nghiêm ngặt: cả phần nói chồng chéo và sai lệch dù chỉ vài mili giây ở thời điểm chuyển đổi người nói đều được tính là lỗi.
  • Cài đặt bộ đệm âm thanh: Người dùng có thể lựa chọn bốn mức độ bộ đệm, từ 30,4 giây xuống 0,32 giây. Thông thường, giảm độ dài bộ đệm sẽ làm giảm độ chính xác của mô hình.

Bối cảnh/so sánh

Nemotron 3 Diarization không chỉ là một bản cập nhật nhỏ mà còn là bước tiến đáng kể trong lĩnh vực phân tách người nói. So với đối thủ cùng lĩnh vực, mô hình này mang lại lợi thế lớn nhờ việc cung cấp miễn phí, dễ tiếp cận và đạt hiệu suất cao hơn 40 % so với phiên bản tiền nhiệm. Điều này đồng thời phản ánh xu hướng ngày càng mở rộng của các nhà cung cấp phần cứng và phần mềm AI – cho phép cộng đồng nghiên cứu và doanh nghiệp nhỏ tiếp cận công nghệ tiên tiến mà không phải chịu gánh nặng chi phí bản quyền. Với khả năng xử lý thời gian thực và hỗ trợ đa người nói, Nemotron 3 hứa hẹn sẽ trở thành công cụ quan trọng cho các ứng dụng như hội nghị truyền hình, hệ thống trợ lý ảo và phân tích nội dung âm thanh trong môi trường doanh nghiệp.

◗ Nguồn

The Decoder27-09

Tin liên quan