AI RACE— Cuộc đua AI
Model mới

NVIDIA ra mắt Nemotron 3 Diarization: Model 100M tham số nhận diện người nói thời gian thực, dẫn đầu bảng xếp hạng VoiceArena

NVIDIA vừa phát hành Nemotron 3 Diarization, mô hình mã nguồn mở 100 triệu tham số có khả năng nhận diện chính xác "ai nói lúc nào" cho tối đa 8 người trong cuộc hội thoại thời gian thực, đạt tỷ lệ lỗi DER chỉ 14,72%.

20:17 23/09/2026
Model mới

Giải pháp mở mã nguồn cho bài toán nhận diện người nói phức tạp

Trong các hệ thống AI xử lý âm thanh, nhận dạng giọng nói (ASR) giúp chuyển đổi lời nói thành văn bản, nhưng để một biên bản cuộc họp, cuộc gọi khách hàng hay tệp podcast thực sự có giá trị, hệ thống cần giải quyết lớp thông tin thứ hai: ai là người đã phát biểu câu nói đó. Bài toán này được gọi là phân đoạn người nói (speaker diarization). Nếu không tách được danh tính từng người, văn bản đầu ra sẽ trộn lẫn các ý kiến, làm giảm đáng kể hiệu quả của các công cụ tóm tắt, trích xuất đầu việc hay bộ nhớ của trợ lý ảo.

NVIDIA vừa chính thức giới thiệu Nemotron 3 Diarization – mô hình mã nguồn mở trọng số (open-weight) quy mô 100 triệu tham số, được thiết kế chuyên biệt để phân loại mốc thời gian hoạt động của từng người nói, kể cả khi các giọng nói chen ngang hoặc đè lên nhau. Ngay khi ra mắt, mô hình đã chiếm vị trí dẫn đầu trên bảng xếp hạng Diarization-Bench của VoiceArena với tỷ lệ lỗi phân đoạn (Diarization Error Rate - DER) chỉ 14,72% trên tập đánh giá gồm 139 cuộc hội thoại tiếng Anh (tương đương khoảng 22 giờ âm thanh), vượt xa hệ thống đứng thứ hai (19,3% DER, tương đương mức giảm lỗi tương đối khoảng 24%).

Kiến trúc Transformer tối ưu hóa cho cả xử lý offline lẫn streaming

Nemotron 3 Diarization là bước nâng cấp lớn từ kiến trúc Streaming Sortformer trước đây của NVIDIA (vốn chỉ hỗ trợ tối đa 4 người). Phiên bản mới mở rộng phạm vi theo dõi lên tới 8 người nói đồng thời, áp dụng cơ chế sắp xếp kênh đầu ra theo thứ tự xuất hiện (arrival-time ordering) – người cất tiếng đầu tiên sẽ vào kênh 1, người tiếp theo vào kênh 2. Cơ chế này giúp nhãn người nói luôn ổn định xuyên suốt các đoạn âm thanh mà không cần tính toán lại tổ hợp hoán vị ở mỗi chu kỳ.

Mô hình tiếp nhận âm thanh đơn kênh (mono) tần số 16 kHz, chuyển đổi thành các đặc trưng Mel-spectrogram bước nhảy 10 ms, sau đó gom cụm 8 lần để tạo thành các khung 80 ms đưa vào bộ mã hóa Transformer 31 lớp có nhúng vị trí quay (RoPE). Phía trên Transformer, một lớp tích chập Conv1D sẽ nội suy kết quả về độ phân giải gốc để xuất ra tensor xác suất có kích thước [T, 8] (tương ứng với số bước thời gian và 8 kênh người nói). Khi hai người cùng nói một lúc, cả hai kênh tương ứng đều sẽ kích hoạt.

Để duy trì ngữ cảnh trong chế độ streaming (phát trực tiếp), mô hình kết hợp hai cơ chế bộ nhớ:

  • AOSC (Arrival-Order Speaker Cache): Lưu trữ thông tin về các giọng nói đã xuất hiện từ trước.
  • Hàng đợi FIFO: Giữ lại ngữ cảnh của các khung âm thanh gần nhất ngay trước đoạn đang xử lý, kết hợp cùng bộ đệm "ngữ cảnh phải" (right context).

Mô hình cho phép lập trình viên linh hoạt đánh đổi giữa độ trễ và độ chính xác thông qua 4 mức bộ đệm đầu vào khuyến nghị:

  • Offline: 30,4 giây (độ chính xác cao nhất).
  • Low latency: 1,04 giây.
  • Very low latency: 0,64 giây.
  • Ultra-low latency: 0,32 giây (cho các tác vụ cần phản hồi tức thì).

Về hiệu năng, khi chạy trên GPU NVIDIA RTX PRO 5000 với backend NeMo PyTorch (torch.compile, batch size 32), ở cấu hình đệm 30,4 giây, Nemotron 3 Diarization đạt tốc độ xử lý gấp 15.113 lần thời gian thực (RTFx) – tăng vọt so với mức 2.619x của Sortformer thế hệ trước, đồng thời hạ tỷ lệ DER trên tập DIHARD III từ 19,09% xuống 12,73%. Ở cấu hình độ trễ 1,04 giây, mô hình đạt tốc độ 865x RTFx và DER 13,18%.

Tập dữ liệu huấn luyện của mô hình kết hợp nguồn công khai và các đoạn hội thoại thực tế có bản quyền từ David AI, bao gồm dữ liệu đa ngôn ngữ trên 21 thứ tiếng. Việc bổ sung tập dữ liệu David AI đã giúp giảm DER tổng hợp thêm 0,77 điểm phần trăm (từ 11,19% xuống 10,42%).

Khả năng ứng dụng thực tế và hệ sinh thái triển khai

Nemotron 3 Diarization không gán trực tiếp danh tính ngoài đời thực của người nói mà cung cấp các nhãn trừu tượng kèm mốc thời gian (speaker_0, speaker_1...). Để tạo ra một bản ghi hoàn chỉnh gán đúng tên từng người, mô hình sẽ đóng vai trò là một mắt xích kết hợp với các mô hình nhận dạng giọng nói như Parakeet TDT 0.6B v3 hoặc Nemotron ASR 3.5. Ứng dụng downstream có thể đối chiếu mốc thời gian của từ vựng do ASR tạo ra với khoảng thời gian hoạt động của kênh người nói tương ứng.

Bên cạnh việc tích hợp trực tiếp qua bộ công cụ mã nguồn mở NVIDIA NeMo Speech theo giấy phép OpenMDW License v1.1, hệ sinh thái đối tác cũng đã nhanh chóng cập nhật mô hình:

  • Argmax: Đưa Nemotron 3 Diarization vào SDK Argmax Pro 3, hỗ trợ phân tách giọng nói trên thiết bị đầu cuối (on-device) theo thời gian thực trước khi đưa vào module ASR, giúp hạn chế lỗi nhận dạng khi hội thoại có nhiều đoạn nói đè.
  • Nền tảng đám mây: Các nền tảng như Baseten và DigitalOcean hiện đã sẵn sàng các mẫu triển khai để mở rộng mô hình trên quy mô lớn.

Mặc dù giải quyết rất tốt bài toán 8 người nói, NVIDIA cũng lưu ý rằng nếu âm thanh vượt quá 8 người, có độ vang lớn, thu âm từ xa hoặc nhiễu âm trường nghiêm trọng, tỷ lệ bỏ sót và nhầm lẫn người nói có thể gia tăng, đòi hỏi các nhà phát triển cần kiểm thử kỹ lưỡng trên môi trường âm thanh thực tế trước khi đưa vào các quy trình tự động hóa chuyên sâu.

Tin liên quan