NVIDIA tung loạt công cụ AI thời gian thực cho truyền hình: Phát hiện deepfake 99,3%, lồng tiếng tự động và phân tích thể thao
Tại triển lãm IBC, NVIDIA công bố bước mở rộng lớn cho bộ giải pháp AI for Media, tích hợp các công cụ phát hiện video giả mạo, nội suy khung hình slow-motion, theo dõi chuyển động 3D và bản địa hóa chương trình trực tiếp.

Đưa trí tuệ nhân tạo thời gian thực vào quy trình sản xuất phát thanh - truyền hình
Tại Triển lãm Phát thanh Truyền hình Quốc tế (IBC) diễn ra ở Amsterdam với hơn 44.000 khách tham quan từ trên 170 quốc gia, NVIDIA đã công bố đợt mở rộng quy mô lớn cho hệ sinh thái NVIDIA AI for Media. Bộ giải pháp bao gồm các bộ công cụ phát triển phần mềm (SDK), dịch vụ vi mô NVIDIA NIM, hướng dẫn kỹ thuật (playbook) và bản thiết kế hệ thống tối ưu hóa trên GPU, hướng tới việc ứng dụng AI trực tiếp vào các quy trình truyền hình trực tiếp, giải đấu thể thao, sản xuất tin tức và nền tảng phát trực tuyến (streaming) mà không làm gián đoạn hạ tầng truyền thống.
Các công cụ mới tập trung giải quyết những bài toán hóc búa của ngành truyền thông hiện đại: xác minh độ chân thực của video trong kỷ nguyên nội dung nhân tạo bùng nổ, tái tạo chuyển động cơ thể theo thời gian thực, nội suy khung hình chất lượng cao và tự động hóa khâu lồng tiếng đa ngôn ngữ.
Loạt công cụ mới: Từ chống deepfake đến tái tạo chuyển động 3D và nội suy khung hình
Điểm nhấn kỹ thuật đầu tiên là công cụ nhận diện video nhân tạo Synthetic Video Detector (SVD) dưới dạng microservice NIM. Sau đợt ra mắt thử nghiệm tại SIGGRAPH, SVD hiện đạt độ chính xác lên tới 99,3% đối với video tạo từ văn bản (text-to-video) và 97,7% đối với video tạo từ hình ảnh (image-to-video). Hệ thống này lập tức được các đối tác lớn đưa vào thực tế:
- Dalet tích hợp SVD vào quy trình kiểm duyệt tin tức trên đám mây, cho phép biên tập viên xem điểm số tin cậy và siêu dữ liệu trực tiếp trên giao diện xử lý bài.
- TwelveLabs ứng dụng SVD vào công cụ Compliance by TwelveLabs để rà soát vi phạm chuẩn mực và gắn nhãn xác thực từng khung hình.
- Wowza đưa giải pháp này vào Wowza Video Intelligence Framework, phân phối tới hơn 35.000 hệ thống máy chủ phát video trên toàn cầu nhằm nhận diện vật thể và dấu hiệu AI can thiệp theo thời gian thực.
Về xử lý hình ảnh và chuyển động, công nghệ NVIDIA 3D Body Pose cho phép ước tính góc và vị trí khớp người 2D lẫn 3D chỉ từ luồng video của một camera duy nhất, loại bỏ nhu cầu sử dụng các bộ đồ cảm biến chuyên dụng (marker). Dữ liệu này phục vụ phân tích chuyển động vận động viên, hỗ trợ trọng tài và điều khiển hiệu ứng ánh sáng, bóng đổ 3D trong trường quay ảo thời gian thực của Vizrt.
Để phục vụ các pha quay chậm thể thao, công cụ Video Frame Generation (VFG) dùng AI tạo thêm khung hình trung gian, giúp tăng tốc độ khung hình lên 2 đến 4 lần. Hãng Ross Video đã tích hợp VFG vào nền tảng Rio Replay để tạo video quay chậm 6x và đang thử nghiệm mức 8x mà không cần đến các cụm camera siêu tốc đắt đỏ. Đi kèm với đó, Video Super Resolution (VSR) bổ sung hỗ trợ video 10-bit nâng độ phân giải trực tiếp, kết hợp cùng TrueHDR có khả năng chuyển đổi video SDR lên HDR thời gian thực với độ sáng tối đa xấp xỉ 2.000 nits.
Ở khâu biên dịch và phát hành quốc tế, hai microservice LipSync và Active Speaker Detection mang đến khả năng bản địa hóa nội dung tự động. LipSync điều chỉnh khẩu hình miệng của nhân vật khớp với âm thanh ngôn ngữ mới nhưng vẫn giữ nguyên chuyển động đầu, mắt và biểu cảm khuôn mặt. Trong khi đó, bộ phát hiện người nói chủ động mới không còn phụ thuộc vào kỹ thuật phân tách người nói (diarization) phức tạp, giúp các đơn vị như NDI tạo ra các luồng phát đa ngôn ngữ từ một nguồn tín hiệu duy nhất.
Chuẩn hóa hạ tầng mở và bước chuyển dịch sang mô hình AI chuyên biệt cho thể thao
Cùng với các mô hình đơn lẻ, NVIDIA giới thiệu bộ khung Sports Intelligence Playbooks, thúc đẩy xu hướng chuyển từ các mô hình tổng quát sang mô hình mở được tinh chỉnh (fine-tuned) bằng dữ liệu bản quyền thể thao. Sử dụng các công nghệ như Nemotron, NeMo AutoModel và Megatron Bridge, playbook cung cấp quy trình từ xử lý dữ liệu, huấn luyện đến suy luận. Trong các thử nghiệm nội bộ trên video thể thao chưa từng huấn luyện, độ chính xác của mô hình khi trả lời câu hỏi trắc nghiệm đã tăng từ 53% lên 94%, và khả năng đánh giá câu hỏi mở tăng từ 5,7% lên 66%. Đối tác Machina Sports và Wowza (với việc tích hợp các mô hình ngôn ngữ thị giác như Cosmos 3) đang tận dụng khung này để phát hiện các tình huống trận đấu trong thời gian thực.
Để kết nối toàn bộ hệ thống phần mềm, kiến trúc mở NVIDIA Holoscan for Media được tích hợp thêm tầng trao đổi truyền thông Media Exchange Layer (MXL). Lớp hạ tầng này cho phép các ứng dụng AI, bộ xử lý video và công cụ đồ họa từ nhiều nhà phát triển khác nhau (như AI-Media, CAMB.AI, Chyron, Panjaya) cùng vận hành trơn tru trên nền tảng tính toán tăng tốc dùng chung, từng bước thay thế các phần cứng chuyên dụng cồng kềnh bằng mô hình sản xuất truyền hình định nghĩa bằng phần mềm (software-defined broadcast).

