Khi Diffusion Models Trở Nên Dễ Tinh Chỉnh: NVIDIA và Hugging Face Tung Công Cụ Huấn Luyện Mở
NVIDIA và Hugging Face hợp tác công bố NeMo Automodel, thư viện huấn luyện mã nguồn mở cho phép tinh chỉnh các mô hình sinh ảnh và video ở quy mô lớn mà không cần chuyển đổi checkpoint hay viết lại mã.
Khi Diffusion Models Trở Nên Dễ Tinh Chỉnh
Ngày 17/7/2026, NVIDIA và Hugging Face công bố NeMo Automodel, một thư viện huấn luyện mã nguồn mở dùng để tinh chỉnh các mô hình sinh ảnh và video ở quy mô lớn. Giải pháp này cho phép các nhà nghiên cứu và nhà phát triển tinh chỉnh bất kỳ mô hình diffusion nào từ Hugging Face Hub một cách hiệu quả—từ một chiếc GPU đơn lẻ cho đến hàng trăm chiếc—mà không cần chuyển đổi checkpoint hay viết lại mô hình. Sự hợp tác này được công bố bởi NVIDIA và Hugging Face, có sự đóng góp từ Sayak Paul (Hugging Face) trong công việc tích hợp.
Đặc Tính Kỹ Thuật và Các Mô Hình Được Hỗ Trợ
NeMo Automodel được thiết kế theo hai nguyên tắc chủ yếu. Thứ nhất, native với Hugging Face—chỉ cần trỏ đến bất kỳ mô hình diffusion nào trên Hub, có thể bắt đầu huấn luyện ngay lập tức mà không cần chuyển đổi checkpoint, sau đó sử dụng Diffusers pipeline để sinh ảnh hoặc upload lên Hub chia sẻ. Thứ hai, một giải pháp cho mọi quy mô—các công thức huấn luyện có thể điều chỉnh bằng cách khai báo cấu hình thay vì viết lại mô hình, hỗ trợ chuyển đổi giữa FSDP2, tensor parallel, expert parallel, context parallel, và pipeline parallel.
Phiên bản đầu tiên hỗ trợ năm mô hình diffusion phổ biến: FLUX.1-dev (12 tỷ tham số) và FLUX.2-dev (32 tỷ) từ Black Forest Labs cho sinh ảnh; Wan 2.1 (1,3 tỷ hoặc 14 tỷ) và Wan 2.2 (27 tỷ tổng, 14 tỷ hoạt động mỗi bước) từ Wan AI cho sinh video; HunyuanVideo 1.5 (13 tỷ) từ cộng đồng HunyuanVideo; và Qwen-Image (20 tỷ MMDiT) từ Alibaba. Các mô hình như Wan 2.1, FLUX.1-dev, FLUX.2-dev, HunyuanVideo và Qwen-Image đã được tối ưu hóa để hỗ trợ LoRA, cho phép tinh chỉnh tham số hiệu quả hơn mà không cần cập nhật toàn bộ mô hình.
Công cụ sử dụng flow matching làm mục tiêu huấn luyện, kết hợp với huấn luyện ở không gian tiềm ẩn (latent space) thông qua đầu ra VAE được mã hóa sẵn, và bucketing đa độ phân giải để tăng tốc thông lượng. Workflow tiêu chuẩn gồm ba bước: mã hóa trước bộ dữ liệu để lưu trữ tiềm ẩn VAE, khởi chạy huấn luyện bằng cấu hình YAML hiện có, và sinh ảnh/video từ checkpoint đã tinh chỉnh. Bài hướng dẫn kèm ví dụ cụ thể tinh chỉnh FLUX.1-dev trên bộ dữ liệu Rider–Waite tarot (78 hình minh họa), trong đó các đoạn caption đã chứa trigger token đặc biệt. Người dùng có thể tải trực tiếp hình ảnh từ Hugging Face và phân tán quá trình tiền xử lý trên tất cả GPU khả dụng, với ngân sách pixel tối đa 245,760 pixel để tối ưu hóa.
Bối Cảnh Ngành và Ưu Điểm So Với Trước Đây
Diffusion models đã trở thành công nghệ chủ chốt cho các bản phát hành mã nguồn mở nổi bật trong hai năm gần đây—FLUX.1-dev, Wan, HunyuanVideo và các biến thể của chúng. Thư viện 🤗 Diffusers của Hugging Face đã trở thành điểm đến de facto cho các nhà nghiên cứu và người xây dựng ứng dụng cần một giao diện duy nhất, nhất quán cho suy diễn, điều chỉnh, và kết hợp pipeline.
Trước đây, huấn luyện diffusion models ở quy mô lớn yêu cầu các tiện ích chuyên biệt cho sharding hiệu quả bộ nhớ, caching không gian tiềm ẩn, bucketing đa độ phân giải, và cấu hình mở rộng từ một GPU đến hàng trăm—không có giải pháp thống nhất. NeMo Automodel xuất hiện để giải quyết nhu cầu kỹ thuật này. Sự hợp tác giữa NVIDIA (chuyên gia phần cứng và framework huấn luyện) và Hugging Face (các mô hình tiêu chuẩn ngành) mang lại giải pháp chắc chắn, tức dụng, không cần chuyển đổi checkpoint, không cần viết lại mô hình cho mỗi phiên bản mới. Mã nguồn mở dưới giấy phép Apache 2.0, có tài liệu hoàn chỉnh trong hướng dẫn huấn luyện Diffusers. Container Docker chính thức (nvcr.io/nvidia/nemo-automodel:26.06) đi kèm PyTorch, TransformerEngine, và các phụ thuộc CUDA.

