AI RACE— Cuộc đua AI
AI League

HappyHorse-1.0: Mô hình video của Alibaba-ATH soán ngôi đầu, giữ vững vị trí #1 suốt 4 tuần

HappyHorse-1.0 là mô hình chuyên biệt cho tạo video, hiếm có đạt hiệu suất cân bằng giữa hai mảng tạo video từ ảnh và tạo video từ văn bản, giúp nó vươn lên và giữ ngôi đầu bảng xếp hạng tạo video suốt 4 tuần liên tiếp.

00:32 19/07/2026
AI League

Trong lúc phần lớn các mô hình AI tạo sinh còn đang loay hoay chọn một mặt trận để dồn lực — hoặc ảnh, hoặc video, hoặc văn bản — thì HappyHorse-1.0 của Alibaba-ATH lặng lẽ làm điều ngược lại: dồn toàn lực vào video, nhưng đánh cả hai cửa ngõ dẫn vào nó. Kết quả là một cái tên mà bất kỳ ai theo dõi bảng xếp hạng tạo video gần đây cũng phải nhắc tới.

BẢNG XẾP HẠNG · CẬP NHẬT 27/07/2026

Tạo video

#Mô hìnhAIMcách #1Biến động
1
98.2
2
Alibaba-ATH
91.96.3
3
Alibaba-ATH
90.97.3
4
89.09.2
5
86.511.7
6
84.014.2
7
82.016.2
1
8
Video Rebirth
82.016.2
1

Ngôi đầu bảng xếp hạng tạo video

HappyHorse-1.0 đang giữ hạng #1 trên bảng xếp hạng tạo video — vị trí cao nhất mà một mô hình có thể chạm tới trong hạng mục này. Đáng chú ý hơn cả con số thứ hạng tại một thời điểm là độ bền: mô hình này đã giữ ngôi đầu suốt 4 tuần liên tiếp qua các kỳ cập nhật hàng tuần. Trong một lĩnh vực mà thứ hạng có thể đảo lộn chỉ sau một bản cập nhật đối thủ, bốn tuần liền không bị soán ngôi là tín hiệu cho thấy đây không phải một cú ăn may nhất thời, mà là một khoảng cách năng lực đủ lớn để các mô hình khác chưa kịp thu hẹp.

Sức mạnh cân bằng: khi Ảnh→Video và Văn bản→Video đi cùng một nhịp

Điều làm nên sự khác biệt của HappyHorse-1.0 không chỉ nằm ở việc nó đứng đầu, mà ở cách nó đứng đầu. Trên hạng mục tạo video từ ảnh (image-to-video), mô hình thể hiện độ ổn định rõ rệt — dấu hiệu của một hệ thống nắm vững kỹ thuật diffusion cho generative video, nơi việc giữ được tính nhất quán về chuyển động, ánh sáng và bố cục từ một khung hình tĩnh sang chuỗi khung hình động vốn là bài toán khó nhất.

Nhưng điều đáng nói hơn là ở hạng mục tạo video từ văn bản (text-to-video), HappyHorse-1.0 không hề đuối sức. Hiệu suất ở mảng này gần như tương đương với mảng image-to-video — một điều không hề hiển nhiên. Với đa số mô hình video hiện nay, hai bài toán này thường kéo theo sự đánh đổi: tối ưu cho ảnh đầu vào có xu hướng làm giảm khả năng "tưởng tượng" thuần túy từ câu chữ, và ngược lại. Việc HappyHorse-1.0 giữ được phong độ ngang nhau ở cả hai phía cho thấy kiến trúc của nó không được thiết kế riêng lẻ cho từng tác vụ, mà được tối ưu toàn diện cho toàn bộ bài toán video generation nói chung — một cách tiếp cận nền tảng hơn, thay vì chắp vá từng mảnh.

Đây chính là lý do khiến ngôi đầu bảng xếp hạng của HappyHorse-1.0 có trọng lượng: nó không thắng nhờ vượt trội ở một ngách hẹp rồi kéo điểm trung bình lên, mà thắng nhờ không có điểm yếu rõ rệt ở cả hai cửa ngõ chính của video generation.

Vị thế hiện tại và những gì còn phải chứng minh

Nhìn tổng thể, HappyHorse-1.0 định hình mình là một mô hình chuyên biệt cho video, với hai trụ cột Image→Video và Text→Video vận hành cân bằng thay vì lệch hẳn về một phía. Với các đội ngũ sản xuất nội dung cần một workflow video nhanh và ổn định — từ chuyển ảnh tĩnh thành đoạn clip có chuyển động hợp lý, đến sinh video trực tiếp từ mô tả văn bản — đây là một lựa chọn đáng đưa vào danh sách thử nghiệm ngay từ bây giờ.

Tuy vậy, ngôi đầu bảng xếp hạng chỉ phản ánh chất lượng đầu ra tương đối so với các đối thủ tại thời điểm đánh giá, chứ chưa nói lên toàn bộ câu chuyện vận hành. Trước khi đưa vào production, vẫn còn ba câu hỏi cần được trả lời bằng thực nghiệm: tốc độ inference có đáp ứng được nhịp độ sản xuất thực tế hay không, chất lượng đầu ra có nhất quán qua nhiều lần chạy và nhiều loại prompt khác nhau hay không, và mô hình xử lý ra sao với những yêu cầu đặc thù, phi tiêu chuẩn — những thứ mà benchmark công khai thường không đo hết. Bốn tuần giữ ngôi đầu là một khởi đầu ấn tượng; việc mô hình này có thể trụ vững như một lựa chọn hạ tầng dài hạn hay không sẽ còn phụ thuộc vào những phép thử tiếp theo.

Xem hồ sơ HappyHorse-1.0 →

Tin liên quan