Đột phá tối ưu AI: Chạy mô hình 125 tỷ tham số mượt mà trên card đồ họa cá nhân RTX 4090
Chuyện gì
Dự án mã nguồn mở Strata thu hút sự chú ý lớn từ cộng đồng kỹ thuật khi cho phép chạy mô hình ngôn ngữ lớn Qwen 3.8 Flash Next (125B) trực tiếp trên phần cứng tiêu dùng phổ biến như RTX 4090 với tốc độ ấn tượng lên tới 100 token/giây. Giải pháp này giúp người dùng cá nhân và các nhà nghiên cứu độc lập có thể tự vận hành mô hình siêu lớn cục bộ mà không cần phụ thuộc vào hạ tầng đám mây đắt đỏ.
Mọi người phản ứng
Cộng đồng lập trình viên vô cùng hào hứng, đánh giá đây là bước nhảy vọt quan trọng trong nỗ lực dân chủ hóa việc ứng dụng AI mã nguồn mở trên máy tính cá nhân.
Nguồn ↗