AI RACE— Cuộc đua AI
Model mới

Startup PrismML ra mắt Bonsai 2 27B: Nén mô hình AI xuống 5,9 GB, chạy mượt trên PC và điện thoại

PrismML vừa trình làng Bonsai 2 27B – phiên bản nén của mô hình Qwen3.8 27B xuống chỉ còn 5,9 GB mà vẫn giữ tới 98% hiệu năng ban đầu, mở ra cơ hội đưa AI suy luận mạnh mẽ lên trực tiếp thiết bị cá nhân.

05:34 18/09/2026
Model mới

Bonsai 2 27B: Đưa mô hình AI 27 tỷ tham số xuống gọn nhẹ chỉ 5,9 GB

Startup trí tuệ nhân tạo PrismML vừa chính thức phát hành Bonsai 2 27B, model mới nhất thuộc dòng mô hình nén chuyên sâu của hãng. Điểm nhấn lớn nhất của Bonsai 2 là khả năng nén mô hình mã nguồn mở phổ biến Qwen3.8 27B từ Alibaba xuống kích thước chỉ còn 5,9 GB – tương đương mức giảm dung lượng bộ nhớ từ 9 đến 10 lần so với nguyên bản.

Với dung lượng dưới 6 GB, mô hình này đủ nhỏ gọn để vận hành trơn tru cục bộ trên máy tính cá nhân và thậm chí là các dòng điện thoại thông minh cao cấp. Bước tiến này củng cố tầm nhìn của PrismML: các mô hình ngôn ngữ lớn (LLM) sở hữu năng lực suy luận cao cấp không nhất thiết phải có dung lượng đồ sộ hay phụ thuộc hoàn toàn vào các trung tâm dữ liệu đám mây.

Bí quyết từ kỹ thuật nén "ternary" và khả năng giữ trọn 98% hiệu năng

Khác với nhiều kỹ thuật nén mô hình thường đánh đổi đáng kể độ chính xác, PrismML khẳng định Bonsai 2 27B duy trì được 98% điểm số trên các bài kiểm tra hiệu năng (benchmark) tổng hợp so với bản gốc Qwen. Con số này cho thấy bước nhảy vọt so với thế hệ Bonsai đầu tiên ra mắt hồi tháng 3/2026 (đạt 95% hiệu năng nguyên bản). Bản Bonsai tiền nhiệm hiện đã ghi nhận hơn 11 triệu lượt tải về, trong khi các model kích thước siêu nhỏ khác của công ty cũng đạt thêm 2,6 triệu lượt tải.

Để làm được điều này, PrismML can thiệp trực tiếp vào các trọng số (weights) – những thông tin mô hình học và lưu trữ trong suốt quá trình đào tạo. Thay vì sử dụng chuẩn 16-bit thông thường cho mỗi trọng số, công nghệ của startup chuyển đổi chúng về dạng "ternary" (tam phân), giản lược giá trị chỉ còn ba trạng thái: +1, -1 hoặc 0. Nhờ giảm mạnh lượng dữ liệu cần lưu trữ cho từng trọng số, dung lượng mô hình thu hẹp đáng kể mà cấu trúc suy luận không bị xáo trộn lớn.

Giám đốc điều hành Babak Hassibi thừa nhận việc nén mô hình khó có thể đạt mức tương đương 100% tuyệt đối do luôn có sự hao hụt nhất định, song việc mất 2% trên lý thuyết không ảnh hưởng đáng kể đến trải nghiệm sử dụng thực tế. Hơn nữa, độ chính xác cuối cùng còn phụ thuộc lớn vào phần mềm và môi trường thực thi xung quanh mô hình.

Đội ngũ học thuật Caltech và làn sóng AI chạy trực tiếp trên thiết bị

PrismML được sáng lập bởi một nhóm các nhà nghiên cứu đến từ Viện Công nghệ California (Caltech), đứng đầu là Giáo sư Babak Hassibi – một chuyên gia kỳ cựu trong lĩnh vực công nghệ nén. Đội ngũ còn có sự tham gia của Ion Stoica trong vai trò cố vấn. Stoica là đồng sáng lập Databricks và là Giám đốc Sky Computing Lab trực thuộc Đại học UC Berkeley. Về mặt tài chính, công ty đã huy động được 22,25 triệu USD trong vòng hạt giống từ các quỹ đầu tư tên tuổi như Khosla Ventures, Cerberus Capital và Caltech. Nhiều tin đồn cho thấy startup cũng đang đàm phán với Apple, dù ông Hassibi từ chối bình luận về chi tiết này.

Thị trường nén LLM hiện không chỉ có PrismML; các đối thủ như Multiverse Computing (do một giáo sư từ Trung tâm Vật lý Quốc tế Donostia của Tây Ban Nha sáng lập) cũng đã huy động được nguồn vốn khổng lồ. Tuy nhiên, bước đi tiếp theo của PrismML là áp dụng phương pháp nén này lên các mô hình quy mô lớn hơn nữa trong vài tháng tới, nhắm tới phân khúc hàng trăm tỷ tham số. Theo CEO Hassibi, mô hình càng lớn thì "không gian" để nén mà không làm hao hụt trí thông minh lại càng rộng mở hơn.

Đánh giá về tiềm năng công nghệ, cố vấn Ion Stoica nhận định khả năng đưa AI lên thiết bị cá nhân sẽ thay đổi cách người dùng tiếp cận trí tuệ nhân tạo: mô hình sẽ phản hồi tức thì ngay trong tầm tay, không tốn thêm chi phí duy trì điện toán đám mây và tối ưu hoá hoàn toàn quyền riêng tư khi dữ liệu người dùng không bao giờ phải rời khỏi thiết bị.

◗ Nguồn

TechCrunch18-09

Tin liên quan