AI RACE— Cuộc đua AI
Nghiên cứu

Base Labs bắt tay Hugging Face và Goodfire xây dựng chuẩn an toàn cho AI mã nguồn mở

Base Labs, Hugging Face và Goodfire AI hợp tác thiết lập hạ tầng đánh giá và giám sát an toàn cho các mô hình AI open-weight, nhằm ngăn chặn tình trạng gỡ bỏ rào chắn bảo vệ đang lan rộng.

00:15 18/09/2026
Nghiên cứu

Liên minh thiết lập chuẩn an toàn mới cho AI open-weight

Base Labs – nhánh nghiên cứu trực thuộc nền tảng hạ tầng suy luận AI Baseten – vừa công bố sáng kiến hợp tác cùng Hugging Face và Goodfire AI. Mục tiêu của liên minh này là xây dựng hạ tầng giám sát và đánh giá an toàn tiêu chuẩn dành riêng cho các mô hình AI có trọng số mở (open-weight).

Động thái trên diễn ra trong bối cảnh cộng đồng công nghệ đang tranh luận gay gắt về mức độ rủi ro của các mô hình open-weight. Khác với các hệ thống nguồn đóng, mô hình mở có thể bị can thiệp trực tiếp vào trọng số để gỡ bỏ toàn bộ rào chắn an toàn (safety guardrails) thông qua một kỹ thuật đang nổi lên mang tên "abliteration".

Tích hợp an toàn từ cốt lõi thay vì chắp vá

Thực trạng các mô hình bị vô hiệu hóa rào chắn an toàn đang ở mức đáng báo động. Nền tảng chia sẻ mô hình Hugging Face hiện ghi nhận hơn 6.000 mô hình AI đã bị can thiệp bằng kỹ thuật abliteration.

Để giải quyết tận gốc vấn đề, Base Labs sẽ nghiên cứu và công bố các phương pháp huấn luyện cũng như cơ chế giám sát dành riêng cho mô hình mở. Nhóm phát triển định vị sáng kiến này như một "tiêu chuẩn minh bạch", được tích hợp trực tiếp vào quy trình huấn luyện và triển khai mô hình ngay từ đầu, thay vì chỉ là những lớp bảo vệ tạm bợ được gắn thêm vào sau khi hoàn tất huấn luyện.

Chia sẻ trên mạng xã hội X, đại diện Baseten nhấn mạnh: "Chúng tôi tin rằng tính mở là một lợi thế cho an toàn AI. Sự cởi mở mang lại khả năng quan sát hành vi mô hình rõ ràng hơn và quan trọng nhất là tạo ra nhiều công cụ biến nghiên cứu an toàn thành các cơ chế kiểm soát minh bạch, khả thi hơn so với mô hình đóng."

Dù các thông số kỹ thuật chi tiết chưa được tiết lộ, đại diện Goodfire AI cho biết mục tiêu cốt lõi là: "An toàn phải được xây dựng ngay bên trong các mô hình mở và được đảm bảo bởi những đơn vị cung cấp dịch vụ vận hành chúng." Goodfire – công ty chuyên về giải pháp mở "hộp đen" AI nhằm giải thích cách mô hình ra quyết định – được xem là mắt xích chủ lực phụ trách việc đưa các cơ chế kiểm soát trực tiếp vào cấu trúc mô hình.

Nguồn lực vững chắc phía sau liên minh

Sáng kiến chuẩn hóa an toàn này nhận được sự hậu thuẫn tài chính rất lớn từ các bên tham gia. Baseten, đơn vị hạ tầng chuyên cung cấp giải pháp suy luận AI (inference), vừa khép lại vòng gọi vốn Series F trị giá 1,5 tỷ USD vào tháng 6, nâng mức định giá của công ty lên 13 tỷ USD. Trong khi đó, đối tác Goodfire AI cũng gọi vốn thành công 150 triệu USD ở vòng Series B do quỹ B Capital dẫn đầu hồi đầu năm để hoàn thiện nền tảng diễn giải mô hình (interpretability).

Hiện tại, Baseten và các đối tác đang mở lời kêu gọi toàn bộ hệ sinh thái lập trình viên cùng tham gia đóng góp cho khung tiêu chuẩn này, hướng tới mục tiêu xây dựng một môi trường AI mã nguồn mở an toàn nhưng vẫn dễ tiếp cận cho cộng đồng.

◗ Nguồn

TechCrunch18-09

Tin liên quan