Startup đo kiểm AI Vals gọi vốn 40 triệu USD từ a16z nhằm chuẩn hóa thước đo mô hình
Startup Vals vừa huy động thành công 40 triệu USD trong vòng Series A do quỹ Andreessen Horowitz dẫn đầu, với tham vọng trở thành tiêu chuẩn vàng mới trong việc đánh giá và kiểm thử năng lực thực tế của các mô hình AI.
a16z dẫn đầu vòng Series A trị giá 40 triệu USD vào startup đo kiểm AI
Trong bối cảnh các bài kiểm tra năng lực AI truyền thống ngày càng bộc lộ điểm yếu và dễ bị các phòng lab can thiệp để làm truyền thông, startup Vals đã nổi lên như một giải pháp thay thế đầy tiềm năng. Công ty vừa chính thức công bố vòng gọi vốn Series A trị giá 40 triệu USD do quỹ đầu tư mạo hiểm danh tiếng Andreessen Horowitz (a16z) dẫn đầu.
Thành lập vào năm 2024 bởi Rayan Krishnan (25 tuổi), Vals nhanh chóng thu hút sự chú ý của giới công nghệ. Trước đó, công ty từng nhận vốn hạt giống từ 8VC và Bloomberg Beta. Sự tham gia của a16z trong vòng gọi vốn mới khẳng định nhu cầu cấp thiết của thị trường đối với một hệ thống đánh giá mô hình AI độc lập, minh bạch và chính xác hơn.
Giữ kín đề thi và tập trung vào tác vụ chuyên sâu thực tế
Nhà sáng lập Rayan Krishnan — cựu sinh viên Stanford từng thực tập tại Palantir, làm việc tại Microsoft và phòng nghiên cứu AI danh tiếng của trường — nhận định rằng các bài đo chuẩn học thuật (academic benchmarks) hiện tại không còn theo kịp tốc độ phát triển thần tốc của những mô hình tiên tiến. Nhiều hệ thống cũ chỉ đo kiến thức trừu tượng như bài thi luật sư (bar exam), đồng thời bộ đề thi lại công khai, tạo kẽ hở để các hãng công nghệ huấn luyện mô hình bám sát đề và "học vẹt" nhằm lấy điểm số PR đẹp mắt.
Để giải quyết tình trạng này, Vals áp dụng phương pháp tiếp cận hoàn toàn khác biệt:
- Bảo mật bộ đề thi: Vals không công khai dữ liệu kiểm thử, ngăn chặn triệt để việc các hãng đưa đề bài vào tập dữ liệu huấn luyện.
- Đo lường năng lực giải quyết tác vụ phức tạp: Thay vì hỏi đáp kiến thức tổng quát, startup này đánh giá khả năng tạo ra sản phẩm thực tế ngang tầm con người trong các lĩnh vực đặc thù như luật, tài chính và lập trình phần mềm.
- Mở rộng sang các lĩnh vực nhạy cảm và rủi ro cao: Vals đang phát triển thước đo cho khả năng tự cải tiến đệ quy (recursive self-improvement), an toàn sinh học, an ninh mạng, sức khỏe tâm thần, và thậm chí cả việc mô hình áp dụng Công ước Geneva trong luật xung đột vũ trang ra sao. Hệ thống không chỉ tìm kiếm kết quả tích cực mà còn dự báo những hệ lụy tiêu cực nếu mô hình vận hành ngoài thực tế.
Về mô hình kinh doanh, Krishnan ví Vals như tổ chức College Board trong kỳ thi SAT: các hãng AI phải trả phí để được kiểm định độc lập. Nhờ kết quả đánh giá thực chất giúp phát hiện lỗi và tối ưu mô hình, doanh thu của công ty hiện đã tăng gấp 8 lần so với năm ngoái. Quy mô nhân sự cũng tăng từ 8 lên 25 người và dự kiến tuyển thêm 10 đến 15 nhân sự mới khi chuyển sang văn phòng làm việc rộng hơn tại San Francisco.
Đòn bẩy xây dựng niềm tin khi các hãng AI chuẩn bị IPO
Bên cạnh mảng khách hàng doanh nghiệp, Vals gần đây đã triển khai thêm chương trình cung cấp dịch vụ đánh giá mô hình AI cho các cơ quan liên bang Mỹ. Đây là bước đi chiến lược trong bối cảnh các chính phủ ngày càng thắt chặt quy định giám sát an toàn trí tuệ nhân tạo.
Rayan Krishnan tin rằng hệ thống đo kiểm của Vals sẽ đóng vai trò trọng yếu trong làn sóng thương mại hóa tiếp theo của ngành công nghệ. Khi các "kỳ lân" AI lớn như Anthropic hay OpenAI tiến tới kế hoạch phát hành cổ phiếu ra công chúng (IPO) và AI trở thành một phần cốt lõi của nền kinh tế, các báo cáo đánh giá năng lực độc lập sẽ là căn cứ then chốt để doanh nghiệp giải trình trước cổ đông, cơ quan quản lý và thuyết phục công chúng về độ tin cậy của sản phẩm.