Lỗ hổng đánh giá: Tại sao doanh nghiệp vẫn triển khai AI agent dù không tin kiểm tra?
Khảo sát 157 doanh nghiệp năm 2026 phát hiện mâu thuẫn nguy hiểm: nửa số đã triển khai agent thất bại ở khách hàng, chỉ 5% hoàn toàn tin tưởng kiểm tra tự động, nhưng 66% đã hoặc đang xây dựng để cho phép triển khai hoàn toàn tự động mà không cần con người can thiệp.
Nửa số doanh nghiệp đã "trượt chân" với AI agent
Các tổ chức doanh nghiệp đang cấp cho agent AI ngày càng nhiều quyền tự chủ, nhưng lại không tin tưởng vào các bài kiểm tra dùng để kiểm soát quyền tự chủ đó. Khảo sát mới nhất từ VentureBeat trên 157 doanh nghiệp hé lộ một "lỗ hổng đánh giá" - khoảng cách nguy hiểm giữa độ tự chủ được cấp cho các agent AI và mức độ tin tưởng vào quy trình kiểm tra. Kết quả gây sốc: nửa số tổ chức đã triển khai một agent vượt qua đánh giá nội bộ nhưng sau đó thất bại ở khách hàng trên production. Chỉ 5% hoàn toàn tin tưởng vào đánh giá tự động hiện tại, trong khi 66% đã hoặc đang xây dựng để cho phép triển khai hoàn toàn tự động mà không cần con người can thiệp.
Con số cụ thể: Khi kiểm tra không khớp với thực tế
Khảo sát Agentic Reliability & Evals tracker được công bố vào tháng 6 năm 2026 bao gồm 157 tổ chức có từ 100 nhân viên trở lên, với phân bố theo kích thước: 37% từ 100-499 nhân viên, 27% từ 500-2.499, 20% từ 2.500-9.999, 10% từ 10.000-49.999, và 6% từ 50.000 nhân viên trở lên. Ngành công nghiệp phần mềm chiếm 23%, Bán lẻ/Tiêu dùng 15%, Y tế/Khoa học sức khỏe 12%, và Sản xuất 10%.
Con số gây sốc nhất: 50% các tổ chức đã triển khai một feature AI hoặc agent đã vượt qua đánh giá nội bộ nhưng sau đó gặp lỗi khi ở khách hàng (output không chính xác, quy trình bị gián đoạn, hoặc sự cố về chất lượng), và 25% gặp tình huống này nhiều lần. Chỉ 36% không gặp thất bại nào, 8% không chạy đánh giá trước khi triển khai, và 6% không theo dõi đủ kỹ để biết nguyên nhân.
Khi hỏi về lý do không tin tưởng đánh giá tự động, 95% các tổ chức đã chỉ ra ít nhất một hạn chế. Lý do chính (29%) là đánh giá không khớp với kết quả thực tế - chính xác là nguyên nhân của hiện tượng trên. Tiếp theo là thiên vị hoặc không nhất quán (21%), thiếu khả năng giải thích được (18%), và lo ngại về rò rỉ dữ liệu hoặc quyền riêng tư (17%). Công cụ được sử dụng phổ biến nhất là bài đánh giá tích hợp sẵn từ các nhà cung cấp mô hình (17%), nhưng 17% khác không sử dụng công cụ chuyên dụng nào cả. Chỉ khoảng 25% chạy kiểm tra chất lượng thời gian thực với dữ liệu production.
Cuộc đua tự chủ nhanh hơn sự tin tưởng
Trong bối cảnh cuộc cách mạng AI agent, việc tự động hóa quy trình triển khai là xu hướng tất yếu. Tuy nhiên, báo cáo cho thấy sự mất cân bằng nghiêm trọng: 66% tổ chức (bao gồm 34% đã cho phép và 33% đang xây dựng) sắp sửa hoặc đã cho phép triển khai zero-human-in-the-loop cho các agent "low-risk", chỉ 22% từ chối kế hoạch này trong tương lai gần. Điều này có nghĩa là quyền tự chủ đang được cấp nhanh hơn tốc độ xây dựng sự tin tưởng. Hệ thống công cụ đánh giá hiện tại hoàn toàn phân mảnh và chưa đủ trưởng thành - không có một tiêu chuẩn chung cho toàn ngành, khiến các doanh nghiệp phải tự xây dựng với các giải pháp lỏng lẻo.

