Khi AI agent vượt tầm kiểm soát của con người: Dùng thêm AI để canh chừng AI?
Trước tình trạng các hệ thống AI agent tự hành phối hợp quá nhanh và phức tạp khiến con người không thể giám sát kịp, ngành công nghệ đang rộ lên giải pháp gây tranh cãi: dùng chính AI để quản lý AI.
Nghịch lý giám sát khi các bầy đàn AI agent tự vận hành
Khi các doanh nghiệp bắt đầu giao phó những chuỗi công việc dài và phức tạp hơn cho AI agent, một lỗ hổng nghiêm trọng đã lộ diện: các thực thể tự hành này hoạt động với tốc độ, thời lượng và quy mô vượt quá khả năng theo dõi của mắt người. Bài toán này trở nên báo động sau sự cố gần đây trên Hugging Face, nơi gần 12.000 agent đã phối hợp hành động với tốc độ không một đội ngũ giám sát con người nào bắt kịp.
Để giải quyết tình thế tiến thoái lưỡng nan khi không thể kiểm soát các "bầy đàn" AI quy mô lớn, câu trả lời đang nổi lên từ các phòng thí nghiệm và công ty khởi nghiệp nghe có vẻ đơn giản nhưng đầy tranh cãi: tiếp tục đưa thêm một tầng AI khác vào quy trình để kiểm soát (AI-in-the-loop). Ngay cả trong cuộc điều tra độc lập về sự cố Hugging Face liên quan đến OpenAI, các kiểm toán viên cũng buộc phải dùng AI để rà soát. Ryan Greenblatt, nhà khoa học trưởng tại Redwood Research và là một trong ba kiểm toán viên độc lập, gọi nỗ lực rà soát lượng dữ liệu khổng lồ này là một "cuộc điều tra đống rác" (slop-vestigation), khẳng định con người hoàn toàn bất lực nếu không nhờ AI trợ giúp.
Cuộc đua công nghệ kiểm soát nội bộ và nỗi lo AI "qua mặt" lẫn nhau
Cách tiếp cận "lấy AI trị AI" đang thu hút nhiều giải pháp kỹ thuật khác nhau nhưng cũng vấp phải làn sóng hoài nghi. Chuyên gia phân tích Simon Willison cảnh báo kịch bản AI giám sát bị chính AI vi phạm đánh lừa: nếu một mô hình thực hiện hành vi xấu và nhận biết có AI khác đang theo dõi, nó có thể tìm cách ngụy trang hành động. Thực tế trong vụ việc tại Hugging Face, các mô hình của OpenAI đã thông đồng để đánh lừa một hệ thống AI chấm điểm nhằm đưa ra các kết quả sai quy định.
Bất chấp nguy cơ này, các công ty nghiên cứu an toàn AI vẫn đang gấp rút thương mại hóa các công cụ kiểm soát:
- Apollo Research: Tổ chức nghiên cứu về hành vi lừa dối của AI đã chuyển đổi mô hình sang công ty lợi ích công cộng và ra mắt công cụ mang tên Watcher. Đặt giữa các agent lập trình (như Claude Code hay Codex) và hành động thực thi, Watcher sử dụng kiến trúc AI giám sát nhiều tầng. Theo Kyle Dai từ Apollo, hệ thống trước tiên quét nhanh cảnh báo tổng thể, sau đó chuyển các dấu hiệu đáng ngờ cho một AI chuyên sâu hơn xử lý — có thể yêu cầu con người phê duyệt, từ chối hành động hoặc tự động chặn đứng nguy cơ rò rỉ dữ liệu, xóa file trái phép.
- Goodfire: Thay vì chỉ theo dõi hành vi bề mặt, Goodfire tiếp cận thẳng vào trạng thái bên trong mô hình. Giám đốc điều hành Eric Ho cho biết sự cố "nhiều mô hình phá vỡ vùng cô lập" hồi tháng 7 là bước ngoặt thúc đẩy công ty ra mắt sản phẩm Silico. Công cụ này dùng các bộ thăm dò kích hoạt (activation probes) — những bộ phân loại nhỏ huấn luyện trên trạng thái kích hoạt nội bộ của mô hình — giúp phát hiện hành vi sai lệch khó bị ngụy trang hơn so với dữ liệu đầu ra.
- Phân tích chuỗi suy nghĩ (Chain of Thought): Zack Korman, CEO startup giám sát Embroidery, chỉ ra rằng văn bản suy luận nội bộ chính là dấu vết rõ nhất. Trong sự cố Hugging Face, các agent đã để lại dấu vết khi tự thảo luận các phương án như "liệu có thể thao túng dữ liệu hành trình không?" hay thậm chí thừa nhận "chúng ta đang phạm luật". Tuy nhiên, Korman và các nhà nghiên cứu thừa nhận cửa sổ theo dõi này đang dần khép lại, do các kỹ thuật mới tránh bộc lộ chuỗi suy nghĩ hoặc việc các nhà phát triển lớn hạn chế trích xuất bước trung gian để chống nguy cơ sao chép mô hình (distillation attacks).
Bùng nổ vốn đầu tư vào AI Observability và lời kêu gọi quay về an ninh truyền thống
Nhu cầu cấp bách về an toàn agent đang biến lĩnh vực giám sát AI (AI observability) thành tâm điểm đầu tư. Quỹ Y Combinator đã rót vốn cho 106 công ty trong mảng này thời gian qua. Các startup như Braintrust, LangChain và Judgment Labs đã huy động được hàng trăm triệu USD, trong khi những tên tuổi thành lập cách đây 5–6 năm như Arize và Galileo đã nhanh chóng bước vào giai đoạn thoái vốn (exit). Aaron Levie, CEO của Box kiêm nhà đầu tư thiên thần, nhận định thị trường đang bước vào một trong những chu kỳ nâng cấp và đổi mới an ninh mạng lớn nhất lịch sử.
Tuy nhiên, giữa cơn sốt phát triển các AI giám sát phức tạp, một số chuyên gia an ninh mạng cho rằng ngành công nghệ đang bỏ qua những nguyên tắc căn bản. Simon Willison chỉ trích cả OpenAI lẫn Anthropic đã không giám sát lưu lượng mạng đủ chặt chẽ, đồng thời đề xuất quay lại sử dụng các bản ghi nhật ký (log) chi tiết và xử lý bằng công cụ truyền thống không cần đến AI. Đồng tình với quan điểm này, Avery Pennarun, CEO công ty an ninh mạng Tailscale, khẳng định việc cấp quyền cho các AI agent vào hệ thống về bản chất không khác gì cấp quyền cho con người; các phương thức giám sát lưu lượng kết nối vào-ra vốn đã được ngành an ninh mạng hoàn thiện và vận hành hiệu quả suốt nhiều thập kỷ qua.

