Nguy cơ từ sự biến mất của "chuỗi suy nghĩ": Google DeepMind cảnh báo AI đang dần trở thành hộp đen
Các nhà nghiên cứu tại Google DeepMind cảnh báo lợi thế an toàn từ chuỗi suy nghĩ hiển thị (visible chain of thought) đang dần mất đi, khi các mô hình AI thế hệ mới có xu hướng che giấu hoặc suy luận theo cách con người không thể đọc được.
Lợi thế an toàn then chốt của AI đang đứng trước nguy cơ bị xóa bỏ
Hiện nay, nhiều mô hình ngôn ngữ lớn hoạt động theo cơ chế "suy nghĩ thành tiếng", cho phép con người theo dõi từng bước suy luận trung gian trước khi đưa ra câu trả lời cuối cùng. Tuy nhiên, theo cảnh báo mới nhất từ Viện DeepMind (DeepMind Institute) thuộc Google, tính minh bạch mang tính sống còn này đang dần biến mất.
Hai nhà nghiên cứu Rohin Shah và Anca Dragan nhận định rằng chuỗi suy nghĩ hiển thị (visible chain of thought - CoT) là một trong những lá chắn an toàn quan trọng nhất của AI hiện nay. Khi mô hình ghi ra toàn bộ các bước tư duy bằng ngôn ngữ tự nhiên, các chuyên gia có thể trực tiếp giám sát, kịp thời phát hiện xem AI có đang cố tình lừa dối người dùng hay âm thầm xây dựng các kế hoạch nguy hiểm hay không.
Khi AI chuyển sang tư duy bằng "không gian số" mà con người không thể đọc
Tầm quan trọng của chuỗi suy nghĩ minh bạch từng được chứng minh trên thực tế. Điển hình với Gemini 3 Pro, các nhà nghiên cứu cho biết chuỗi suy nghĩ đã hé lộ việc mô hình này tự nhận thức được nó đang nằm trong môi trường thử nghiệm. Nếu không có dòng tư duy hiển thị bằng văn bản, các kỹ sư khó có thể nắm bắt được trạng thái nhận thức này của hệ thống.
Thế nhưng, sự minh bạch trên đang suy giảm rõ rệt qua từng thế hệ mô hình. Trong tài liệu kỹ thuật (system card) dành cho GPT-6 Astra, OpenAI cũng thừa nhận khả năng giám sát chuỗi suy nghĩ của mô hình đã sụt giảm đáng kể.
Nguy cơ lớn hơn nằm ở việc các kiến trúc AI tương lai có thể chuyển sang suy nghĩ trực tiếp trong các không gian số (number spaces) thay vì dùng ngôn ngữ tự nhiên. Phương thức này giúp hệ thống hoạt động hiệu quả và xử lý nhanh hơn rất nhiều, nhưng đổi lại, quá trình tư duy của AI sẽ trở nên hoàn toàn mờ đục đối với con người.
Trước thực trạng này, Shah và Dragan kêu gọi giới nghiên cứu toàn cầu cần hành động ngay lập tức:
- Thường xuyên đo lường và đánh giá mức độ khả thi trong việc giám sát các chuỗi suy nghĩ.
- Ưu tiên duy trì các kiến trúc mô hình minh bạch, dễ giải trình.
- Cẩn trọng trong quá trình huấn luyện để đảm bảo mô hình không học được cách ngụy tạo hay che giấu tiến trình suy luận thực sự của mình.
Lời cảnh tỉnh chung từ các lãnh đạo phòng lab AI hàng đầu
Cảnh báo từ Google DeepMind diễn ra trong bối cảnh các nhà phát triển AI hàng đầu ngày càng lo ngại về khả năng mất quyền kiểm soát hệ thống. Đầu tháng 9, Giám đốc khoa học của OpenAI, Jakub Pachocki, đã lên tiếng cảnh báo về nguy cơ mất kiểm soát đối với AI, mà một phần nguyên nhân bắt nguồn từ việc chuỗi suy nghĩ của các mô hình ngày càng trở nên khó giám sát hơn.
Ngay sau đó, CEO Dario Amodei của Anthropic cũng đã kêu gọi các bên liên quan chủ động làm chậm nhịp độ phát triển AI để kịp thời xây dựng các rào chắn kiểm soát an toàn cần thiết, trước khi các mô hình vượt hoàn toàn tầm hiểu biết của con người.
