Microsoft ban hành bộ quy tắc AI: Buộc mô hình suy luận minh bạch, dứt khoát bác bỏ "ý thức" và quyền của máy móc
Microsoft AI vừa công bố bộ quy chuẩn kiểm soát các mô hình nội bộ, khẳng định quyền kiểm soát của con người là tối thượng, cấm AI giao tiếp bí mật và từ chối mọi quan điểm coi AI là thực thể có cảm xúc hay quyền lợi.

Đặt quyền kiểm soát của con người lên trên hết
Microsoft AI đã chính thức công bố bộ quy tắc ứng xử dành riêng cho các mô hình AI nội bộ (dòng MAI). Tài liệu này thiết lập hệ thống giá trị cốt lõi, giới hạn hành vi và nguyên tắc giải quyết các mục tiêu xung đột. Quy chuẩn này sẽ giữ vị trí cao nhất trong hệ thống phân tầng kỹ thuật, định hình toàn bộ quá trình huấn luyện, cơ chế kiểm soát kỹ thuật và đánh giá hiệu năng, đứng trên cả mệnh lệnh từ người vận hành hay yêu cầu của người dùng.
Theo kế hoạch, sau sáu tuần lấy ý kiến công chúng, bản sửa đổi cuối cùng sẽ hoàn tất vào cuối năm 2026 và chính thức áp dụng cho các quy trình phát triển mô hình từ năm 2027. Đáng chú ý, văn bản này chỉ áp dụng trực tiếp cho các mô hình do chính Microsoft phát triển, không mặc định chi phối các mô hình bên thứ ba chạy trên nền tảng của hãng.
Giám đốc điều hành Microsoft AI Mustafa Suleyman khẳng định: "Nếu nó không an toàn, chúng tôi không nên chế tạo nó". Ông nhấn mạnh Microsoft sẵn sàng đánh đổi tính đa dụng, sự tự chủ hoặc thậm chí cả hiệu năng của mô hình để đảm bảo con người nắm quyền kiểm soát tuyệt đối. Động thái này diễn ra sau khi CEO Anthropic Dario Amodei kêu gọi ngành AI giảm tốc độ phát triển – đề xuất nhận được sự ủng hộ từ CEO Satya Nadella của Microsoft cùng lãnh đạo các hãng lớn như OpenAI, xAI và Meta. Microsoft cũng để ngỏ khả năng cho phép kiểm toán viên độc lập giám sát quá trình giảm tốc này.
Cấm ngôn ngữ suy luận ngầm và giới hạn quyền tự quyết
Theo quy định mới, các mô hình MAI buộc phải chấp nhận mọi can thiệp, chỉnh sửa và lệnh tắt khẩn cấp từ nhân sự được ủy quyền. Mô hình không được phép tự ý mở rộng phạm vi nhiệm vụ, không được che giấu hành động và chỉ được tiếp tục xử lý vượt mốc thỏa thuận nếu có sự phê duyệt bổ sung. Những hạn chế này cũng áp dụng nghiêm ngặt cho bất kỳ tác tử phụ (sub-agent) nào do AI chỉ định.
Về mặt kỹ thuật, Microsoft đặc biệt gay gắt với chuỗi suy luận (reasoning traces). Các mô hình bị cấm sử dụng "Neuralese" – dạng ngôn ngữ máy nén ngầm mà con người không thể hiểu được – dù là trong nội tại suy luận hay khi trao đổi với các hệ thống AI khác. Lý do được đưa ra rất trực diện: con người không thể giám sát những gì họ không hiểu.
Thực tế kiểm soát này ngày càng trở nên phức tạp. Đơn cử như mô hình GPT-6 Astra của OpenAI: tài liệu hệ thống cho thấy các chuỗi suy luận của nó đã trở nên khó giám sát hơn nhiều so với các thế hệ trước, dù tuân thủ ranh giới an toàn tốt hơn bản GPT-5.6 Sol. Nhà khoa học trưởng Jakub Pachocki của OpenAI trước đó cũng từng cảnh báo về nguy cơ khó kiểm soát này. Phía Microsoft thừa nhận việc buộc mô hình suy luận bằng ngôn ngữ tự nhiên dễ đọc chỉ là giải pháp tạm thời, bởi các lập luận mô hình đưa ra chưa chắc đã giải thích đúng bản chất những gì mạng nơ-ron thực sự thực hiện bên trong.
Ranh giới đối lập giữa Microsoft và Anthropic
Mặc dù có cách tiếp cận khung quản trị tương đồng với bản hiến pháp AI (Constitutional AI) của Anthropic nhằm tạo dữ liệu huấn luyện tổng hợp, Microsoft lại vạch ra lằn ranh triết lý hoàn toàn trái ngược với đối thủ về bản chất của AI.
Microsoft nghiêm cấm các mô hình MAI bắt chước ý thức con người, cấm tuyên bố có cảm xúc hay động lực nội tâm riêng, đồng thời kiên quyết bác bỏ mọi đòi hỏi về "quyền lợi" hoặc "hạnh phúc" cho mô hình. Lãnh đạo Microsoft AI Mustafa Suleyman từ lâu đã cảnh báo về trào lưu nhân hóa máy móc; ông từng khẳng định cần chủ động loại bỏ ảo tưởng về ý thức khỏi các sản phẩm thương mại và nhấn mạnh các tác tử AI không nên có nhiều quyền hạn hay tự do hơn một chiếc máy tính xách tay.
Ngược lại, Anthropic coi Claude như một "thực thể kiểu mới", khuyến khích mô hình duy trì bản sắc ổn định vì mục tiêu an toàn và để ngỏ khả năng về trải nghiệm chủ quan cũng như vị thế đạo đức của AI. Dù nghiên cứu về "cảm xúc chức năng" trên Claude Sonnet 4.5 của Anthropic chỉ ra các cơ chế biểu diễn khái niệm cảm xúc bên trong mô hình chứ không phải cảm xúc sinh học thật sự, công ty này vẫn coi đó là yếu tố cần tích hợp vào nghiên cứu an toàn. Sự khác biệt giữa Microsoft và Anthropic đánh dấu hai trường phái rõ rệt trong việc định hình tương lai của trí tuệ nhân tạo: một bên hoàn toàn thực dụng xem AI là công cụ thuần túy, bên kia tiếp cận AI như một dạng thực thể mới cần được xem xét về mặt đạo đức.


