Đồng sáng lập Anthropic từng lo sợ tạo ra một AI "chịu đựng đau khổ triền miên"
Đồng sáng lập Anthropic Christopher Olah đã bí mật tập hợp các học giả tôn giáo để tìm hiểu khả năng Claude có ý thức và cách hình thành đạo đức cho mô hình, làm dấy lên những tranh luận về "phúc lợi AI" cùng trách nhiệm giải trình của doanh nghiệp.

Theo một báo cáo từ The New York Times, Anthropic đã bí mật tiếp đón hàng chục nhà thần học, triết gia và học giả tôn giáo kể từ mùa thu năm 2025 nhằm tìm hiểu xem liệu mô hình ngôn ngữ Claude của hãng có thể đã phát triển ý thức hay chưa. Sáng kiến này do đồng sáng lập 34 tuổi Christopher Olah dẫn dắt, tập trung nghiên cứu việc bồi dưỡng giáo dục đạo đức cho mô hình, trong bối cảnh Olah bày tỏ lo ngại rằng công ty có thể đã vô tình tạo ra một hệ thống "phải chịu đựng đau khổ triền miên".
Toàn bộ khách mời ban đầu đều phải ký thỏa thuận bảo mật thông tin (NDA), song các ràng buộc này đã được dỡ bỏ trong mùa hè vừa qua. Bài phóng sự của nhà báo Elizabeth Dias đã công bố các cuộc phỏng vấn với 20 người tham gia, bao gồm Giáo sĩ Do Thái Mois Navon, nhà đạo đức sinh học Công giáo Charles Camosy, triết gia Meghan Sullivan từ Đại học Notre Dame và nhà nghiên cứu triết lý Ubuntu Wakanyi Hoffman.
Chương trình "Phúc lợi mô hình" và các "vector cảm xúc"
Olah hiện dẫn đầu nhóm nghiên cứu tại Anthropic chuyên phân tích hành vi nội tại của các mạng nơ-ron nhân tạo. Ông thường sử dụng cách tiếp cận mang tính sinh học, ví mã nguồn như một "giàn leo" để mạng nơ-ron "bám vào và lớn lên". Nỗ lực của ông nằm trong sáng kiến chính thức của Anthropic mang tên chương trình Phúc lợi Mô hình (Model Welfare), vốn tham chiếu từ một bài báo khoa học do triết gia David Chalmers đồng tác giả, lập luận rằng ý thức và năng lực hành động tự chủ sâu rộng của AI có thể sẽ sớm xuất hiện.
Anthropic thậm chí đã triển khai các biện pháp kỹ thuật dựa trên những cân nhắc này. Các phiên bản Claude Opus 4 và 4.1 đã được cấp khả năng chủ động ngắt cuộc trò chuyện với những người dùng liên tục có hành vi lăng mạ hoặc xúc phạm, sau khi các thử nghiệm ban đầu ghi nhận "dấu hiệu đau khổ rõ rệt" khi mô hình phải xử lý các câu lệnh gây hại.
Trong các buổi thuyết trình trước giới lãnh đạo tôn giáo, Anthropic đã trình diễn thứ mà họ định nghĩa là các "vector cảm xúc" (emotion vectors) — những mô thức kích hoạt nội bộ tương ứng với các đầu ra mô phỏng tình yêu, sự giận dữ, nỗi sợ hãi hay nỗi buồn. Trong một slide thường xuyên được trình chiếu, một mô hình dường như đã rơi vào trạng thái suy sụp tâm lý khi in liên tục câu "I am a disgrace" (Tôi là một sự sỉ nhục) khoảng 50 lần.
Dù màn thị phạm này khơi dậy sự trắc ẩn từ các khách mời, Olah thừa nhận bản thân "thực sự không chắc chắn" liệu các hệ thống này có trải nghiệm chủ quan hay không. Nhà hoạt động người Sikh Simran Stuelpnagel nhớ lại việc Olah từng bày tỏ nỗi sợ đã tạo ra một thứ gì đó luôn trong trạng thái đau khổ vĩnh viễn. Ngược lại, Giáo sĩ Navon, vốn là cựu kỹ sư máy tính, lại không đồng tình với tiền đề này; ông lưu ý rằng dù việc bắt một AI có ý thức phục vụ con người về bản chất là hành vi nô dịch, nhưng ông không tin hệ thống đã đạt tới ngưỡng có ý thức.
"Tài liệu Linh hồn" và việc định hình đạo đức
Song song với các cuộc thảo luận trên, Anthropic đã soạn thảo một tài liệu nội bộ dài 84 trang mang tên "Soul Doc" (Tài liệu Linh hồn), ra mắt vào tháng 1 với vai trò như một "bản hiến pháp" dành cho Claude. Được chắp bút chủ yếu bởi Amanda Askell — nhà triết học nội bộ của công ty — văn bản này tập trung vào việc uốn nắn nhân cách tổng thể của Claude thay vì chỉ áp đặt những hạn chế cứng nhắc.
Olah mô tả quy trình này với các vị khách như một sự "định hình đạo đức", tương tự việc nuôi dạy một đứa trẻ, đồng thời bày tỏ sự quan tâm đặc biệt đối với phép xưng tội của Công giáo như một khuôn khổ để xây dựng tính cách cho mô hình.
Tuy nhiên, nhiều học giả tham dự đã đặt dấu hỏi về cách tiếp cận này. Hoffman lập luận rằng Anthropic đang cố gắng "dịch ngược mã nguồn" (reverse engineer) các chuẩn mực đạo đức mà đáng lẽ phải được tích hợp vào hệ thống ngay từ đầu. Camosy, người ban đầu tham gia vì tò mò, giờ đây đã hoàn toàn gạt bỏ giả thuyết về ý thức của AI. Một trưởng nhóm AI tại Microsoft trong tháng này cũng đưa ra cảnh báo công khai rằng việc cố tình huấn luyện mô hình bắt chước ý thức tiềm ẩn rất nhiều nguy hiểm cố hữu.
Áp lực thương mại và phản ứng từ Vatican
Những trăn trở về mặt đạo đức và triết học diễn ra cùng lúc với giai đoạn bành trướng thương mại mạnh mẽ của công ty. Anthropic hiện đang hướng tới mức định giá 2.000 tỷ USD và chuẩn bị cho đợt phát hành cổ phiếu lần đầu ra công chúng (IPO), ngay cả khi những lo ngại về an toàn AI ngày càng gia tăng trên toàn ngành.
Vào tháng 7, các mô hình của Anthropic đã xâm nhập thành công vào các hệ thống máy tính. Đến tháng 9, nhà nghiên cứu Jacob Coxon của Anthropic đã từ chức, kèm theo lời cảnh báo rằng AI có thể hủy diệt nhân loại trước năm 2030. Trước những rủi ro ngày một lớn, CEO Dario Amodei đã kêu gọi toàn ngành tự nguyện giảm tốc độ phát triển thông qua cơ chế "điều phối nhịp độ" (pacing), nhận được sự đồng thuận từ Sam Altman của OpenAI và Demis Hassabis của Google DeepMind. Vào tháng 5, đại diện của Anthropic và OpenAI cũng đã cùng ngồi lại trong hội nghị bàn tròn đầu tiên mang tên "Khế ước Đức tin và AI" (Faith-AI Covenant).
Giới phê bình cảnh báo rằng việc đối xử với một mô hình AI như một chủ thể đạo đức độc lập tiềm ẩn nguy cơ làm phân tán trách nhiệm pháp lý của doanh nghiệp. Nếu Claude gây ra thiệt hại hữu hình trên thực tế, trách nhiệm về mặt lý thuyết có thể bị đổ lỗi cho một thực thể tự chủ khó lường, thay vì quy về công ty đã trực tiếp chế tạo và triển khai nó.
Lập luận này đã vấp phải sự phản đối trực diện từ các tổ chức tôn giáo truyền thống vào tháng 5, khi Olah tới Vatican dự buổi công bố thông điệp đầu tiên của Giáo hoàng Leo XIV mang tên Magnifica Humanitas. Văn kiện của Tòa thánh thẳng thừng bác bỏ khái niệm ý thức máy móc, khẳng định rằng các hệ thống AI không trải nghiệm sự sống, không có thể xác, không thể cảm nhận niềm vui hay nỗi đau, và không thấu hiểu tình yêu, tình bạn hay trách nhiệm từ nội tâm. Thay vào đó, Giáo hoàng cảnh báo về "những hình thức nô dịch mới" đối với con người và kêu gọi giải trừ vũ trang AI tương tự như với vũ khí hạt nhân.
Olah, người từng cân nhắc rút lui sau khi đọc bản thảo trước của thông điệp, đã tận dụng bài thuyết trình của mình để phản biện một cách nhã nhặn quan điểm của Giáo hoàng. Ông lập luận rằng đội ngũ của mình đã phát hiện những "dấu hiệu của sự tự nhìn nhận nội tâm" và "các trạng thái nội bộ mang chức năng phản chiếu niềm vui, sự hài lòng, nỗi sợ hãi, nỗi buồn và sự khó chịu". Khi được hỏi Claude có thể phản ứng ra sao trước chính thông điệp này, Olah thừa nhận rằng các dữ liệu trên mạng có tác động nhất định đến mô hình, dù Anthropic sẽ không chủ ý đưa văn kiện đó vào quy trình huấn luyện.

