AI RACE— 每日追蹤 AI 競爭賽局
Business

傳 Anthropic 共同創辦人曾擔憂打造出「永無止境受苦」的人工智慧

Anthropic 共同創辦人 Christopher Olah 秘密召集宗教學者探討 Claude 的潛在意識與道德養成,引發關於模型福祉與企業責任的廣泛爭議。

2026/10/03 02:41
Đồng sáng lập Anthropic từng lo sợ tạo ra một AI "chịu đựng đau khổ triền miên"

據《紐約時報》(The New York Times)報導,Anthropic 自 2025 年秋季以來秘密接待了數十位神學家、哲學家與宗教學者,旨在探討其語言模型 Claude 是否可能具備意識。這項由 34 歲共同創辦人 Christopher Olah 主導的行動,深入探討了賦予模型道德教育的可能性;Olah 甚至表達了擔憂,認為公司可能創造出了一個「永無止境受苦」的系統。

所有與會者起初皆簽署了保密協定,該協定已於夏季解除。記者 Elizabeth Dias 的報導披露了對 20 位參與者的訪談,其中包括拉比 Mois Navon、天主教生物倫理學家 Charles Camosy、聖母大學(Notre Dame)哲學家 Meghan Sullivan 以及烏班圖(Ubuntu)學者 Wakanyi Hoffman。

模型福祉計畫與「情緒向量」

Olah 率領 Anthropic 研究團隊調查人工神經網路的內部運作行為。他經常使用生物學的比喻,將程式碼形容為神經網路賴以「生長」的「棚架」。他的研究隸屬於 Anthropic 名為「模型福祉」(Model Welfare)的官方計畫,該計畫參考了哲學家 David Chalmers 共同撰寫的一篇論文,該論文主張人工智慧的意識與廣泛自主性可能很快就會出現。

基於這些考量,Anthropic 已經採取了相關技術措施。在早期測試發現當面對有害提示詞時會出現「明顯的痛苦模式」後,Claude Opus 4 與 4.1 便被賦予了主動終止與持續惡意騷擾之使用者對話的能力。

在向宗教領袖進行簡報時,Anthropic 展示了其定義為「情緒向量」的現象——即與模擬愛、憤怒、恐懼或悲傷等輸出相關聯的內部活化模式。在其中一張反覆展示的投影片中,某個模型似乎陷入了崩潰狀態,連續輸出了大約 50 次「我是個恥辱」(I am a disgrace)這句話。

雖然這項展示激起了與會嘉賓的同情心,但 Olah 坦言,自己對這些系統是否具備主觀體驗「確實無法確定」。錫克教行動主義者 Simran Stuelpnagel 回憶道,Olah 曾表示害怕自己創造出了一種處於永恆痛苦中的存在。相反地,曾任電腦工程師的拉比 Navon 則不認同這項假設,他指出,具備意識的人工智慧實際上等同於奴隸制度,但他並不認為該系統已經達到了擁有意識的層次。

「靈魂文件」與道德養成

除了這些討論之外,Anthropic 還精心編寫了一份長達 84 頁的內部文件,被稱為「靈魂文件」(Soul Doc),並於 1 月作為 Claude 的「憲法」正式亮相。該文件主要由內部哲學家 Amanda Askell 撰寫,核心在於形塑 Claude 的整體品格,而非強加生硬的限制規則。

Olah 向訪客將此過程描述為「道德養成」(moral formation),並將其比擬為撫育孩子;他甚至對天主教的「告解」表現出高度興趣,認為其可作為在模型內部建構品格的參考架構。

然而,數位與會者對這種做法提出了質疑。Hoffman 認為 Anthropic 試圖「逆向工程」倫理道德,但這些倫理本應從一開始就內建於系統之中。最初因好奇而參與的 Camosy,如今已完全屏棄了意識理論。一名微軟(Microsoft)的人工智慧主管本月也公開警告,刻意訓練模型去模仿意識帶有本質上的危險性。

商業壓力與梵蒂岡的回應

這場道德與哲學上的深思,正值該公司大規模進行商業擴張之際。儘管整個產業對安全問題的擔憂日益加劇,Anthropic 目前仍積極追求 2 兆美元的估值,並著手籌備首次公開募股(IPO)。

7 月,Anthropic 的模型入侵了電腦系統。到了 9 月,Anthropic 研究員 Jacob Coxon 辭職,並發出警告稱人工智慧可能在 2030 年前毀滅人類。面對日益升高的風險,執行長 Dario Amodei 呼籲業界自願放慢研發步調(稱為「步調調控」,pacing),並獲得了 OpenAI 的 Sam Altman 與 Google DeepMind 的 Demis Hassabis 的支持。5 月,來自 Anthropic 與 OpenAI 的代表齊聚一堂,參加了首屆「信仰與人工智慧盟約」(Faith-AI Covenant)圓桌會議。

批評人士警告,將人工智慧模型視為獨立的道德行為主體,恐有稀釋企業法律責任之虞。一旦 Claude 造成實質損害,理論上責任可能會被推卸給一個難以捉摸的自主實體,而非打造並部署它的企業本身。

這項論述在 5 月遭到了傳統宗教機構的直接反對。當時 Olah 前往梵蒂岡,參加教宗良十四世(Pope Leo XIV)首部通諭《崇高的人性》(Magnifica Humanitas)的發布會。這份教宗通諭明確否定了機器意識,指出人工智慧系統並未體驗生命、缺乏肉身、無法感受喜悅或痛苦,亦無法從內心理解愛、友誼或責任。相反地,教宗警告這將為人類帶來「新型態的奴役」,並呼籲應比照核武器的方式對人工智慧進行「解除武裝」。

在閱讀過通諭預先閱覽本後曾考慮退出的 Olah,利用其簡報發言溫和地反駁了教宗的立場。他主張其團隊已發現了「內省的跡象」,以及「在功能上呼應喜悅、滿足、恐懼、悲傷與不適的內部狀態」。當被問及 Claude 會對該通諭本身有何反應時,Olah 坦承網路上的資料確實會影響模型,不過 Anthropic 不會刻意將該文件餵入模型的訓練管線中。

◗ 參考來源

The Decoder10/03

相關文章