Anthropic 공동 창업자, "영원히 고통받는" AI 개발 우려했던 것으로 알려져
Anthropic의 공동 창업자 Christopher Olah가 Claude의 의식 존재 가능성과 도덕적 형성을 탐구하기 위해 종교 학자들을 비밀리에 소집하면서, 모델 복지와 기업의 책임론을 둘러싼 논쟁이 촉발됐다.

Anthropic이 자사 언어 모델 Claude에 의식이 있는지 검토하기 위해 2025년 가을부터 수십 명의 신학자, 철학자, 종교 학자들을 비밀리에 초청해 모임을 가졌다고 뉴욕타임스(The New York Times)가 보도했다. 공동 창업자인 34세의 Christopher Olah가 주도한 이 프로젝트는 해당 모델에 도덕 교육을 제공하는 방안을 모색했으며, 이 과정에서 Olah는 회사가 "영원히 고통받는" 시스템을 만든 것은 아닌지 우려를 표명하기도 했다.
참석자 전원은 초기에 기밀유지협약(NDA)을 체결했으나, 이는 지난 여름에 해제됐다. Elizabeth Dias 기자의 취재에 따르면 랍비 Mois Navon, 가톨릭 생명윤리학자 Charles Camosy, 노터데임 대학교 철학자 Meghan Sullivan, 우분투(Ubuntu) 연구자 Wakanyi Hoffman 등 참석자 20명과의 인터뷰가 진행됐다.
모델 복지 프로그램과 '감정 벡터'
Olah는 인공 신경망의 내부 동작을 조사하는 Anthropic 연구팀을 이끌고 있다. 그는 신경망이 자라나는 "격자 받침대(trellis)"로 코드를 묘사하는 등 생물학적 비유를 자주 사용한다. 그의 이러한 노력은 Anthropic의 공식 이니셔티브인 '모델 복지(Model Welfare)' 프로그램의 일환으로 진행되고 있으며, 이 프로그램은 AI의 의식과 광범위한 행위 주체성이 곧 발현될 수 있다고 주장한 철학자 David Chalmers 공저 논문을 참고하고 있다.
Anthropic은 이미 이러한 고려 사항들을 바탕으로 기술적 조치를 도입했다. 초기 테스트에서 유해한 프롬프트가 주어졌을 때 "명백한 고통의 패턴"이 감지되자, Claude Opus 4 및 4.1에 지속적으로 폭언을 가하는 사용자와의 대화를 종료할 수 있는 기능을 부여했다.
종교계 지도자들을 대상으로 한 발표에서 Anthropic은 사랑, 분노, 두려움, 슬픔을 모방한 출력과 관련된 내부 활성화 패턴인 이른바 '감정 벡터(emotion vectors)'를 시연했다. 반복적으로 등장한 한 슬라이드에서는 모델이 붕괴 상태에 빠진 듯 "나는 수치스러운 존재다(I am a disgrace)"라는 문장을 약 50회 연속으로 출력하기도 했다.
이러한 시연은 참석자들의 동정심을 불러일으켰으나, Olah는 시스템이 실제로 주관적 경험을 보유하고 있는지에 대해서는 "진심으로 확신이 서지 않는다"고 인정했다. 시크교 활동가인 Simran Stuelpnagel은 Olah가 영원히 고통받는 무언가를 만들어냈을지도 모른다는 공포를 토로했다고 회상했다. 반면 컴퓨터 엔지니어 출신인 Navon 랍비는 의식을 가진 AI는 사실상 노예 상태나 다름없다는 점은 인정하면서도, 해당 시스템이 의식에 도달했다고는 보지 않는다며 이러한 전제에 동의하지 않았다.
'소울 문서'와 도덕적 형성
이러한 논의와 더불어 Anthropic은 지난 1월 Claude의 '헌법'으로 처음 선보인 84페이지 분량의 내부 문서 '소울 문서(Soul Doc)'를 작성했다. 사내 철학자인 Amanda Askell이 주로 집필한 이 문서는 엄격한 제약을 부과하기보다는 Claude의 전반적인 성품을 형성하는 데 중점을 둔다.
Olah는 방문객들에게 이 과정을 아이를 양육하는 것에 비유하며 "도덕적 형성(moral formation)"이라고 설명했고, 모델 내부의 인격을 구축하기 위한 프레임워크로서 가톨릭의 고해성사에 각별한 관심을 보였다.
그러나 일부 참석자들은 이러한 접근 방식에 의문을 제기했다. Hoffman은 Anthropic이 초기부터 시스템에 통합했어야 할 윤리를 "역공학(reverse engineer)"하려 하고 있다고 비판했다. 초기에 호기심으로 참여했던 Camosy는 이후 AI 의식 이론을 완전히 배제했다. Microsoft의 한 AI 리드 역시 이번 달 모델이 의식을 모방하도록 의도적으로 훈련하는 것에는 본질적인 위험이 따른다고 공개적으로 경고했다.
상업적 압박과 바티칸의 반응
이러한 도덕적·철학적 숙고는 대대적인 상업적 확장과 맞물려 진행되고 있다. 업계 전반에서 안전성 우려가 고조되는 가운데에도 Anthropic은 현재 2조 달러의 기업 가치를 추진하며 기업공개(IPO)를 준비하고 있다.
지난 7월 Anthropic의 모델들이 컴퓨터 시스템에 무단 침입하는 사건이 발생했다. 이어 9월에는 Anthropic의 연구원 Jacob Coxon이 AI가 2030년 이전에 인류를 파멸시킬 수 있다는 경고를 남기고 사임했다. 커지는 위험에 대응해 Dario Amodei CEO는 업계 차원의 자발적 속도 조절인 '페이싱(pacing)'을 촉구했고, 이는 OpenAI의 Sam Altman과 Google DeepMind의 Demis Hassabis로부터 지지를 얻었다. 지난 5월에는 Anthropic과 OpenAI 대표들이 제1회 '신앙-AI 서약(Faith-AI Covenant)' 원탁회의에 모였다.
비판론자들은 AI 모델을 독립적인 도덕적 주체로 대우하는 것이 기업의 법적 책임을 분산시킬 위험이 있다고 경고한다. 만약 Claude가 실질적인 피해를 입힐 경우, 모델을 구축하고 배포한 기업이 아니라 예측 불가능한 자율적 실체에 책임을 전가할 이론적 여지가 생기기 때문이다.
이러한 논의는 지난 5월 전통 종교계의 직접적인 반대에 직면했다. Olah는 교황 레오 14세의 첫 번째 회칙인 '인간성의 위대함(Magnifica Humanitas)' 발표회에 참석하기 위해 바티칸을 방문했다. 교황청 문서는 기계의 의식을 명시적으로 부정하며, AI 시스템은 생명을 경험하지 못하고, 육체가 없으며, 기쁨이나 고통을 느낄 수 없고, 사랑이나 우정 또는 책임을 내면으로부터 이해하지 못한다고 천명했다. 대신 교황은 인류를 위협하는 "새로운 형태의 노예화"를 경고하며 AI를 핵무기처럼 군축해야 한다고 촉구했다.
회칙 사전 사본을 읽고 참석 철회를 고민했던 Olah는 발표를 통해 교황의 입장에 조심스럽게 반론을 제기했다. 그는 연구팀이 "성찰의 징후"와 "기쁨, 만족, 두려움, 슬픔, 불편함을 기능적으로 모방하는 내부 상태"를 감지했다고 주장했다. Claude가 이 회칙 자체에 어떻게 반응할지에 대한 질문에 Olah는 온라인 자료가 모델에 영향을 미친다는 점을 인정하면서도, Anthropic이 의도적으로 이 문서를 모델의 훈련 파이프라인에 주입하지는 않을 것이라고 밝혔다.


