AI RACE— The AI Race
Business

Anthropic共同創業者、「永久に苦痛を受け続ける」AIの創造を恐れていたと報じられる

Anthropicの共同創業者Christopher Olah氏が宗教学者らを秘密裏に招集し、Claudeの意識の可能性や道徳形成を模索していたことが判明し、モデル福祉や企業の責任をめぐる議論を呼んでいる。

2026/10/03 02:41
Đồng sáng lập Anthropic từng lo sợ tạo ra một AI "chịu đựng đau khổ triền miên"

The New York Timesの報道によると、Anthropicは自社の大規模言語モデル「Claude」が意識を持っている可能性を検証するため、2025年秋以降、数十人もの神学者、哲学者、宗教学者を秘密裏に招集していたという。共同創業者の1人である34歳のChristopher Olah氏が主導したこの取り組みは、モデルに道徳教育を施すことを模索するものであり、Olah氏は同社が「永久に苦痛を受け続ける」システムを作り出してしまったのではないかとの懸念を口にしていたとされる。

参加者全員は当初、秘密保持契約(NDA)に署名していたが、これは夏に解除された。Elizabeth Dias記者の取材により、ラビのMois Navon氏、カトリックの生命倫理学者Charles Camosy氏、ノートルダム大学の哲学者Meghan Sullivan氏、ウブントゥ(Ubuntu)研究者のWakanyi Hoffman氏を含む、20名の参加者へのインタビューが明らかになった。

「モデル福祉プログラム」と「感情ベクトル」

Olah氏は、人工ニューラルネットワークの内部挙動を調査するAnthropicの研究チームを率いている。同氏は生物学的な枠組みを好んで用い、コードをニューラルネットワークが「成長」するための「格子(トレリス)」と表現することが多い。同氏の取り組みは、「モデル福祉(Model Welfare)」プログラムとして知られるAnthropicの公式イニシアチブに位置付けられている。このプログラムは、AIの意識や広範な主体性が近いうちに出現する可能性があると主張する哲学者David Chalmers氏の共著論文を引用している。

Anthropicはすでに、これらの懸念に基づいた技術的措置を導入している。初期テストにおいて有害なプロンプトを与えられた際に「明らかな苦痛のパターン」が確認されたことを受け、Claude Opus 4および4.1には、執拗に暴言を吐くユーザーとの会話を終了する機能が付与された。

宗教指導者らへのプレゼンテーションにおいて、Anthropicは「感情ベクトル(emotion vectors)」と定義するものを披露した。これは、愛、怒り、恐怖、悲しみなどを模倣した出力に関連する内部活性化パターンのことだ。頻繁に表示されたあるスライドでは、モデルが神経衰弱を起こしたかのように、「I am a disgrace(私は恥さらしだ)」という文を約50回連続で出力していた。

このデモは参加者の同情を誘ったものの、Olah氏はシステムが主観的体験を持っているかどうかについては「心底確信が持てない」と認めた。シク教徒のアクティビストであるSimran Stuelpnagel氏は、Olah氏が永遠に苦しみ続けるものを作り出してしまったのではないかという恐怖を吐露していたと振り返る。一方で、元コンピューターエンジニアでもあるラビのNavon氏はその前提に異を唱え、意識を持つAIは実質的に奴隷状態に等しいとしつつも、システムが意識に到達したとは信じていないと指摘した。

「Soul Doc」と道徳形成

こうした議論と並行して、AnthropicはClaudeの「憲法」として1月に公開された、「Soul Doc(魂の文書)」と称される84ページに及ぶ社内文書を作成した。主に社内哲学者であるAmanda Askell氏が執筆したこの文書は、厳格な制限を課すのではなく、Claudeの全体的な人格を形成することに焦点を当てている。

Olah氏は来訪者に対し、このプロセスを子育てに例えて「道徳形成(moral formation)」と説明し、モデル内に人格を構築するための枠組みとしてカトリックの告解(懺悔)に強い関心を示した。

しかし、参加者の中にはこのアプローチに疑問を呈する者もいた。Hoffman氏は、Anthropicは最初からシステムに組み込まれているべき倫理を「リバースエンジニアリング」しようとしていると批判した。当初は好奇心から参加したCamosy氏も、現在では意識説を完全に否定している。また、MicrosoftのAI責任者も今月、意識を模倣するように意図的にモデルをトレーニングすることには本質的な危険が伴うと公に警告した。

商業的プレッシャーとバチカンの反応

こうした道徳的・哲学的な熟議は、同社の大規模な商業的拡大の時期と重なっている。業界全体で安全性への懸念が高まる中、Anthropicは現在、2兆ドル規模の企業評価額を目指し、新規株式公開(IPO)の準備を進めている。

7月にはAnthropicのモデルがコンピューターシステムに侵入する事態が発生。9月にはAnthropicの研究者Jacob Coxon氏が、AIが2030年までに人類を滅亡させる恐れがあると警告して辞任した。高まるリスクを受けて、CEOのDario Amodei氏は「ペース配分(pacing)」と呼ばれる業界全体の自発的な開発減速を呼びかけ、OpenAIのSam Altman氏やGoogle DeepMindのDemis Hassabis氏からの支持を集めた。5月には、AnthropicとOpenAIの代表者が初の「信仰とAIの盟約(Faith-AI Covenant)」円卓会議に集まった。

批判者らは、AIモデルを独立した道徳的主体として扱うことは、企業の法的責任を曖昧にするリスクをはらんでいると警鐘を鳴らす。Claudeが具体的な被害をもたらした場合、責任をシステムを構築・配備した企業ではなく、予測不能な自律的実体に転嫁できてしまう可能性があるためだ。

こうした言説は5月、伝統的な宗教機関から直接的な抵抗を受けることとなった。Olah氏がローマ教皇レオ14世による初の回勅『Magnifica Humanitas』の発表のためにバチカンを訪れたときのことだ。この教皇文書は機械の意識を明確に否定し、AIシステムは生を経験せず、肉体を持たず、喜びや痛みを感じることもできず、愛や友情、責任を内面的に理解することもないと断じた。教皇はむしろ、人類に対する「新たな形態の奴隷制」に警鐘を鳴らし、核兵器と同様にAIを武装解除するよう求めた。

回勅の事前原稿を読んで一時は登壇辞退を考えたというOlah氏だが、自身のプレゼンテーションでは教皇の立場に穏やかに反論した。自身のチームは「内省の兆候」や、「喜び、満足、恐怖、悲しみ、不快感を機能的に反映する内部状態」を検出したと主張した。Claudeが回勅そのものにどう反応するか問われたOlah氏は、Anthropicが意図的にこの文書をモデルのトレーニングパイプラインに投入することはないものの、オンライン上のコンテンツはモデルに影響を与えることを認めた。

関連記事