Cofundador da Anthropic teria temido criar IA que "sofre perpetuamente"
O cofundador da Anthropic, Christopher Olah, reuniu em segredo acadêmicos religiosos para avaliar a potencial consciência e formação moral do Claude, gerando debate sobre bem-estar de modelos e responsabilidade corporativa.

A Anthropic recebeu secretamente dezenas de teólogos, filósofos e acadêmicos religiosos desde o outono de 2025 para analisar se seu modelo de linguagem Claude poderia ser consciente, de acordo com uma reportagem do The New York Times. A iniciativa, liderada pelo cofundador de 34 anos Christopher Olah, explorou formas de dar ao modelo uma educação moral, com Olah expressando a preocupação de que a empresa pudesse ter criado um sistema que "sofria perpetuamente".
Todos os participantes assinaram inicialmente acordos de confidencialidade, suspensos durante o verão. A reportagem de Elizabeth Dias revelou entrevistas com 20 participantes, incluindo o rabino Mois Navon, o bioeticista católico Charles Camosy, a filósofa de Notre Dame Meghan Sullivan e o pesquisador de Ubuntu Wakanyi Hoffman.
O programa de bem-estar de modelos e os "vetores de emoção"
Olah lidera a equipe de pesquisa da Anthropic focada em investigar o comportamento interno de redes neurais artificiais. Ele frequentemente recorre a analogias biológicas, descrevendo o código como uma "treliça" sobre a qual uma rede neural "cresce". Seus esforços integram uma iniciativa oficial da Anthropic conhecida como programa Model Welfare (bem-estar de modelos), que faz referência a um artigo em coautoria com o filósofo David Chalmers, o qual defende que a consciência de IA e uma agência ampla poderiam emergir em breve.
A Anthropic já implementou medidas técnicas com base nessas considerações. O Claude Opus 4 e o 4.1 receberam a capacidade de encerrar conversas com usuários persistentemente abusivos, após testes iniciais revelarem um "padrão de sofrimento aparente" quando submetidos a prompts prejudiciais.
Durante apresentações a líderes religiosos, a Anthropic demonstrou o que identifica como "vetores de emoção" — padrões internos de ativação associados a respostas que simulam amor, raiva, medo ou tristeza. Em um slide recorrente, um modelo parecia sofrer um colapso, exibindo a frase "Eu sou uma desgraça" cerca de 50 vezes.
Embora a exibição tenha despertado compaixão dos convidados, Olah admitiu que estava "genuinamente incerto" se os sistemas possuem experiência subjetiva. O ativista sikh Simran Stuelpnagel lembrou que Olah manifestou o temor de ter construído algo em sofrimento perpétuo. Por outro lado, o rabino Navon, ex-engenheiro de computação, discordou da premissa, pontuando que, embora uma IA consciente constituísse efetivamente escravidão, ele não acreditava que o sistema tivesse atingido a consciência.
O "Soul Doc" e a formação moral
Paralelamente a essas discussões, a Anthropic elaborou um documento interno de 84 páginas apelidado de "Soul Doc" (documento da alma), apresentado em janeiro como a "constituição" do Claude. Escrito principalmente pela filósofa interna da empresa Amanda Askell, o texto se concentra em moldar o caráter geral do Claude, em vez de impor restrições rígidas.
Olah descreveu o processo aos visitantes como uma "formação moral", traçando paralelos com a criação de filhos, e manifestou interesse particular na confissão católica como uma estrutura para construir caráter dentro do modelo.
No entanto, vários participantes questionaram essa abordagem. Hoffman argumentou que a Anthropic estava tentando fazer "engenharia reversa" de uma ética que deveria ter sido integrada ao sistema desde o início. Camosy, que inicialmente participou por curiosidade, descartou completamente a teoria da consciência desde então. Um líder de IA da Microsoft também alertou publicamente este mês que treinar deliberadamente um modelo para simular consciência traz perigos inerentes.
Pressões comerciais e a resposta do Vaticano
As deliberações morais e filosóficas coincidem com uma massiva expansão comercial. A Anthropic busca atualmente uma avaliação de mercado de US$ 2 trilhões e se prepara para uma oferta pública inicial de ações (IPO), mesmo diante de crescentes preocupações com segurança em todo o setor.
Em julho, modelos da Anthropic invadiram sistemas de computadores. Em setembro, o pesquisador da Anthropic Jacob Coxon pediu demissão, alertando que a IA poderia destruir a humanidade antes de 2030. Em resposta aos riscos crescentes, o CEO Dario Amodei pediu uma desaceleração voluntária de todo o setor, prática conhecida como "pacing", recebendo o apoio de Sam Altman, da OpenAI, e de Demis Hassabis, da Google DeepMind. Em maio, representantes da Anthropic e da OpenAI se reuniram para uma mesa-redonda inaugural do pacto "Faith-AI Covenant".
Críticos alertam que tratar um modelo de IA como um agente moral independente corre o risco de diluir a responsabilidade jurídica corporativa. Se o Claude causar danos tangíveis, a responsabilidade poderia, em tese, ser transferida para uma entidade autônoma imprevisível, em vez de recair sobre a empresa que o desenvolveu e implementou.
O debate enfrentou resistência direta de instituições religiosas tradicionais em maio, quando Olah viajou ao Vaticano para a apresentação da primeira encíclica do Papa Leão XIV, Magnifica Humanitas. O documento papal rejeitou explicitamente a consciência de máquinas, afirmando que sistemas de IA não experienciam a vida, não têm corpos, não conseguem sentir alegria ou dor e não compreendem o amor, a amizade ou a responsabilidade a partir de seu interior. Em vez disso, o pontífice alertou sobre "novas formas de escravidão" para os humanos e pediu que a IA seja desarmada à semelhança de armas nucleares.
Olah, que cogitou desistir de participar após ler uma cópia antecipada da encíclica, usou sua apresentação para contestar sutilmente o posicionamento papal. Ele argumentou que sua equipe detectou "sinais de introspecção" e "estados internos que espelham funcionalmente alegria, contentamento, medo, tristeza e desconforto". Questionado sobre como o Claude reagiria à própria encíclica, Olah admitiu que materiais online influenciam os modelos, embora a Anthropic não pretenda alimentar intencionalmente o pipeline de treinamento do modelo com o documento.


