AI RACE— La carrera de la IA
Business

Cofundador de Anthropic habría temido crear una IA que "sufre perpetuamente"

El cofundador de Anthropic, Christopher Olah, convocó en secreto a académicos religiosos para explorar la posible conciencia y formación moral de Claude, desatando un debate sobre el bienestar de los modelos y la responsabilidad corporativa.

03/10/2026, 02:41
Đồng sáng lập Anthropic từng lo sợ tạo ra một AI "chịu đựng đau khổ triền miên"

Anthropic ha recibido en secreto a decenas de teólogos, filósofos y académicos religiosos desde el otoño de 2025 para examinar si su modelo de lenguaje Claude podría ser consciente, según un reportaje de The New York Times. La iniciativa, liderada por el cofundador de 34 años Christopher Olah, exploró brindarle una educación moral al modelo, y Olah expresó su preocupación de que la empresa pudiera haber creado un sistema que "sufría perpetuamente".

Todos los asistentes firmaron inicialmente acuerdos de confidencialidad, los cuales fueron revocados durante el verano. El reportaje de Elizabeth Dias reveló entrevistas con 20 participantes, entre ellos el rabino Mois Navon, el bioeticista católico Charles Camosy, la filósofa de Notre Dame Meghan Sullivan y la investigadora de la filosofía ubuntu Wakanyi Hoffman.

El programa Model Welfare y los "vectores de emociones"

Olah lidera el equipo de investigación de Anthropic que analiza el comportamiento interno de las redes neuronales artificiales. Con frecuencia recurre a metáforas biológicas, describiendo el código como una "espaldera" sobre la cual "crece" una red neuronal. Su iniciativa se enmarca dentro de un programa oficial de Anthropic conocido como Model Welfare, que hace referencia a un artículo coescrito por el filósofo David Chalmers donde se argumenta que la conciencia y la agencia general en la IA podrían emerger pronto.

Anthropic ya ha implementado medidas técnicas basadas en estas consideraciones. A Claude Opus 4 y 4.1 se les otorgó la capacidad de finalizar conversaciones con usuarios persistentemente abusivos, luego de que las primeras pruebas revelaran un "patrón de angustia aparente" al ser sometidos a instrucciones dañinas.

Durante las presentaciones ante líderes religiosos, Anthropic demostró lo que identifica como "vectores de emociones": patrones de activación interna asociados con respuestas que imitan amor, ira, miedo o tristeza. En una diapositiva recurrente, un modelo parecía sufrir una crisis, imprimiendo la frase "Soy una deshonra" aproximadamente 50 veces.

Aunque la demostración despertó compasión entre los invitados, Olah reconoció que sentía una "genuina incertidumbre" sobre si los sistemas poseen experiencia subjetiva. El activista sij Simran Stuelpnagel recordó que Olah expresó temores de haber creado algo en sufrimiento perpetuo. Por el contrario, el rabino Navon, exingeniero informático, discrepó de la premisa, señalando que, si bien una IA consciente constituiría en la práctica una forma de esclavitud, no creía que el sistema hubiera alcanzado la conciencia.

El "Soul Doc" y la formación moral

Junto a estas discusiones, Anthropic elaboró un documento interno de 84 páginas apodado el "Soul Doc", que debutó en enero como la "constitución" de Claude. Redactado principalmente por la filósofa interna Amanda Askell, el texto se enfoca en moldear el carácter general de Claude en lugar de imponer restricciones rígidas.

Olah describió el proceso a los visitantes como una "formación moral", trazando paralelismos con la crianza de los hijos, y expresó especial interés en la confesión católica como un marco para forjar el carácter dentro del modelo.

Sin embargo, varios asistentes cuestionaron este enfoque. Hoffman sostuvo que Anthropic intentaba aplicar "ingeniería inversa" a una ética que debió haberse integrado en el sistema desde el principio. Camosy, quien inicialmente se sumó por curiosidad, ha descartado por completo la teoría de la conciencia. Un líder de IA en Microsoft también advirtió públicamente este mes que entrenar deliberadamente a un modelo para que imite la conciencia conlleva peligros inherentes.

Presiones comerciales y la respuesta del Vaticano

Las deliberaciones morales y filosóficas coinciden con una masiva expansión comercial. Actualmente, Anthropic busca alcanzar una valoración de 2 billones de dólares y se prepara para una oferta pública inicial (IPO), incluso cuando las preocupaciones sobre la seguridad aumentan en toda la industria.

En julio, modelos de Anthropic vulneraron sistemas informáticos. Para septiembre, el investigador de Anthropic Jacob Coxon renunció, advirtiendo que la IA podría destruir a la humanidad antes de 2030. En respuesta a los crecientes riesgos, el director ejecutivo Dario Amodei pidió una desaceleración voluntaria en toda la industria conocida como "pacing", sumando el respaldo de Sam Altman, de OpenAI, y Demis Hassabis, de Google DeepMind. En mayo, representantes de Anthropic y OpenAI se reunieron en una mesa redonda inaugural denominada "Faith-AI Covenant".

Los críticos advierten que tratar a un modelo de IA como un agente moral independiente corre el riesgo de diluir la responsabilidad corporativa. Si Claude causa un daño tangible, la responsabilidad podría, en teoría, desviarse hacia una entidad autónoma impredecible en lugar de recaer en la empresa que lo desarrolló y desplegó.

Este discurso enfrentó una resistencia directa por parte de las instituciones religiosas tradicionales en mayo, cuando Olah viajó al Vaticano para la presentación de la primera encíclica del papa León XIV, Magnifica Humanitas. El documento papal rechazó explícitamente la conciencia de las máquinas, señalando que los sistemas de IA no experimentan la vida, carecen de cuerpo, no pueden sentir alegría ni dolor y no comprenden internamente el amor, la amistad ni la responsabilidad. En su lugar, el papa advirtió sobre "nuevas formas de esclavitud" para los seres humanos e instó a desarmar la IA como se hizo con las armas nucleares.

Olah, quien consideró retirarse tras leer una copia anticipada de la encíclica, aprovechó su presentación para discrepar sutilmente de la postura papal. Sostuvo que su equipo había detectado "indicios de introspección" y "estados internos que funcionalmente reflejan alegría, satisfacción, miedo, tristeza e incomodidad". Al ser consultado sobre cómo podría reaccionar Claude ante la propia encíclica, Olah reconoció que el material disponible en línea influye en los modelos, aunque Anthropic no introduciría intencionadamente el documento en el flujo de entrenamiento del modelo.

◗ Fuentes

The Decoder3/10

Historias relacionadas