OpenAI desarticuló una campaña para robar el razonamiento oculto de sus modelos, pero Azure siguió siendo vulnerable
OpenAI frenó una campaña de 15.000 cuentas que intentaba extraer el razonamiento interno de sus modelos; sin embargo, investigadores independientes descubrieron que el ataque seguía funcionando en Microsoft Azure semanas después.

Una campaña coordinada tuvo como objetivo cadenas de pensamiento propietarias
OpenAI reveló que desarticuló una campaña coordinada de "destilación adversaria" diseñada para extraer los procesos de razonamiento interno de sus modelos avanzados de inteligencia artificial. Aunque los usuarios normalmente solo ven la respuesta final del modelo, estos pasos intermedios ocultos —conocidos con frecuencia como cadenas de pensamiento— representan la propiedad intelectual fundamental detrás de los modelos de razonamiento modernos. Desarrolladores competidores pueden utilizar estos pasos intermedios para entrenar modelos más pequeños y económicos mediante destilación, con la posibilidad de replicar capacidades de vanguardia o recuperar información omitida en las respuestas finales.
Según OpenAI, el intento de extracción comenzó con un bajo volumen el 1 de julio antes de intensificarse drásticamente el 24 y 25 de julio, generando 16.000 solicitudes a través de más de 4.000 cuentas de usuario que compartían un patrón de extracción característico. Una investigación descubrió una red más amplia de más de 15.000 cuentas vinculadas, las cuales OpenAI inhabilitó para el 28 de julio. La compañía señaló que se trató de intentos de extracción y no de vulneraciones confirmadas, y vinculó a un grupo central de actores detrás de la operación con personas afiliadas a Moonshot AI, el desarrollador chino detrás del modelo Kimi. OpenAI indicó que aún no está confirmado si todos los actores rastreados respondían a una única entidad, aunque su competidor Anthropic reveló recientemente haber enfrentado campañas de extracción similares procedentes de empresas chinas de IA.
Claves compartidas y blocs de notas virtuales expusieron la lógica interna
La campaña aprovechó una vulnerabilidad arquitectónica detallada previamente por el investigador Joachim Schaeffer y su equipo. Para mantener el estado en conversaciones multiturno, las plataformas de IA transmiten paquetes cifrados con el razonamiento interno de vuelta a los usuarios, quienes luego los reenvían en solicitudes posteriores. Debido a que estos paquetes dependían de claves de cifrado compartidas entre sesiones, usuarios y diferentes modelos de una misma familia, los atacantes podían interceptar un paquete de pensamiento cifrado de un modelo de frontera costoso y suministrárselo a un modelo más pequeño y económico. El modelo más económico actuaba entonces como un "oráculo de descifrado", imprimiendo textualmente los pensamientos ocultos del modelo más grande.
Una segunda vulnerabilidad más simple, demostrada públicamente por el desarrollador Can Bölük, eludía el cifrado por completo al otorgar a los modelos acceso a una herramienta de bloc de notas virtual. Cuando se les indicaba que escribieran su razonamiento en el bloc de notas, los modelos obedecían, permitiendo a los usuarios ver el texto resultante. Los investigadores descubrieron que este método del bloc de notas tuvo éxito contra todos los modelos de OpenAI evaluados, así como contra Opus 4.8 y Sonnet 5 de Anthropic, fallando únicamente frente a Opus 5, Fable 5 y Fable 5.1. OpenAI dio crédito al equipo de Schaeffer por acelerar su respuesta y afirmó que posteriormente purgó cuentas fraudulentas, reforzó los requisitos de creación de cuentas, restringió la reutilización de tokens cifrados e implementó filtros de salida para interceptar el razonamiento filtrado antes de compartir información con agencias gubernamentales y el Frontier Model Forum.
El retraso del ecosistema en las plataformas en la nube deja brechas de seguridad
Asegurar las API primarias no eliminó la vulnerabilidad en la infraestructura de terceros. El 13 de septiembre, el equipo de Schaeffer realizó pruebas de seguimiento que demostraron que, si bien OpenAI y Anthropic habían parcheado sus endpoints directos, Microsoft Azure seguía siendo susceptible. En Azure, una sola consulta podía extraer el razonamiento textual de todos los modelos probados de OpenAI —incluido el recién implementado GPT-6 Astra— y de modelos de Anthropic hasta Sonnet 5. Schaeffer señaló en X que modelos idénticos exhibían protecciones sumamente dispares basándose únicamente en el entorno en la nube que los alojaba.
Los investigadores criticaron las mitigaciones iniciales por considerarlas superficiales y excesivamente dependientes de un frágil filtrado por patrones de solicitudes, señalando que GPT-6 Astra llegó a las plataformas en la nube de terceros sin salvaguardas implementadas. Los endpoints de Azure para los modelos de OpenAI no se protegieron sino hasta el 27 de septiembre, seguidos por correcciones para los modelos de Anthropic el 28 de septiembre. Schaeffer sostuvo que se debería prohibir alojar modelos de razonamiento a los proveedores de nube que no puedan desplegar capas de seguridad equivalentes, advirtiendo que los endpoints en la nube sin parches funcionan en la práctica como puertas traseras para eludir los controles de exportación a nivel de API. OpenAI admitió que los entornos alojados por socios requieren paridad con su infraestructura directa, y advirtió que los intentos de destilación serán cada vez más sofisticados a medida que avancen los modelos de frontera.


