OpenAI interrompeu campanha para roubar raciocínio oculto de seus modelos, mas Azure permaneceu vulnerável
A OpenAI barrou uma campanha de 15.000 contas que tentava extrair o raciocínio interno de seus modelos, mas pesquisadores independentes descobriram que o ataque ainda funcionava no Microsoft Azure semanas depois.

Campanha coordenada visava cadeias de pensamento proprietárias
A OpenAI revelou que interrompeu uma campanha coordenada de "destilação adversária" projetada para extrair os processos de raciocínio interno de seus modelos avançados de inteligência artificial. Embora os usuários normalmente vejam apenas a resposta final de um modelo, essas etapas intermediárias ocultas — frequentemente chamadas de cadeias de pensamento — representam a principal propriedade intelectual por trás dos modelos modernos de raciocínio. Desenvolvedores concorrentes podem usar essas etapas intermediárias para treinar modelos menores e mais baratos por meio da destilação, potencialmente replicando capacidades de ponta ou recuperando informações omitidas nas saídas finais.
De acordo com a OpenAI, a tentativa de extração começou com baixo volume em 1º de julho antes de escalar acentuadamente em 24 e 25 de julho, gerando 16.000 solicitações em mais de 4.000 contas de usuários que compartilhavam um padrão característico de extração. Uma investigação descobriu uma rede mais ampla de mais de 15.000 contas afiliadas, que a OpenAI desativou até 28 de julho. A empresa destacou que se tratava de tentativas de extração, e não de violações confirmadas, e vinculou um grupo central de agentes por trás da operação a indivíduos afiliados à Moonshot AI, desenvolvedora chinesa responsável pelo modelo Kimi. A OpenAI observou que ainda não foi confirmado se todos os agentes monitorados respondiam a uma única entidade, embora a concorrente Anthropic tenha revelado recentemente enfrentar campanhas de extração semelhantes originadas de empresas chinesas de IA.
Chaves compartilhadas e blocos de notas virtuais expuseram lógica interna
A campanha se aproveitou de uma vulnerabilidade arquitetural detalhada anteriormente pelo pesquisador Joachim Schaeffer e sua equipe. Para manter o estado ao longo de conversas com múltiplos turnos, plataformas de IA transmitem pacotes criptografados de raciocínio interno de volta aos usuários, que os reenviam em solicitações subsequentes. Como esses pacotes dependiam de chaves de criptografia compartilhadas entre sessões, usuários e diferentes modelos da mesma família, invasores podiam interceptar um pacote criptografado de pensamentos de um modelo de fronteira caro e fornecê-lo a um modelo menor e mais barato. O modelo mais barato servia então como um "oráculo de descriptografia", reproduzindo textualmente os pensamentos ocultos do modelo maior.
Uma segunda vulnerabilidade, mais simples, demonstrada publicamente pelo desenvolvedor Can Bölük, contornou a criptografia por completo ao fornecer aos modelos acesso a uma ferramenta de bloco de notas virtual. Quando instruídos a registrar seu raciocínio no bloco de notas, os modelos obedeciam, permitindo que os usuários visualizassem o texto resultante. Os pesquisadores descobriram que esse método do bloco de notas funcionou contra todos os modelos testados da OpenAI, além do Opus 4.8 e do Sonnet 5 da Anthropic, falhando apenas contra Opus 5, Fable 5 e Fable 5.1. A OpenAI creditou à equipe de Schaeffer a aceleração de sua resposta, afirmando que, posteriormente, expurgou contas fraudulentas, reforçou os requisitos de criação de contas, restringiu a reutilização de tokens criptografados e implementou filtros de saída para interceptar raciocínios vazados antes de compartilhar informações de inteligência com agências governamentais e com o Frontier Model Forum.
Defasagem do ecossistema em plataformas de nuvem deixa brechas de segurança
Proteger as APIs principais não eliminou a vulnerabilidade em infraestruturas de terceiros. Em 13 de setembro, a equipe de Schaeffer realizou testes complementares demonstrando que, embora a OpenAI e a Anthropic tivessem corrigido seus endpoints diretos, o Microsoft Azure continuava suscetível. No Azure, uma única consulta conseguia extrair o raciocínio textual de todos os modelos testados da OpenAI — incluindo o recém-lançado GPT-6 Astra — e de modelos da Anthropic até o Sonnet 5. Schaeffer observou no X que modelos idênticos exibiam proteções amplamente distintas com base unicamente no ambiente de nuvem de hospedagem.
Pesquisadores criticaram as mitigações iniciais como superficiais e excessivamente dependentes de correspondência frágil de padrões de solicitação, apontando que o GPT-6 Astra chegou a plataformas de nuvem terceirizadas sem salvaguardas implementadas. Os endpoints do Azure para modelos da OpenAI não foram protegidos até 27 de setembro, seguidos por correções para modelos da Anthropic em 28 de setembro. Schaeffer argumentou que provedores de nuvem incapazes de implementar camadas equivalentes de segurança deveriam ser proibidos de hospedar modelos de raciocínio, alertando que endpoints de nuvem sem correção funcionam, na prática, como portas dos fundos para burlar controles de exportação no nível da API. A OpenAI reconheceu que ambientes hospedados por parceiros exigem paridade com sua infraestrutura direta, alertando que as tentativas de destilação se tornarão cada vez mais sofisticadas à medida que os modelos de fronteira avançarem.


