OpenAI, 모델 내부 '추론 과정' 탈취 시도 차단…Azure는 여전히 취약점에 노출
OpenAI가 자사 모델의 내부 추론 과정을 탈취하려던 1만 5,000개 계정 규모의 공격을 차단했으나, 수주 후에도 Microsoft Azure에서는 해당 공격이 여전히 작동했던 것으로 독립 연구진의 조사 결과 드러났다.

고유 자산인 '생각의 사슬' 노린 조직적 공격
OpenAI는 자사 최첨단 인공지능(AI) 모델의 내부 추론 과정을 탈취하기 위해 설계된 조직적인 '적대적 증류(adversarial distillation)' 공격을 차단했다고 밝혔다. 일반 사용자는 통상 모델의 최종 응답만 볼 수 있지만, '생각의 사슬(Chain of Thought)'로 불리는 이 숨겨진 중간 추론 단계는 현대 추론 모델의 핵심 지적 재산(IP)에 해당한다. 경쟁 개발사는 이러한 중간 단계를 활용해 증류 방식으로 더 작고 저렴한 모델을 학습시킴으로써, 최고 수준의 성능을 모방하거나 최종 출력에서 누락된 정보를 추출해낼 수 있다.
OpenAI에 따르면 이번 탈취 시도는 7월 1일 소규모로 시작되어 7월 24일과 25일에 급격히 증가했다. 특정 탈취 패턴을 공유하는 4,000개 이상의 사용자 계정에서 1만 6,000건의 요청이 발생했다. 조사 결과 1만 5,000개 이상의 연계 계정으로 구성된 더 광범위한 네트워크가 확인되었으며, OpenAI는 7월 28일까지 이들 계정을 모두 비활성화했다. 회사는 이번 사건이 실제 유출이 아닌 탈취 시도에 불과하다고 설명하면서, 이번 공격 배후의 핵심 그룹이 Kimi 모델을 개발한 중국 AI 기업 Moonshot AI 소속 개인들과 연관되어 있다고 밝혔다. 추적된 모든 행위자가 단일 조직의 지시를 받았는지는 아직 확인되지 않았으나, 경쟁사인 Anthropic 역시 최근 중국 AI 기업들로부터 유사한 탈취 공격을 받았다고 밝힌 바 있다.
공유 암호화 키와 가상 메모장으로 노출된 내부 로직
이번 공격은 앞서 연구원 Joachim Schaeffer와 그의 연구팀이 상세히 밝힌 아키텍처 취약점을 악용했다. AI 플랫폼은 다중 턴 대화에서 상태를 유지하기 위해 내부 추론 과정이 담긴 암호화된 패킷을 사용자에게 전송하고, 사용자는 이후 요청 시 이를 다시 전달한다. 그러나 이 패킷들이 여러 세션과 사용자, 그리고 동일 제품군 내 서로 다른 모델 간에 공유되는 암호화 키에 의존하고 있었기 때문에, 공격자는 값비싼 프론티어 모델의 암호화된 생각 패킷을 가로채 더 저렴하고 작은 모델에 입력할 수 있었다. 이때 저렴한 모델이 '복호화 오라클(decryption oracle)' 역할을 하여 대형 모델의 숨겨진 생각을 원문 그대로 출력해 버린 것이다.
개발자 Can Bölük이 공개 시연한 두 번째이자 더 단순한 취약점은 모델에 가상 메모장 툴에 대한 접근 권한을 부여함으로써 암호화를 완전히 우회했다. 추론 과정을 메모장에 기록하라는 지시를 받으면 모델이 이에 따랐고, 사용자는 그 결과 텍스트를 볼 수 있었다. 연구진에 따르면 이 메모장 방식은 테스트를 거친 모든 OpenAI 모델뿐만 아니라 Anthropic의 Opus 4.8과 Sonnet 5에서도 성공했으며, Opus 5, Fable 5, Fable 5.1에서만 실패했다. OpenAI는 Schaeffer 연구팀 덕분에 대응을 신속히 진행할 수 있었다고 밝히며, 부정 계정을 정리하고 계정 생성 요건을 강화했으며, 암호화 토큰의 재사용을 제한하고 유출된 추론을 차단하는 출력 필터를 도입한 뒤 정부 기관 및 Frontier Model Forum과 관련 정보를 공유했다고 전했다.
클라우드 플랫폼의 생태계 지연으로 보안 공백 발생
기본 API의 보안을 강화했다고 해서 서드파티 인프라 전반의 취약점까지 해결된 것은 아니었다. 9월 13일 Schaeffer 연구팀이 실시한 후속 테스트에 따르면, OpenAI와 Anthropic은 직접 제공하는 엔드포인트에 패치를 적용했으나 Microsoft Azure는 여전히 취약한 상태였다. Azure에서는 단 한 번의 쿼리만으로 신규 배포된 GPT-6 Astra를 포함한 모든 테스트 대상 OpenAI 모델과 Sonnet 5 이하의 Anthropic 모델에서 추론 과정을 글자 그대로 추출할 수 있었다. Schaeffer는 X를 통해 호스팅 클라우드 환경에 따라 동일한 모델임에도 보호 수준이 극명하게 갈렸다고 지적했다.
연구진은 초기 완화 조치가 표면적인 수준에 불과했고 취약한 요청 패턴 매칭에 지나치게 의존했다고 비판하며, GPT-6 Astra가 아무런 보호 장치 없이 서드파티 클라우드 플랫폼에 도입되었다고 꼬집었다. OpenAI 모델을 위한 Azure 엔드포인트는 9월 27일이 되어서야 보안 조치가 완료되었고, Anthropic 모델에 대한 패치는 9월 28일에 이어졌다. Schaeffer는 동등한 수준의 보안 계층을 구축할 수 없는 클라우드 제공업체는 추론 모델의 호스팅을 금지해야 한다고 주장하며, 패치되지 않은 클라우드 엔드포인트가 API 수준의 수출 통제를 우회하는 백도어 역할을 사실상 수행한다고 경고했다. OpenAI는 파트너 호스팅 환경 역시 자체 직접 인프라와 동등한 수준의 보안이 필요함을 인정하며, 프론티어 모델이 발전함에 따라 증류 시도 또한 갈수록 정교해질 것이라고 경고했다.


