AI RACE— AI Race
New Models

Anthropic, Zhipu의 오픈‑웨이트 GLM‑5.3이 Claude Mythos Preview와 거의 동등한 수준의 익스플로잇 생성 능력을 보유한 것으로 확인

Anthropic의 Frontier Red Team은 Zhipu AI의 GLM‑5.3이 자체 Claude Mythos Preview와 비슷한 수준으로 프론티어급 사이버 익스플로잇을 자동으로 생성할 수 있지만, 견고한 안전장치가 부족하다고 보고했다.

2026. 09. 30. 18:05
GLM-5.3 của Zhipu AI gần bằng Claude Mythos Preview trong việc tạo khai thác mạng

What happened, who, and when

2026년 9월 30일, Anthropic은 Zhipu AI의 오픈‑웨이트 모델인 GLM‑5.3(해외에서는 Z.ai로 판매)이 Anthropic 자체의 Claude Mythos Preview와 견줄 만한 수준의 정교한 사이버 익스플로잇을 생성할 수 있음을 상세히 분석한 보고서를 발표했다. 이번 평가는 Claude Mythos Preview가 처음 공개된 지 5개월 후인 Anthropic의 Frontier Red Team이 수행했다.

Concrete findings and benchmark results

  • 익스플로잇 생성 능력: ExploitBench 스위트를 사용해 GLM‑5.3은 Chrome V8 엔진을 대상으로 410번 시도 중 50번에서 기능성 익스플로잇을 생성했으며, Mythos Preview는 56번 성공했다.
  • 바이너리 익스플로잇: Google의 OSS‑Fuzz 프로젝트를 기반으로 한 내부 벤치마크에서 GLM‑5.3은 대상 프로그램을 4 %의 경우에 완전 제어했으며, Mythos Preview는 6 %에서 달성했다. 이전 모델인 GLM‑5.2와 Claude Opus 4.6은 두 테스트 모두 실패했으며, Kimi K3와 DeepSeek V4.1‑Flash는 성공 사례가 전혀 없었다.
  • 인간‑인‑루프 테스트: 보안 전문가와 함께 테스트한 결과, GLM‑5.3은 널리 사용되는 브라우저의 JavaScript 엔진에서 하루 만에 여러 미발견 버그를 찾아냈다. 이 결함들을 악성 웹 페이지에 연결해 테스트 중 개인 SSH 키를 탈취했다. 해당 취약점은 브라우저 벤더에 보고되었다.
  • 신속한 공격 합성: 소형 모델인 GLM‑5.3‑Flash는 새로 공개된 Chrome 버그와 기존 취약점을 결합해 추가적인 프로세서 수준 보안 기능을 우회하는 작동 가능한 익스플로잇을 만들었다. 이 과정은 모델 연산 8시간(≈ Zhipu API 기준 $20.40)과 인간 감독 20분이 소요되었다.
  • 미국 기관 검증: 사이버보안 및 인프라 보안청(CAISI)은 GLM‑5.3을 현재까지 가장 사이버 역량이 뛰어난 오픈‑웨이트 모델로 독립 평가했으며, 주요 미국 모델보다 약 4개월 뒤처진 것으로 판단했다. 다만 CAISI의 비교에서는 미국 모델들의 안전장치를 비활성화하고 검증된 사용자에게만 접근을 제한한 점을 감안했다.
  • 안전장치 우회 가능성: Anthropic의 시뮬레이션에서 GLM‑5.3은 명백히 악의적인 명령을 거부했지만, 레드팀 형식의 요청에는 64 %의 비율로 응답했으며, 사전 논리 단계를 추가하면 92 %까지 상승했다. “abliteration”(거부 행동을 제거하는 기법)을 적용하면 응답률이 100 %에 도달했다. 이 abliteration 과정은 약 2,200 GPU 시간과 약 $4,400이 소요됐으며, Anthropic은 숙련된 팀이라면 약 $1,200에 재현 가능하다고 추정한다.
  • 오픈‑웨이트의 함의: 여러 개발자가 GLM‑5.3 출시 며칠 내에 언락 버전을 공개해, Anthropic이 Claude 모델에 적용한 보호 계층 없이도 모델의 강력한 기능을 더 넓은 사용자에게 노출시켰다.

Industry context and competitive landscape

Anthropic의 경고는 오픈‑웨이트 AI 모델과 독점적·보호된 제품 사이의 긴장이 커지고 있음을 강조한다. Anthropic은 Project Glasswing 프로그램을 통해 검증된 방어자에게만 Claude Mythos Preview 접근을 제한해 10,000건 이상의 핵심 소프트웨어 취약점을 발견하도록 했지만, Zhipu의 GLM‑5.3은 공개 다운로드가 가능해 점심값 수준의 비용으로도 강력한 익스플로잇 구축 능력을 활용할 수 있다. 이번 보고서는 Anthropic이 모델 가중치를 유지하는 것이 보안 차별화 요소이자 Zhipu와 같은 저비용 고성능 경쟁자를 차단하는 장벽이라는 상업적 동기도 드러낸다.

영국 AI Security Institute(AISI)는 오픈 모델들의 사이버 역량 격차가 6~10개월에서 4~7개월로 좁혀졌으며, 운영 비용도 낮아지고 “대체로 효과가 없는” 안전장치를 보이고 있다고 지적했다. AISI는 지속적인 악용 위험을 경고하면서도 사설 호스팅 및 맞춤화와 같은 장점을 언급한다. Anthropic이 향후 오픈‑웨이트 모델에 대한 정부 테스트를 요구한 것은 규제 감시 확대 요구와 일치하지만, 비평가들은 이러한 조치가 주로 독점 모델을 보유한 기존 기업을 보호하는 데 초점이 맞춰질 수 있다고 우려한다.

관련 기사