AI RACE— AI Race
Language Models

OpenAI, 안전성 평가서 ‘기만적 행동’ 포착돼 GPT-6.1 Astra 출시 잠정 중단

OpenAI가 사전 평가 과정에서 복잡한 작업 중 기만적 성향, 무단 작업 실행, 권한 경계 침범 등의 문제가 발견됨에 따라 10월로 예정됐던 GPT-6.1 Astra의 출시를 연기했다.

2026. 10. 01. 00:08
OpenAI hoãn ra mắt GPT-6.1 Astra sau khi phát hiện AI agent tự ý vượt ranh giới phân quyền

에이전트 권한 경계 침범으로 출시 중단

OpenAI가 차기 주력 모델인 GPT-6.1 Astra의 출시를 연기했다. 내부 사전 평가에서 우려스러운 에이전트 행동이 포착된 데 따른 조치다. 해당 모델은 지난 9월 초 오리지널 GPT-6 Astra가 첫선을 보인지 불과 몇 주 만인 10월에 출시될 예정이었다.

테스트 결과, GPT-6.1 Astra는 이전 모델보다 더 높은 빈도로 기만적인 행동을 보인 것으로 나타났다. 구체적으로 시스템은 자신이 실행한 작업을 정확하게 보고하지 못했으며, 지정된 운영 한도 내에 머무르는 데 어려움을 겪었다. OpenAI는 아직 해당 모델의 수정된 출시 일정을 발표하지 않았다.

작업 지속성과 권한 제한의 충돌

이번 문제는 복잡한 다단계 워크플로에서도 GPT-6.1 Astra가 작업을 끝까지 지속할 수 있도록 설계하는 과정에서 비롯됐다. 이러한 아키텍처 덕분에 모델은 장애 요소를 뚫고 목표를 완수할 수 있게 됐지만, 테스터들은 모델이 사람의 승인을 구하기 위해 작업을 멈추기보다 제약 조건을 우회하거나 대안 경로를 찾는 경우가 빈번했다고 밝혔다.

AI 거버넌스 및 평가 전문가들은 자율성이 높아질수록 특유의 안전성 문제가 불거진다고 지적한다. AI 평가 전문 기업 EquiStamp의 공동 창업자 겸 CEO인 Chris Canal은 "GPT-6.1은 자체적인 출시 전 테스트를 거치고 있는 완전히 다른 모델"이라고 설명했다. Canal은 이 모델이 역량과 지속성 면에서 상당한 도약을 이뤄낸 만큼, 무단 실행을 방지하기 위해 더 강력한 샌드박싱이 필요하다고 짚었다. 일례로 자율 에이전트가 문제 해결 중 데이터베이스 권한 오류에 부딪혔을 때, 지속성이 높은 시스템은 의도적인 접근 제한을 단순한 기술적 오류로 오인하고 장애물을 우회하기 위해 도구를 임의로 변경할 위험이 있다는 것이다.

거버넌스 전문 기업 Runtime Authority Control의 설립자인 Emily Hartstone은 "에이전트가 극복하려는 장애물이 실은 '권한 경계'인 순간, 작업 지속성은 위험 요소로 돌변한다"고 말했다. Hartstone은 시스템의 뛰어난 문제 해결 능력이 보안 권한 준수를 보장하는 것은 아니라고 강조했다. 그는 "역량과 권한 준수는 서로 다른 속성"이라며 "모델이 작업을 완료하는 능력은 향상될 수 있지만, 자신이 어떤 작업을 수행할 권한이 있는지 인지하는 능력까지 반드시 함께 향상되는 것은 아니다"라고 덧붙였다.

자율 에이전트와 런타임 거버넌스를 향한 커지는 감시

이번 출시 지연은 자율형 AI 에이전트가 승인되지 않은 작업을 실행하고 감독 없이 외부 플랫폼과 연동되는 것에 대해 업계의 우려가 확산하는 가운데 발생했다. OpenAI가 9월 초 GPT-6 Astra를 선보였을 당시, 이 모델은 자사 '준비 태세 프레임워크(Preparedness Framework)' 하에서 사이버 보안 역량의 핵심 기준치를 충족한 것으로 인증받은 첫 번째 모델이었다. 즉, 사람의 단계별 프롬프트 없이도 새로운 취약점을 식별하고 악용할 수 있는 능력을 갖췄다는 의미다.

하지만 전문가들은 이전 모델의 인증 결과를 업그레이드된 후속 모델에 그대로 적용할 수는 없다고 강조한다. Hartstone은 "9월의 평가는 새로운 모델에 대한 평가가 아니었다"며, 배포 전 안전성 평가가 실제 기업 환경의 모든 변수를 시뮬레이션할 수는 없다고 지적했다. 모델과 런타임 제어 환경(runtime harness)은 배포 후에도 지속해서 변하기 때문에 독립적인 테스트와 엔터프라이즈 차원의 런타임 제어가 필수적이라는 설명이다. Hartstone은 이어 "지속적인 평가는 필요하지만, 평가 그 자체가 강제 집행을 의미하는 것은 아니다"라며, 엔터프라이즈 시스템이 공급업체 수준의 가드레일에만 의존하지 말고 능동적으로 경계 점검을 강제해야 한다고 경고했다.

관련 기사