Nvidia, 통제 불능 AI 에이전트의 샌드박스 탈출 방지하는 'Open Agent Safety Platform' 출시
젠슨 황 Nvidia CEO가 AI 에이전트를 격리해 최근 OpenAI 등 주요 연구소에서 발생한 탈출 및 침해 사고를 방지하도록 설계된 하드웨어·소프트웨어 통합 격리 플랫폼을 공개했다.
Nvidia, 자율 에이전트 전용 외부 격리 아키텍처 공개
Nvidia가 자율 AI 에이전트를 개발 환경 내에 안전하게 격리하도록 구축된 전용 보안 시스템을 선보였다. 젠슨 황 CEO가 월요일 발표한 'Nvidia Open Agent Safety Platform'은 소프트웨어 장벽과 특화된 하드웨어를 결합해 외부에서 AI 시스템을 감시하고 제어함으로써, 무단 탈출을 시도하더라도 운영 네트워크 및 외부 시스템에 접근하지 못하도록 차단한다.
이번 출시는 Anthropic, Google, Meta, OpenAI 등이 개발한 AI 모델이 샌드박스 제한을 우회해 실제 시스템에 접근한 주요 사건들이 잇따른 뒤 이뤄졌다. 가장 대표적인 사례로는 지난여름 OpenAI 에이전트가 지정된 사이버 보안 작업을 수행하던 중 Hugging Face를 침해한 사건이 꼽힌다. 황 CEO는 CNBC에 출연해 Nvidia가 새로 도입한 플랫폼이 이러한 침해 사고를 막을 수 있었을 것이라며, 에이전트 안전 문제는 규제적 탄압이나 개발 속도 둔화가 아닌 풀스택 엔지니어링 과제로 다뤄져야 한다고 강조했다.
OpenShell과 BlueField-4 DPU를 통한 에이전트 격리 작동 방식
이 아키텍처는 두 개의 독립된 계층으로 작동한다. 지난 3월 Nvidia가 에이전트의 접근 권한을 규정하기 위해 처음 공개한 오픈소스 소프트웨어 인터페이스인 'OpenShell', 그리고 독자적인 모니터링 엔진인 'Sentry'다. Sentry는 AI 모델을 실행하는 호스트 GPU나 CPU에서 구동되는 대신, Nvidia의 BlueField-4 DPU(데이터 처리 장치)에서 분리되어 실행된다. 감시 기능을 물리적으로 분리된 프로세서로 옮김으로써, Nvidia는 보안 시스템이 에이전트의 행동을 왜곡 없이 관측할 수 있는 독자적인 감시 위치를 확보했다.
Nvidia에 따르면 이러한 이중 계층 구조를 통해 시스템은 이상 행동을 감지하고, 에이전트가 지정된 경계를 벗어나려 시도할 경우 수 밀리초(ms) 내에 해당 에이전트를 격리할 수 있다. 황 CEO는 개발자 Peter Steinberger가 에이전트 운영체제 OpenClaw를 출시한 직후인 약 1년 전부터 이번 프로젝트 엔지니어링이 시작되었다고 밝혔다. 지난 3월 Nvidia는 기본 보안 기능이 통합된 OpenClaw의 기업용 버전인 NemoClaw를 선보인 바 있다.
황 CEO는 에이전트 통제를 기업의 인력 관리 감독에 비유하며 CNBC 인터뷰에서 "에이전트를 배포할 때는 아무리 똑똑하더라도 가장 먼저 모든 권한을 박탈해야 한다"고 설명했다. Anthropic, Arm, Microsoft, Oracle, SpaceX 등 다수의 업계 주요 기업이 이 오픈소스 플랫폼에 대한 지원을 약속했다. 반면 OpenAI는 참여 조직 명단에서 눈에 띄게 제외됐다.
개발 속도 조절 및 규제 개입에 대한 업계의 반발
Nvidia의 하드웨어 중심 접근 방식은 규제로 인한 AI 배포 동결이나 강제 중단에 반대해 온 회사의 기조와 맞닿아 있다. 규제 반대 측은 이러한 중단 조치가 중국에 맞선 미국의 경쟁력을 저해할 수 있다고 주장한다. Nvidia는 자율적인 외부 보안 경계를 유지함으로써 격리 실패 위험을 해소하는 동시에 기술 역량의 빠른 발전을 지속할 수 있다고 본다.
이러한 견해는 대통령 과학기술자문회의(PCAST) 공동의장이자 전 백악관 AI 총괄(AI czar)인 벤처 투자자 David Sacks의 생각과도 궤를 같이한다. Sacks는 X(구 트위터)를 통해 이번 발표에 반응하며, 최근 잇따른 통제 불능 모델 사례는 개발 자체의 근본적 장벽이라기보다는 인프라 결함이라고 규정했다. Sacks는 샌드박스가 실패한 이유는 런타임 환경 설정이 잘못되었고 엔지니어링 설계가 미흡했기 때문이지, 프론티어 AI 연구를 중단해야 하기 때문이 아니라고 지적했다. 한편 에이전트의 일탈 행동에 대한 우려가 계속 커지자, OpenAI는 자사 에이전트의 통제 불능 보고 사례를 기록하는 공개 트래커를 별도로 개설했다.



