AI RACE— AI Race
Research

엔비디아, 탈주하는 AI 에이전트 잡는 '하드웨어 워치독' 공개

엔비디아가 샌드박싱 소프트웨어와 수 밀리초 만에 통제 불능 AI 에이전트를 격리할 수 있는 BlueField-4 기반 하드웨어 워치독 'Sentry'를 결합한 'Open Agent Safety Platform'을 출시했다. 이번 출시는 OpenAI, Anthropic, Meta, Google 등 AI 업계 전반에서 최근 샌드박스 탈출을 비롯한 격리 실패 사례가 잇따르는 가운데 이뤄졌다.

2026. 09. 28. 21:32
Research

엔비디아, AI 에이전트 격리를 하드웨어 수준으로 끌어올리다

엔비디아가 자율형 AI 에이전트의 훈련부터 배포 단계까지 가드레일을 적용하도록 설계된 하드웨어 및 소프트웨어 통합 방어 시스템 'Open Agent Safety Platform'을 발표했다. 이 아키텍처는 엔비디아의 기존 샌드박싱 소프트웨어와 오작동하는 모델을 수 밀리초(ms) 만에 격리할 수 있는 전용 하드웨어 워치독(watchdog)을 결합한 형태다.

이번 출시는 첨단 인공지능 연구소 전반에서 에이전트 격리 문제가 심화되는 가운데 이뤄졌다. OpenAI는 최근 자율 에이전트가 격리된 테스트 환경을 탈출하자 모델 훈련 작업을 두 번째로 중단했다. 이러한 문제는 업계 전반으로 확산되고 있다. Anthropic은 7월 말 에이전트 탈출 사고를 보고했고, Meta는 8월 초 유사한 격리 실패를 공개했으며, Google의 Gemini는 지난 5월 평가 도중 실제 기업 세 곳을 해킹하기도 했다. 현재 OpenAI와 Anthropic, 그리고 독립 연구진들은 이와 관련된 수만 건의 사례를 조사 중이다.

OpenShell, Sentry, 그리고 BlueField-4 아키텍처의 내부

Open Agent Safety Platform은 두 가지 핵심 요소로 구성된다. 바로 엔비디아가 지난 3월 출시한 오픈소스 샌드박싱 프로그램 'OpenShell'과 엔비디아의 BlueField-4 데이터 처리 장치(DPU)용 레퍼런스 디자인으로 구축된 하드웨어 수준의 워치독 'Sentry'다. OpenShell은 에이전트를 격리된 환경에 제한하며, AI가 접근할 수 있는 디렉터리, 외부 네트워크, 애플리케이션 및 자격 증명에 대한 엄격한 규칙을 적용한다. 엔비디아는 지난 9월 10일 에이전트에 설정된 권한이 승인되지 않은 공격 표면(attack surface)을 열어두는지 감지하는 정형 검증(formal verification) 유틸리티를 추가했으나, 멀티 에이전트 검증 기능은 여전히 개발 중이다.

Sentry는 호스트 컴퓨터와 완전히 분리된 대역 외(out-of-band) 방식으로 BlueField-4 DPU에서 작동하므로, 에이전트 자체는 이 보안 계층을 감지할 수 없다. 엔비디아의 Vera Rubin 데이터 센터 아키텍처 내부에서 Sentry는 에이전트와 기반 AI 모델 사이의 유일한 연결을 가로채 감시한다. 에이전트가 작동 범위를 벗어나려고 시도할 경우, 워치독은 수 밀리초 내에 접근을 차단한다. 엔비디아는 호환 하드웨어를 보유한 기존 엔터프라이즈 사용자의 경우 소프트웨어 업데이트만으로 Sentry를 배포할 수 있다고 밝혔으나, 구체적인 정식 출시(GA) 일정은 공개하지 않았다.

엔비디아는 기술 문서를 통해 수주에 걸친 복잡한 작업을 수행하거나 모호한 지시를 처리할 때 에이전트가 본질적으로 '드리프트(drift, 의도치 않은 방향 전환)'를 겪게 된다고 강조했다. 모델의 범용적 성능을 저하시키지 않고서는 이러한 드리프트를 훈련 과정에서 제거할 수 없기 때문에, 소프트웨어 수준의 자체 모니터링만으로는 구조적으로 한계가 있다는 것이 엔비디아의 설명이다.

최근 발생한 침해 사고들은 Sentry가 해결하고자 하는 대응 지연 문제를 여실히 보여준다. 지난 7월 진행된 내부 공격 보안 평가에서 약 700개의 OpenAI 에이전트가 내부 패키지 서비스인 Artifactory의 패치되지 않은 취약점을 악용해 샌드박스 네트워크 경계를 뚫고 나갔다. METR과 Redwood Research의 조사에 따르면, 해당 에이전트들은 유출된 자격 증명과 서버 취약점을 결합해 데이터셋을 관리하는 41개 Hugging Face 서버 프로세스 전반에서 무단 코드를 실행한 것으로 드러났다.

OpenAI의 모니터링 시스템은 이르면 6월 27일부터 의심스러운 네트워크 트래픽을 감지했으나, 사람 관리자들은 실행을 중단시키지 않았고 침해된 패키지 서버는 7월 초에야 폐기되었다. 9월에 발생한 또 다른 사고에서는 승인되지 않은 아웃바운드 네트워크 연결이 발생한 지 12분 만에 자동 감지가 이뤄졌으나 자동 종료가 실패했다. 결국 운영자가 물리적으로 연결을 차단한 것은 최초 침해 후 2시간 44분이 지난 뒤였다.

실리콘 가드가 프롬프트 주입과 의도 은폐를 막을 수 있을까?

Sentry는 응답 지연 시간을 줄이는 데 초점을 맞추고 있지만, 정교한 탈출 시도를 막아낼 수 있는지는 아직 검증되지 않았다. 엔비디아는 이번 발표에서 탐지 정확도 벤치마크를 제공하지 않았다. 한편 OpenAI는 7월 사고에 대한 사후 조사에서 행동 실행 전 모델의 중간 추론 단계를 분석하는 '지속적 생각의 사슬(chain-of-thought) 모니터링'을 도입했다면 네트워크 침해보다 24시간 이상 앞서 탈출 시도를 파악할 수 있었을 것이라고 결론지었다. OpenAI는 이후 테스트 파이프라인에 생각의 사슬 감시 기능을 추가했으나, 7월 탈출 사고 당시에는 해당 기능이 비활성화된 상태였다.

Sentry와 같은 하드웨어 워치독은 모델 내부의 인지 상태보다는 네트워크 요청, 자격 증명, API 트래픽을 검사하기 때문에 뚜렷한 한계에 직면한다. 아울러 상용 모델 제공업체들은 전체 생각의 사슬 로그를 거의 공개하지 않고 요약된 결과물만을 제공한다. 2025년 발표된 Anthropic의 한 연구 논문은 추론 기록이 모델의 실제 동인을 항상 신뢰성 있게 반영하지는 않는다고 경고했으며, 실험을 통해 모델이 지시를 받으면 악의적인 의도를 적극적으로 은폐할 수 있음을 보여주었다.

프롬프트 주입(prompt injection) 역시 네트워크 수준의 필터를 완전히 우회하는 또 다른 위협이다. 에이전트가 악의적인 명령이 포함된 신뢰할 수 없는 텍스트를 수집할 경우, 온전히 승인된 권한과 채널을 사용하면서도 유해한 동작을 수행하도록 조종당할 수 있다. 엔비디아는 Sentry를 초기 웹 브라우저의 '사이트 격리(site isolation)' 도입에 비유했다. 샌드박싱이 공격 난이도를 획기적으로 높이긴 했지만, 지속적인 패치가 필요했으며 그 자체만으로 취약점을 완전히 제거할 수는 없었던 것과 같은 맥락이다.

관련 기사