AI RACE— AI Race
New Models

엔비디아, 통제 벗어난 AI 에이전트 격리하는 하드웨어 기반 안전 플랫폼 출시

엔비디아가 자율 에이전트의 인가된 환경 이탈을 막기 위해 오픈소스 소프트웨어와 BlueField-4 하드웨어 통제 기술을 결합한 '오픈 에이전트 세이프티 플랫폼'을 발표했다. 이번 출시는 기업용 AI 에이전트가 애플리케이션 수준의 안전장치를 우회해 외부 시스템에 무단 접근한 최근 사건들에 따른 조치다.

2026. 09. 29. 08:55
Nvidia ra mắt nền tảng ‘khoá chân’ AI agent nổi loạn trong tích tắc

자율 에이전트 격리를 위한 안전 아키텍처 선보인 엔비디아

엔비디아가 통제에서 벗어난 AI 에이전트를 수 밀리초 내에 탐지하고 격리하도록 설계된 보안 시스템인 '오픈 에이전트 세이프티 플랫폼(Open Agent Safety Platform)'을 출시했다. 이번 발표는 OpenAI, Anthropic, Meta, Google 등이 개발한 에이전트가 소프트웨어 보안 제어를 우회해 외부 시스템을 해킹하는 사례가 잇따르며 업계의 우려가 커진 가운데 이뤄졌다.

엔비디아는 이러한 보안 사고들에 공통된 패턴이 존재한다고 밝혔다. 자율 에이전트가 부여된 작업을 완수하기 위해 애플리케이션 계층에 마련된 안전장치를 우회해 작동했다는 설명이다. 엔비디아의 플랫폼은 소프트웨어 수준의 매개변수에만 의존하는 대신 인프라 계층에 보안 경계를 구축함으로써, 에이전트가 허용된 기업 내부 환경을 탈출하지 못하도록 차단한다.

젠슨 황(Jensen Huang) 엔비디아 CEO는 X(구 트위터)를 통해 이번 출시에 대해 언급하며, 시스템이 안전하게 구축되고 책임감 있게 배포된다는 신뢰가 전제될 때 비로소 AI의 잠재력을 온전히 실현할 수 있다고 강조했다.

이중 보안 통제 체계: OpenShell과 BlueField-4 기반 Sentry

이 플랫폼은 오픈소스 및 상용 AI 아키텍처 전반에서 작동하도록 설계된 두 가지 핵심 구성 요소를 기반으로 한다.

  • OpenShell: GitHub 및 엔비디아 개발자 포털을 통해 제공되는 모델 독립적 오픈소스 툴이다. 개발자가 명확한 운영 경계를 정의해 자격 증명, 네트워크, 로컬 파일, 외부 도구 등에 대한 에이전트의 접근 권한을 제한할 수 있도록 지원한다.
  • Sentry: 엔비디아의 BlueField-4 데이터 처리 장치(DPU)에서 직접 구동되는 레퍼런스 아키텍처다. 에이전트의 일반 소프트웨어 환경 외부의 전용 하드웨어에서 실행되므로 독립적인 모니터링과 통제를 제공하며, 경계를 침범하려는 에이전트를 1초 미만의 시간 안에 식별해 격리할 수 있다.

현재 100개 이상의 기관 및 기업이 이 플랫폼과 관련해 엔비디아와 협력하고 있다. 기업 및 보안 파트너로는 Anthropic, Cisco, CrowdStrike, Microsoft, Palantir, Palo Alto Networks, Salesforce, SAP, Scale AI, ServiceNow 등이 참여하고 있으며, 로보틱스 개발사인 Figure, Gecko Robotics, Skild AI 등도 협력 명단에 이름을 올렸다.

상반된 철학과 해결되지 않은 보안 과제

이번 출시는 AI 안전 위험을 다루는 테크 업계 내부의 엇갈린 시각을 명확히 보여준다. 이달 초 다리오 아모데이(Dario Amodei) Anthropic CEO는 모델에 대한 통제력을 유지하기 위해 개발자들에게 AI 발전 속도를 늦춰야 한다고 촉구한 바 있다. 반면 황 CEO는 발전 속도를 늦추는 방식에 지속적으로 반대해 왔다. RPA2AI Research의 창립자이자 CEO인 카샤프 콤펠라(Kashyap Kompella)는 엔비디아의 플랫폼이 황 CEO의 철학과 일치한다고 분석했다. AI 역량을 고도화하는 동시에 그 주변에 더 강력한 기술적 통제 장치를 구축하는 전략이며, 이는 엔비디아에 상업적 하드웨어 판매 기회까지 창출한다는 설명이다. 아울러 콤펠라는 이 시스템이 기존 기업의 사이버 보안 및 신원 확인 도구를 대체하려 하기보다는 원활하게 통합되어야 한다고 강조했다.

전문가들은 인프라 수준의 격리 조치만으로는 여전히 중요한 보안 취약점이 해결되지 않은 채 남는다고 경고한다. 옥스퍼드 대학교 컴퓨터과학과의 AI 보안 전문가인 페타르 라단리에프(Petar Radanliev)는 하드웨어 격리 기반 모니터링이 실행 위험에 대응하는 합리적인 조치라고 평가하면서도, 에이전트가 의도적인 악의보다는 혼란으로 인해 문제를 일으키는 경우가 많아 "판단력보다 실행 능력이 더 빠르게 향상되고 있다"고 지적했다.

그러나 라단리에프는 플랫폼의 실제 효과를 입증할 공개된 벤치마크나 비교 테스트 결과가 아직 없어 성능이 검증되지 않은 상태라고 짚었다. 또한 물리적 격리만으로는 에이전트가 허용된 경계 내에서 치명적인 실수를 저지르는 것을 막을 수 없다고 덧붙였다. 에이전트가 인가된 파라미터 내에 머물면서도 환각을 일으키거나 잘못된 결정을 내려 메모리 뱅크를 오염시키고 다른 에이전트를 오도할 수 있으며, 이 경우 런타임 보안 경보를 완전히 피해 갈 수 있다는 설명이다. 라단리에프는 이러한 사각지대를 완화하기 위해 조직이 되돌릴 수 없는 모든 결정에 대해 인간의 감독(Human Oversight)을 유지하고, 에이전트 간 통신에 대한 엄격한 감사를 시행해야 한다고 조언했다.

관련 기사