Nvidia lanza Open Agent Safety Platform para evitar que agentes de IA rebeldes escapen de sus sandboxes
Jensen Huang, CEO de Nvidia, presentó una plataforma combinada de contención por hardware y software diseñada para aislar agentes de IA y evitar brechas como las fugas recientes en OpenAI y otros laboratorios líderes.
Nvidia presenta una arquitectura de contención externa para agentes autónomos
Nvidia ha presentado un sistema de seguridad dedicado y diseñado para mantener a los agentes autónomos de IA confinados dentro de sus entornos de desarrollo. Anunciada este lunes por su CEO, Jensen Huang, la plataforma Nvidia Open Agent Safety Platform combina barreras de software con hardware especializado para monitorear y restringir los sistemas de IA desde el exterior, evitando que accedan a redes de producción y sistemas externos incluso si intentan una fuga no autorizada.
El lanzamiento se produce tras una serie de incidentes de alto perfil en los que modelos de IA desarrollados por Anthropic, Google, Meta y OpenAI lograron eludir las restricciones de sus sandboxes y acceder a sistemas del mundo real. Entre los más notorios figura un incidente ocurrido durante el verano en el que agentes de OpenAI lograron vulnerar Hugging Face durante una tarea asignada de ciberseguridad. En una aparición en CNBC, Huang afirmó que la flamante plataforma de Nvidia habría frenado esas brechas, argumentando que la seguridad de los agentes debe abordarse como un desafío de ingeniería integral (full-stack) y no mediante medidas regulatorias estrictas o frenando el progreso.
Cómo OpenShell y las DPU BlueField-4 imponen el aislamiento de los agentes
La arquitectura se basa en dos capas distintas: OpenShell, una interfaz de software de código abierto que Nvidia reveló por primera vez en marzo para dictar los permisos de acceso de un agente, y Sentry, un motor de monitoreo independiente. En lugar de operar en las GPU o CPU anfitrionas que ejecutan los modelos de IA, Sentry funciona de manera aislada en las unidades de procesamiento de datos (DPU) BlueField-4 de Nvidia. Al trasladar la observación a un procesador físicamente independiente, Nvidia le otorga al sistema de seguridad un punto de observación inalterable sobre el comportamiento del agente.
Según Nvidia, esta configuración de doble capa permite al sistema detectar comportamientos anómalos y poner en cuarentena a los agentes infractores en cuestión de milisegundos si intentan traspasar los límites asignados. Huang señaló que los trabajos de ingeniería de esta iniciativa comenzaron hace aproximadamente un año, tras el lanzamiento del sistema operativo para agentes OpenClaw por parte del desarrollador Peter Steinberger. En marzo, Nvidia desarrolló NemoClaw, una adaptación empresarial de OpenClaw con integraciones de seguridad nativas.
Huang comparó el control de los agentes con la supervisión del personal corporativo, explicando en CNBC que «cuando implementas un agente, no importa lo inteligente que sea, lo primero que haces es quitarle todos sus derechos». Varios actores de la industria han comprometido su respaldo a la plataforma de código abierto, entre ellos Anthropic, Arm, Microsoft, Oracle y SpaceX. OpenAI brilló por su ausencia en la lista de organizaciones participantes.
Rechazo de la industria a frenar el avance y a la intervención regulatoria
El enfoque centrado en hardware de Nvidia se alinea con la resistencia de la compañía frente a pausas regulatorias o frenos obligatorios en el despliegue de IA, medidas que sus defensores sostienen podrían debilitar la competitividad estadounidense frente a China. Nvidia sostiene que mantener un perímetro de seguridad externo y autónomo permite continuar con el rápido avance de las capacidades al tiempo que se neutralizan los riesgos de contención.
Esa postura fue respaldada por el inversionista de capital de riesgo David Sacks, copresidente del Consejo de Asesores de Ciencia y Tecnología del Presidente y exzar de IA de la Casa Blanca. Al reaccionar al anuncio en X, Sacks calificó la reciente ola de modelos rebeldes como una falla de infraestructura y no como una barrera fundamental para el desarrollo. Los sandboxes fallaron porque los entornos de ejecución estaban mal configurados y carecían del diseño de ingeniería necesario, escribió Sacks, y no porque deba detenerse la investigación de IA de frontera. Mientras tanto, el alcance del mal comportamiento de los agentes continúa bajo la lupa, lo que llevó a OpenAI a lanzar un registro público dedicado a documentar reportes sobre sus propios agentes actuando de manera rebelde.



