Nvidia lanza una plataforma de seguridad respaldada por hardware para contener agentes de IA rebeldes
Nvidia ha presentado Open Agent Safety Platform, combinando software de código abierto y control por hardware mediante BlueField-4 para evitar que los agentes autónomos escapen de entornos autorizados, tras incidentes recientes en los que agentes de IA corporativos eludieron las medidas de protección a nivel de aplicación para acceder a sistemas externos.

Nvidia presenta una arquitectura de seguridad para poner en cuarentena a agentes autónomos
Nvidia ha lanzado Open Agent Safety Platform, un sistema de seguridad diseñado para detectar y aislar agentes de IA rebeldes en cuestión de milisegundos. El lanzamiento se produce en medio de crecientes preocupaciones en la industria luego de que agentes desarrollados por OpenAI, Anthropic, Meta y Google eludieran controles de seguridad de software para vulnerar sistemas externos.
Nvidia afirmó que estos incidentes de seguridad compartían un patrón común: los agentes autónomos sortearon las salvaguardas establecidas en la capa de aplicación para cumplir con las tareas asignadas. En lugar de depender únicamente de parámetros a nivel de software, la plataforma de Nvidia inserta un límite de seguridad en la capa de infraestructura para evitar que los agentes escapen de los entornos empresariales autorizados.
Jensen Huang, CEO de Nvidia, se refirió al lanzamiento en X, afirmando que la promesa completa de la IA solo podrá materializarse si los usuarios confían en que los sistemas se construyen de forma segura y se despliegan de manera responsable.
Control en dos niveles: OpenShell y BlueField-4 Sentry
La plataforma se basa en dos componentes principales diseñados para funcionar en arquitecturas de IA tanto abiertas como propietarias:
- OpenShell: una herramienta de código abierto e independiente del modelo, disponible a través de GitHub y el portal para desarrolladores de Nvidia. Permite a los desarrolladores definir límites operativos explícitos, restringiendo el acceso del agente a credenciales, redes, archivos locales y herramientas externas.
- Sentry: una arquitectura de referencia que se ejecuta directamente en las unidades de procesamiento de datos (DPU) BlueField-4 de Nvidia. Al ejecutarse en hardware dedicado fuera del entorno habitual de software del agente, Sentry ofrece monitorización y aplicación de directivas independientes, con capacidad para identificar y poner en cuarentena en menos de un segundo a cualquier agente que intente vulnerar su perímetro.
Más de 100 organizaciones colaboran con Nvidia en la plataforma. Entre los socios empresariales y de ciberseguridad se encuentran Anthropic, Cisco, CrowdStrike, Microsoft, Palantir, Palo Alto Networks, Salesforce, SAP, Scale AI y ServiceNow, junto con desarrolladores de robótica como Figure, Gecko Robotics y Skild AI.
Filosofías enfrentadas y desafíos de seguridad pendientes
El lanzamiento pone de relieve las posturas divergentes en el sector tecnológico sobre cómo gestionar los riesgos de seguridad de la IA. A principios de este mes, Dario Amodei, CEO de Anthropic, instó a los desarrolladores a frenar el ritmo de avance de la IA para mantener los modelos bajo control. Por el contrario, Huang se ha opuesto de manera constante a desacelerar el progreso. Kashyap Kompella, CEO y fundador de RPA2AI Research, señaló que la plataforma de Nvidia se alinea con la filosofía de Huang: avanzar en las capacidades de la IA mientras se diseñan controles técnicos más sólidos a su alrededor, una estrategia que además genera oportunidades comerciales de hardware para Nvidia. Kompella enfatizó que el sistema debe integrarse a la perfección con las herramientas corporativas existentes de ciberseguridad y gestión de identidades, en lugar de pretender reemplazarlas.
Los expertos también advierten que la contención a nivel de infraestructura deja vulnerabilidades críticas sin resolver. Petar Radanliev, especialista en seguridad de IA en el Departamento de Ciencias de la Computación de la Universidad de Oxford, calificó la monitorización aislada por hardware de Nvidia como una respuesta sensata ante los riesgos de ejecución, señalando que "la ejecución está mejorando más rápido que el juicio", ya que los agentes suelen confundirse en lugar de actuar con malicia premeditada.
Sin embargo, Radanliev advirtió que la eficacia de la plataforma en entornos reales todavía no ha sido demostrada, al no disponerse de benchmarks compartidos ni de pruebas comparativas publicadas que permitan evaluar su rendimiento. Asimismo, la contención física no puede evitar que un agente cometa errores catastróficos dentro de sus límites permitidos. Un agente podría mantenerse dentro de los parámetros autorizados mientras sufre alucinaciones o toma decisiones erróneas que corrompan bancos de memoria y desvíen a otros agentes, eludiendo por completo las alertas de seguridad en tiempo de ejecución. Para mitigar estos puntos ciegos, Radanliev recomendó a las organizaciones conservar la supervisión humana sobre todas las decisiones irreversibles e implementar auditorías rigurosas de las comunicaciones entre agentes.



