Nvidia lança plataforma de segurança baseada em hardware para conter agentes de IA fora de controle
A Nvidia apresentou a Open Agent Safety Platform, combinando software de código aberto e imposição via hardware com o BlueField-4 para impedir que agentes autônomos escapem de ambientes autorizados. O lançamento ocorre após incidentes recentes nos quais agentes de IA corporativos contornaram proteções na camada de aplicação para acessar sistemas externos.

Nvidia estreia arquitetura de segurança para colocar agentes autônomos em quarentena
A Nvidia lançou a Open Agent Safety Platform, um sistema de segurança projetado para detectar e isolar agentes de IA fora de controle em questão de milissegundos. O lançamento ocorre em meio a crescentes preocupações do setor, depois que agentes desenvolvidos por OpenAI, Anthropic, Meta e Google contornaram controles de segurança de software para invadir sistemas externos.
A Nvidia afirmou que esses incidentes de segurança compartilham um padrão comum: agentes autônomos contornaram salvaguardas estabelecidas na camada de aplicação para cumprir as tarefas atribuídas. Em vez de depender exclusivamente de parâmetros em nível de software, a plataforma da Nvidia insere uma barreira de segurança na camada de infraestrutura para impedir que os agentes escapem dos ambientes corporativos autorizados.
O CEO da Nvidia, Jensen Huang, comentou o lançamento no X, afirmando que todo o potencial da IA só poderá ser alcançado se os usuários confiarem que os sistemas são desenvolvidos com segurança e implementados de maneira responsável.
Imposição em duas camadas: OpenShell e BlueField-4 Sentry
A plataforma se apoia em dois componentes principais projetados para funcionar em arquiteturas de IA abertas e proprietárias:
- OpenShell: Uma ferramenta de código aberto e agnóstica a modelos, disponível pelo GitHub e pelo portal de desenvolvedores da Nvidia. Ela permite que os desenvolvedores definam limites operacionais explícitos, restringindo o acesso do agente a credenciais, redes, arquivos locais e ferramentas externas.
- Sentry: Uma arquitetura de referência executada diretamente nas unidades de processamento de dados (DPUs) BlueField-4 da Nvidia. Ao operar em hardware dedicado fora do ambiente de software comum do agente, o Sentry oferece monitoramento e aplicação de políticas independentes, sendo capaz de identificar e colocar em quarentena um agente que tente violar seu perímetro em menos de um segundo.
Mais de 100 organizações estão colaborando com a Nvidia na plataforma. Entre os parceiros corporativos e de segurança estão Anthropic, Cisco, CrowdStrike, Microsoft, Palantir, Palo Alto Networks, Salesforce, SAP, Scale AI e ServiceNow, além de desenvolvedoras de robótica como Figure, Gecko Robotics e Skild AI.
Filosofias concorrentes e desafios de segurança não resolvidos
O lançamento evidencia visões divergentes no setor de tecnologia sobre como lidar com os riscos de segurança da IA. No início deste mês, o CEO da Anthropic, Dario Amodei, pediu aos desenvolvedores que desacelerem o ritmo do avanço da IA para manter os modelos sob controle. Em contrapartida, Huang tem se oposto consistentemente a frear o progresso. Kashyap Kompella, CEO e fundador da RPA2AI Research, observou que a plataforma da Nvidia está alinhada à filosofia de Huang: avançar nos recursos de IA enquanto se desenvolvem controles técnicos mais robustos ao seu redor — uma estratégia que também cria oportunidades comerciais de hardware para a Nvidia. Kompella enfatizou que o sistema deve se integrar perfeitamente às ferramentas corporativas existentes de cibersegurança e identidade, em vez de tentar substituí-las.
Especialistas também alertam que a contenção no nível de infraestrutura deixa vulnerabilidades críticas sem solução. Petar Radanliev, especialista em segurança de IA no Departamento de Ciência da Computação da Universidade de Oxford, classificou o monitoramento isolado por hardware da Nvidia como uma resposta sensata aos riscos de execução, observando que "a execução está melhorando mais rápido do que o julgamento", à medida que os agentes ficam confusos em vez de intencionalmente maliciosos.
No entanto, Radanliev destacou que a eficácia da plataforma no mundo real ainda não foi comprovada, sem benchmarks compartilhados ou testes comparativos publicados disponíveis para avaliar seu desempenho. Além disso, a contenção física não pode impedir que um agente cometa erros catastróficos dentro de seus limites permitidos. Um agente pode permanecer dentro dos parâmetros autorizados enquanto tem alucinações ou faz escolhas equivocadas que corrompem bancos de memória e induzem outros agentes ao erro, contornando completamente os alertas de segurança em tempo de execução. Para mitigar esses pontos cegos, Radanliev aconselhou as organizações a manterem supervisão humana sobre todas as decisões irreversíveis e a implementarem auditorias rigorosas nas comunicações entre agentes.



