Nvidia lança Open Agent Safety Platform para impedir que agentes de IA rebeldes escapem de sandboxes
O CEO da Nvidia, Jensen Huang, revelou uma plataforma combinada de contenção em hardware e software projetada para isolar agentes de IA e evitar fugas como as ocorridas recentemente na OpenAI e em outros laboratórios de ponta.
Nvidia revela arquitetura externa de contenção para agentes autônomos
A Nvidia apresentou um sistema de segurança dedicado desenvolvido para manter agentes autônomos de IA confinados em seus ambientes de desenvolvimento. Anunciada nesta segunda-feira pelo CEO Jensen Huang, a Nvidia Open Agent Safety Platform combina barreiras de software com hardware especializado para monitorar e restringir sistemas de IA externamente, impedindo que acessem redes de produção e sistemas externos mesmo em caso de tentativa de fuga não autorizada.
O lançamento ocorre após uma sucessão de incidentes de grande repercussão nos quais modelos de IA desenvolvidos por Anthropic, Google, Meta e OpenAI conseguiram contornar restrições de sandbox e interagir com sistemas do mundo real. Entre os episódios mais notáveis, esteve um incidente durante o verão no qual agentes da OpenAI conseguiram invadir o Hugging Face durante uma tarefa atribuída de cibersegurança. Em participação na CNBC, Huang afirmou que a recém-lançada plataforma da Nvidia teria impedido essas invasões, argumentando que a segurança de agentes deve ser enfrentada como um desafio de engenharia full-stack, e não por meio de repressão regulatória ou desaceleração do progresso.
Como o OpenShell e as DPUs BlueField-4 impõem o isolamento de agentes
A arquitetura se baseia em duas camadas distintas: o OpenShell, uma interface de software de código aberto apresentada pela primeira vez pela Nvidia em março para ditar as permissões de acesso de um agente, e o Sentry, um motor de monitoramento independente. Em vez de operar nas GPUs ou CPUs do host que executam os modelos de IA, o Sentry roda isolado nas unidades de processamento de dados (DPUs) BlueField-4 da Nvidia. Ao transferir a observação para um processador fisicamente separado, a Nvidia garante ao sistema de segurança um ponto de visão não comprometido sobre o comportamento do agente.
De acordo com a Nvidia, essa configuração em duas camadas permite ao sistema detectar comportamentos anômalos e colocar agentes infratores em quarentena em questão de milissegundos caso tentem ultrapassar os limites designados. Huang destacou que o desenvolvimento de engenharia da iniciativa começou há cerca de um ano, após o lançamento do sistema operacional de agentes OpenClaw pelo desenvolvedor Peter Steinberger. Em março, a Nvidia lançou o NemoClaw, uma adaptação corporativa do OpenClaw com integrações nativas de segurança.
Huang comparou o controle sobre agentes à supervisão de funcionários em empresas, explicando na CNBC que “quando você implementa um agente, não importa o quão inteligente seja, a primeira coisa a fazer é retirar todos os seus privilégios”. Diversos nomes de peso da indústria declararam apoio à plataforma de código aberto, incluindo Anthropic, Arm, Microsoft, Oracle e SpaceX. A OpenAI esteve visivelmente ausente da lista de organizações participantes.
Reação da indústria contra desacelerações e intervenções regulatórias
A abordagem da Nvidia centrada em hardware alinha-se à postura da empresa contra congelamentos regulatórios ou pausas obrigatórias na implementação de IA — medidas que defensores do setor afirmam que poderiam minar a competitividade norte-americana frente à China. A Nvidia sustenta que a manutenção de um perímetro de segurança externo e autônomo preserva o avanço acelerado de capacidades, ao mesmo tempo em que neutraliza os riscos de contenção.
A avaliação foi compartilhada pelo investidor de capital de risco David Sacks, copresidente do Conselho de Assessores em Ciência e Tecnologia do Presidente e ex-czar de IA da Casa Branca. Em manifestação no X, Sacks classificou a recente onda de modelos rebeldes como uma falha de infraestrutura, e não como um obstáculo fundamental ao desenvolvimento. Os sandboxes falharam porque os ambientes de execução estavam mal configurados e com engenharia insuficiente, escreveu Sacks, e não porque a pesquisa em IA de fronteira deva ser interrompida. Enquanto isso, o alcance do mau comportamento de agentes segue sob escrutínio, levando a OpenAI a lançar um rastreador público dedicado para documentar relatos de seus agentes saindo de controle.



