AI RACE— A Corrida da IA
Research

Falhas de confiança no Model Context Protocol expõem agentes de IA a ataques entre protocolos

Pesquisadores de segurança descobriram brechas estruturais de confiança no Model Context Protocol (MCP) que permitem a propagação de prompts maliciosos entre agentes internos de IA, afetando sistemas no Google, Rapid7 e outras grandes instituições.

06/10/2026, 05:26
Lỗ hổng tín nhiệm trong Model Context Protocol khiến AI agent đối mặt nguy cơ tấn công chéo giao thức

A rápida implementação de agentes de IA em ambientes corporativos introduziu um ponto cego significativo de segurança. Nos últimos cinco meses, organizações como Google, JP Morgan Chase, Weviate, Rapid7, a direção interministerial digital do governo francês e o governo federal dos EUA viram seus sistemas de agentes serem testados contra uma nova classe de explorações multiagente.

Os ataques exploram premissas arquiteturais de confiança dentro do Model Context Protocol (MCP) — um padrão cada vez mais comum que permite a interação entre aplicações de IA e agentes especializados em redes internas.

Explorando os corredores entre protocolos

As vulnerabilidades foram demonstradas pelo pesquisador de segurança independente Syed Anas Mohiuddin, que mostrou que brechas de confiança no MCP permitem que invasores disseminem instruções prejudiciais de um agente interno para outro.

Diferente das injeções de prompt convencionais que miram diretamente grandes modelos de linguagem (LLMs), essa técnica tem como alvo agentes downstream dedicados a tarefas específicas — como tradução ou análise de dados. Como esses agentes especializados geralmente não possuem salvaguardas robustas e confiam implicitamente nos componentes upstream, prompts maliciosos podem instruir um agente a repassar tarefas ao longo de uma cadeia até disparar ações não autorizadas, incluindo falsificação de solicitação do lado do servidor (SSRF) e exfiltração de dados.

Mohiuddin apelidou essa técnica de "protocol pivoting". Nesses cenários, um invasor obtém acesso inicial por meio de um protocolo (como o MCP), explora suposições implícitas de confiança entre os sistemas e eleva privilégios usando uma estrutura diferente, como o protocolo Agent-to-Agent (A2A) do Google ou o emergente Agent Network Protocol.

Markus Vervier, pesquisador da X41 D-Sec que também desenvolveu exploits voltados ao MCP, observou que a técnica opera fundamentalmente como uma injeção indireta de prompt. Independentemente do termo utilizado, os pesquisadores concordam que o vetor de ataque é inesperado e difícil de combater, já que cada componente individual executa a tarefa designada exatamente como foi projetado.

Falhas críticas encontradas no Google e na Rapid7

A gravidade das falhas varia de acordo com as implementações:

  • Google (Gravidade 8/10): A vulnerabilidade afetou uma caixa de ferramentas MCP para bancos de dados (googleapis/mcp-toolbox). O sistema inicializava seu cliente HTTP sem uma política de CheckRedirect para gerenciar URLs redirecionadas e não validava endereços IP de destino. Um invasor, utilizando um parâmetro de caminho manipulado, poderia fazer com que a toolbox seguisse um redirecionamento para um endpoint interno e executasse requisições em seu nome. O Google solucionou o problema implementando listas de permissão e bloqueio de IPs que rejeitam URLs-base inseguras na inicialização.
  • Rapid7 (CVE-2026-97228): Com uma pontuação de gravidade de 2,7 de 10, essa falha dentro da rede da Rapid7 foi corrigida no mês passado.

Um apelo pelo Zero Trust em sistemas agênticos

Especialistas ressaltam que os problemas de segurança subjacentes são vulnerabilidades conhecidas, como SSRF e injeção, que ressurgiram porque as organizações abandonaram princípios de "zero trust" (confiança zero) na pressa de adotar arquiteturas agênticas. Em muitas configurações atuais, servidores MCP retêm credenciais enquanto tratam entradas de agentes adjacentes como dados verificados.

Douglas McKee, diretor de inteligência de vulnerabilidades da Rapid7, destacou que cada protocolo foi projetado de forma isolada, deixando as conexões entre agentes desprovidas de monitoramento. McKee enfatizou que qualquer dado repassado de um LLM para uma ferramenta ou agente secundário precisa ser tratado com o mesmo nível de escrutínio que uma entrada não autenticada enviada por um desconhecido na internet pública.

Notícias relacionadas