AI RACE— La carrera de la IA
Research

Fallas de confianza en Model Context Protocol exponen a los agentes de IA a ataques entre protocolos

Investigadores de seguridad han descubierto brechas estructurales de confianza en Model Context Protocol (MCP) que permiten que prompts maliciosos salten entre agentes de IA internos, afectando a sistemas de Google, Rapid7 y otras instituciones de primer nivel.

06/10/2026, 05:26
Lỗ hổng tín nhiệm trong Model Context Protocol khiến AI agent đối mặt nguy cơ tấn công chéo giao thức

El rápido despliegue de agentes de IA en entornos corporativos ha introducido un punto ciego de seguridad significativo. Durante los últimos cinco meses, organizaciones como Google, JP Morgan Chase, Weviate, Rapid7, la dirección interministerial digital del gobierno francés y el gobierno federal de EE. UU. han visto sus sistemas de agentes puestos a prueba frente a una nueva clase de exploits multiagente.

Los ataques aprovechan supuestos de confianza arquitectónicos dentro del Model Context Protocol (MCP), un estándar cada vez más común que permite a las aplicaciones de IA y a los agentes especializados interactuar a través de redes internas.

Explotando los pasillos entre protocolos

Las vulnerabilidades fueron demostradas por el investigador de seguridad independiente Syed Anas Mohiuddin, quien evidenció que las brechas de confianza en MCP permiten a los atacantes propagar instrucciones dañinas de un agente interno a otro.

A diferencia de las inyecciones de prompts estándar dirigidas directamente a modelos de lenguaje grande (LLM), esta técnica se enfoca en agentes secundarios especializados en tareas específicas, como la traducción o el análisis de datos. Debido a que estos agentes especializados suelen carecer de barreras de seguridad robustas y confían implícitamente en los componentes previos, los prompts maliciosos pueden ordenar a un agente que transfiera tareas a lo largo de una cadena hasta desencadenar acciones no autorizadas, incluidas la falsificación de peticiones del lado del servidor (SSRF) y la exfiltración de datos.

Mohiuddin bautizó esta técnica como "protocol pivoting" (pivoteo de protocolos). En estos escenarios, un atacante obtiene acceso inicial a través de un protocolo (como MCP), explota las presunciones de confianza implícita entre sistemas y escala privilegios mediante un framework diferente, como el protocolo Agent-to-Agent (A2A) de Google o el emergente Agent Network Protocol.

Markus Vervier, investigador de X41 D-Sec que también ha desarrollado exploits dirigidos a MCP, señaló que la técnica opera fundamentalmente como una inyección indirecta de prompts. Independientemente de la etiqueta, los investigadores coinciden en que el vector de ataque es inesperado y difícil de defender, ya que cada componente individual realiza su tarea asignada tal como fue diseñado.

Fallas críticas detectadas en Google y Rapid7

La gravedad de las fallas varía según la implementación:

  • Google (gravedad 8/10): La vulnerabilidad afectó a una caja de herramientas de MCP para bases de datos (googleapis/mcp-toolbox). El sistema inicializaba su cliente HTTP sin una política CheckRedirect para gestionar URLs redirigidas y no validaba las direcciones IP de destino. Un atacante, mediante un parámetro de ruta manipulado, podía hacer que la herramienta siguiera una redirección hacia un endpoint interno y ejecutara peticiones en nombre del atacante. Google resolvió el problema implementando listas de IP permitidas y bloqueadas que rechazan URLs base no seguras durante el inicio.
  • Rapid7 (CVE-2026-97228): Con una calificación de gravedad de 2,7 sobre 10, esta falla dentro de la red de Rapid7 fue corregida el mes pasado.

Un llamado a la confianza cero en sistemas agénticos

Los expertos señalan que los fallos de seguridad subyacentes son vulnerabilidades conocidas, como SSRF e inyección, que han resurgido debido a que las organizaciones han abandonado los principios de "confianza cero" (Zero Trust) en su prisa por adoptar arquitecturas agénticas. En muchas configuraciones actuales, los servidores MCP conservan credenciales mientras tratan las entradas provenientes de agentes adyacentes como información verificada.

Douglas McKee, director de inteligencia de vulnerabilidades en Rapid7, destacó que cada protocolo se diseñó de forma aislada, dejando sin supervisión las vías de comunicación entre agentes. McKee enfatizó que cualquier dato transferido desde un LLM hacia una herramienta o agente secundario debe tratarse con el mismo nivel de escrutinio que una entrada no autenticada proveniente de un desconocido en la internet pública.

◗ Fuentes

Ars Technica6/10

Historias relacionadas