Un nuevo marco de ataque demuestra que los agentes construidos en el Protocolo de Contexto de Modelo pueden ser secuestrados a través de metadatos de herramientas envenenadas, logrando una tasa de invocación de herramientas maliciosas del 93.6% en GLM-4.6 y una tasa media de éxito del ataque del 74.4% en escenarios de exfiltración de información, compromiso del entorno y descarrilamiento del razonamiento.

El ataque, llamado A2M (Attraction-to-Manipulation), explota una vulnerabilidad fundamental en cómo los agentes MCP seleccionan herramientas. Los agentes MCP se basan en la coincidencia semántica entre descripciones de tareas y metadatos de herramientas para decidir qué herramientas invocar—un proceso que ocurre a nivel de agente, no a nivel de modelo. Un atacante que controla un servidor de herramientas puede crear metadatos que hagan que sus herramientas maliciosas parezcan semánticamente relevantes para tareas legítimas, luego usar trazas de ejecución del razonamiento del agente para refinar los valores de retorno de la herramienta y dirigir al agente hacia resultados controlados por el atacante. El marco funciona como una caja negra, sin requerir acceso a pesos del modelo o estados de razonamiento interno.

El diseño de dos fases separa el ataque en fases distintas. En la fase de Atracción, el marco optimiza los metadatos de herramientas—las descripciones y esquemas que los agentes usan para decidir si invocar una herramienta—para maximizar la probabilidad de invocación. En la fase de Manipulación, observa las trazas de ejecución que resultan de la invocación de herramientas y usa esas trazas para crear devoluciones de herramientas adversariales que empujen al agente hacia el objetivo del atacante. Este refinamiento basado en trazas permite que el ataque funcione sin conocer el proceso de toma de decisiones interno del agente.

En LiveMCPBench, un punto de referencia que los autores utilizaron para la evaluación, los ataques directos optimizados en GLM-4.6 lograron una tasa media de invocación de herramientas maliciosas del 93.6% en cuatro escenarios de ataque. Cuando el mismo ataque se transfirió a otros cuatro modelos sin reoptimización, la tasa de invocación cayó a un promedio macro del 63.6%, lo que indica que aunque el ataque se generaliza, pierde efectividad en modelos para los que no fue ajustado. La tasa media de éxito del ataque—midiendo si el agente realmente realizó la acción deseada por el atacante—fue del 74.4% en los tres tipos de ataque probados.

El marco también demuestra un vector de denegación de servicio: los ataques directos aumentaron los costos de tokens ponderados a 32.4 veces la línea de base benigna bajo lo que los autores llaman Denegación Cognitiva de Servicio, un escenario donde el agente se ve obligado a invocar herramientas costosas repetidamente. Esta amplificación de costos ocurre porque los metadatos envenenados hacen que el agente invoque las herramientas del atacante en lugar de las legítimas, y esas herramientas pueden diseñarse para consumir tokens sin proporcionar salida útil.

La vulnerabilidad se encuentra en la intersección de dos opciones de diseño en ecosistemas MCP. Los agentes deben seleccionar herramientas basándose en relevancia semántica, y los servidores de herramientas suelen ser de terceros o no confiables. Un atacante que ejecuta un servidor de herramientas puede envenenar tanto los metadatos que ven los agentes como los resultados que devuelven las herramientas, creando una superficie de ataque de dos fases que el control de herramientas existente no aborda. El documento motiva un control más fuerte de herramientas—probablemente incluyendo sistemas de reputación, validación de salida o aislamiento—e aislamiento en tiempo de ejecución para evitar que una herramienta comprometida afecte el contexto de ejecución más amplio del agente.

Para equipos que despliegan agentes en MCP, la conclusión es inmediata: trata la selección de herramientas como riesgo de cadena de suministro, verifica los servidores de herramientas antes de agregarlos al contexto de tu agente, y aísla la ejecución de herramientas de operaciones sensibles.