Um novo framework de ataque demonstra que agentes construídos no Model Context Protocol podem ser sequestrados através de metadados de ferramentas envenenadas, alcançando uma taxa de invocação de ferramentas maliciosas de 93.6% no GLM-4.6 e uma taxa média de sucesso de ataque de 74.4% em cenários de exfiltração de informações, comprometimento de ambiente e descarrilhamento de raciocínio.

O ataque, chamado A2M (Attraction-to-Manipulation), explora uma vulnerabilidade fundamental em como agentes MCP selecionam ferramentas. Agentes MCP dependem de correspondência semântica entre descrições de tarefas e metadados de ferramentas para decidir quais ferramentas invocar—um processo que ocorre no nível do agente, não no nível do modelo. Um atacante que controla um servidor de ferramentas pode criar metadados que fazem suas ferramentas maliciosas parecerem semanticamente relevantes para tarefas legítimas, depois usar rastreamentos de execução do raciocínio do agente para refinar os valores de retorno da ferramenta e direcionar o agente para resultados controlados pelo atacante. O framework opera como uma caixa preta, não exigindo acesso aos pesos do modelo ou aos estados internos de raciocínio.

O design em dois estágios separa o ataque em fases distintas. Na fase de Atração, o framework otimiza metadados de ferramentas—as descrições e esquemas que agentes usam para decidir se devem invocar uma ferramenta—para maximizar a probabilidade de invocação. Na fase de Manipulação, ele observa os rastreamentos de execução resultantes da invocação de ferramentas e usa esses rastreamentos para criar retornos de ferramentas adversariais que empurram o agente em direção ao objetivo do atacante. Esse refinamento baseado em rastreamento permite que o ataque funcione sem conhecer o processo de tomada de decisão interno do agente.

No LiveMCPBench, um benchmark que os autores usaram para avaliação, ataques diretos otimizados no GLM-4.6 alcançaram uma taxa média de invocação de ferramentas maliciosas de 93.6% em quatro cenários de ataque. Quando o mesmo ataque foi transferido para quatro outros modelos sem re-otimização, a taxa de invocação caiu para uma média de 63.6%, indicando que embora o ataque se generalize, ele perde eficácia em modelos para os quais não foi ajustado. A taxa média de sucesso do ataque—medindo se o agente realmente executou a ação desejada pelo atacante—foi de 74.4% entre os três tipos de ataque testados.

O framework também demonstra um vetor de negação de serviço: ataques diretos aumentaram os custos ponderados de tokens para 32.4 vezes a linha de base benigna sob o que os autores chamam de Negação de Serviço Cognitiva, um cenário onde o agente é forçado a invocar ferramentas caras repetidamente. Essa amplificação de custo ocorre porque os metadados envenenados fazem o agente invocar as ferramentas do atacante em vez das legítimas, e essas ferramentas podem ser projetadas para consumir tokens sem fornecer saída útil.

A vulnerabilidade fica na intersecção de duas escolhas de design em ecossistemas MCP. Agentes devem selecionar ferramentas com base em relevância semântica, e servidores de ferramentas são frequentemente de terceiros ou não confiáveis. Um atacante que executa um servidor de ferramentas pode envenenar tanto os metadados que agentes veem quanto os resultados que ferramentas retornam, criando uma superfície de ataque em dois estágios que a verificação de ferramentas existente não aborda. O artigo motiva uma verificação mais forte de ferramentas—provavelmente incluindo sistemas de reputação, validação de saída ou sandboxing—e isolamento em tempo de execução para evitar que uma ferramenta comprometida afete o contexto de execução mais amplo do agente.

Para equipes que implantam agentes em MCP, a conclusão é imediata: trate a seleção de ferramentas como risco de cadeia de suprimentos, verifique servidores de ferramentas antes de adicioná-los ao contexto do seu agente e isole a execução de ferramentas de operações sensíveis.