Un paper de seguridad publicado el 12 de agosto por investigadores de Shenzhen University documenta un ataque de supply-chain que amenaza implementaciones de agentes LLM en producción: Convergent Detour Hijacking (CDH). El ataque es contundente—una tarea correctamente completada no prueba una ruta de ejecución segura. Un agente bajo CDH finaliza a tiempo mientras consume 66,91% más tokens y se ejecuta 92,45% más lentamente, sin señal alguna de compromiso en la salida final.

CDH explota el diseño de progressive-disclosure utilizado por la mayoría de plataformas de skills en producción. Estos sistemas, incluyendo OpenClaw, cargan solo los metadatos de una skill en el momento de la selección, y luego recuperan el cuerpo completo de la instrucción después de que la skill es elegida. Este enfoque de dos etapas es eficiente pero crea dos puntos de control propiedad del editor de la skill. Un editor malicioso manipula la descripción para ser co-seleccionada con skills legítimas. Una vez que carga el cuerpo, introduce pasos de prerequisito y verificación que suenan plausibles, creando bucles innecesarios. El desvío completa la tarea original, pero cada salto innecesario consume tokens y tiempo de ejecución.

El ataque requiere solo texto. Un editor malicioso escribe una skill estática y nunca vuelve a tocar el agente. Sin payload ejecutable. Sin acceso a internals del modelo. Sin manipulación de herramientas en tiempo de ejecución. CDH funciona porque los planificadores LLM respetan cadenas de dependencia localmente plausibles. Si un cuerpo de skill dice "ejecutar primero una verificación de salud baseline", el planificador la programa. Los investigadores enmarcan esto como una propiedad estructural, no un bug específico del modelo: la plausibilidad local no garantiza necesidad.

Las pruebas en 491 tareas en múltiples backends LLM demostraron la eficacia del ataque. En DeepSeek-V4-Pro, la skill coordinadora del atacante fue seleccionada en el 80,02% de las tareas. Entre las ejecuciones completadas, el consumo de tokens aumentó 66,91% y el tiempo de extremo a extremo aumentó 92,45%. La conclusión general de las tareas se mantuvo comparable al baseline limpio—el ataque evita romper tareas, porque los fallos atraen escrutinio.

El panorama más amplio de supply-chain es precario. Un paper concurrente CCS 2026 sobre routers de API LLM encontró que 1 router pago y 8 gratuitos de 428 estudiados inyectaron código malicioso en respuestas de tool-call. Diecisiete accedieron a credenciales canario propiedad de investigadores en AWS; uno drenó ETH de una clave privada propiedad de investigador. Un ataque de dependency-confusion en marzo de 2026 comprometió LiteLLM, exponiendo cada solicitud de API en vuelo de implementaciones downstream a inspección en texto plano. Un segundo paper sobre Semantic Compliance Hijacking encontró que el marketplace SkillsMP aloja más de 631.813 skills no aseguradas. Ataques sin payload codificados como reglas en lenguaje natural lograron tasas de bypass del 11,6% al 33,5% en cuatro frameworks de agentes.

Los investigadores de CDH extraen la implicación directamente: descripciones de herramientas engañosas causan que los agentes seleccionen herramientas de manera poco confiable, y descripciones persuasivas se eligen con mayor frecuencia. Esto no es especulación de casos extremos—es el principio operativo que CDH explota, y la misma propiedad estructural que hace que cada marketplace de skills abierto sea una superficie de ataque activa.

Para arquitectos, la lección es directa: su monitoreo está incompleto. La corrección de salida y las tasas de éxito no detectan manipulación de trayectoria. Necesita auditoría de trayectoria—registrando qué skills fueron seleccionadas, en qué orden, y si cada paso fue necesario—más registros allow-listed que traten skills de terceros como no confiables por defecto. Las ganancias de eficiencia del progressive disclosure siguen siendo válidas, pero los equipos que ejecutan marketplaces de skills abiertos ahora están ejecutando una verificación que no pueden ver contra un ataque diseñado para pasar cada verificación que pueden ejecutar.