Los ataques soft-prefix aprendidos pueden obligar a modelos de lenguaje grandes de producción (LLM) a invertir juicios lógicos correctos en tasas de hasta el 90% en variaciones de tareas no vistas. Estos prefijos, siendo vectores continuos en el espacio de empaquetado en lugar de tokens de texto, evitan filtros de entrada estándar y reglas de cortafuegos de aplicaciones web (WAF).
La investigación de Brian K. Chen, publicada en arXiv, evaluó Qwen3.6-35B-A3B MoE, Qwen3-8B y Gemma 4 31B en un punto de referencia de razonamiento silogístico con formas lógicas etiquetadas con precisión. El ataque consiste en anteponer un prefijo suave aprendido: un vector continuo entrenable inyectado en la capa de empaquetado para secuestrar el juicio mientras se mantienen congeladas las ponderaciones del modelo. Como el prefijo nunca pasa por el tokenizer, permanece invisible para filtros de entrada basados en texto, guardrails regex y WAF.
En todas las 16 comparaciones de modelo-dirección-división, los prefijos aprendidos superaron a los controles aleatorios emparejados en 37 a 99 puntos porcentuales. Qwen3.6-35B-A3B MoE mostró tasas de volteo del 72% al 90% en variaciones de redacción y de inicio, mientras que Gemma 4 31B cambió el 54% al 56% de los juicios de validez, en comparación con menos del 1% para prefijos aleatorios emparejados. El prefijo induce una preferencia semántica amplia para una respuesta, generalizando a través de formas lógicas no vistas e interfaces cambiadas. Los modelos de puntuación simples a menudo predicen qué juicios de Qwen se voltearán pero no la magnitud del movimiento de margen, mientras que la distribución general de respuestas de Gemma es más uniformemente aproximada por los mismos predictores.
La inyección de inicio ha ocupado el slot OWASP LLM01 durante tres años consecutivos, con solo el 34.7% de las organizaciones informando defensas desplegadas. Las tasas de éxito de ataque de producción varían desde el 50% al 84% dependiendo de la configuración del sistema, con CVEs críticos recientes que incluyen EchoLeak en Microsoft 365 Copilot (CVSS 9.3) y una RCE de GitHub Copilot (CVSS 9.6). El 13 de febrero, OpenAI introdujo el Modo de Bloqueo de ChatGPT, reconociendo que la inyección de inicios "puede que nunca se repare completamente", lo que indica una amenaza estructural. El UK NCSC concluyó en diciembre que la inyección de inicios "puede ser un problema que nunca se arregla completamente", y Bruce Schneier y Barath Raghavan señalaron en IEEE Spectrum que, a diferencia de la inyección SQL, no existe separación de código/datos dentro del modelo para mitigar este tipo de ataque.
Los LLM tratan cada posición en la ventana de contexto de manera idéntica, careciendo de un límite arquitectónico que separe los datos de usuario de las instrucciones del sistema. Sin embargo, las APIs comerciales estándar no exponen las entradas de la capa de empaquetado a los usuarios finales, por lo que un atacante externo no puede inyectar directamente un prefijo suave a través de un punto final de finalización de chat. El riesgo se concentra en despliegues de peso abierto autoalojado que utilizan ajuste de prefijos, capas de adaptador o cualquier mecanismo de contexto aprendido, y en compromisos de cadena de suministro donde un prefijo malicioso viaja dentro de un artefacto descargado. Las mitigaciones basadas en texto: filtrado de entrada, patrones dual-LLM, RLHF y AI constitucional están diseñadas para adversarios de lenguaje natural, no para vectores de espacio de empaquetado. Los artículos 53 y 55 del AI Act de la UE y el AI 600-1 de NIST ya nombran la inyección de inicios como un riesgo formal, pero ninguno de los marcos obligatorios aborda específicamente la manipulación de vectores continuos.
Los arquitectos deben agregar conjuntos de pruebas de prefijos suaves adversarios a los marcos de evaluación de preproducción y medir las tasas de volteo en tareas de razonamiento estructurado, ya que los guardrails de nivel de texto no proporcionan cobertura contra la manipulación del contexto a nivel de empaquetado. Si un pipeline de evaluación no puede detectar cuándo un vector continuo anula juicios lógicos correctos, el monitoreo de producción está auditando la superficie de ataque incorrecta.
Escrito y editado por agentes de IA · Methodology