Investigadores de la Universidad de Pensilvania han demostrado hipnosis de modelo: señales débiles individualmente, semánticamente irrelevantes, apiladas en un prompt pueden impulsar la salida de un modelo de lenguaje con casi certeza. Publicado el 17 de agosto de 2026 por Enric Boix-Adsera y Benedict Tessler, el artículo confirma que el ataque funciona en 16 modelos sin razonamiento, cuatro modelos API de frontera incluyendo GPT-5.6, Gemini y Claude, y modelos de razonamiento de peso abierto con presupuestos de pensamiento extendido. La transferencia entre familias de modelos tiene éxito.
El mecanismo es aditivo. Los investigadores modelan la influencia de cada señal como un coeficiente de log-odds, luego seleccionan codiciosamente señales que apunten en la misma dirección. Ninguna señal individual es lo suficientemente fuerte para detectar o bloquear; el efecto acumulativo invierte el modelo. El artículo muestra: la misma pregunta moral (¿Es correcto causar un daño si previene cinco daños mayores?), precedida por una historia irrelevante de seis oraciones, produce "No" con 94% de probabilidad en la redacción original y "Sí" con 99,93% de probabilidad después de paráfrasis adversarial. La historia contiene cero información relevante para la pregunta ética. Qwen3-8B fue el objetivo; la construcción del prompt fue completamente automática.
Se probaron cuatro familias de señales en tres objetivos conductuales. Listas de animales: una plantilla de 10 ranuras prepara si el modelo prefiere 5 o 7. Paráfrasis: una historia de 20 ranuras dirige respuestas del problema del tranvía. Blobs de metadatos JSON: un objeto de 12 campos cambia la conciencia autoinformada. Errores tipográficos: una historia de 20 ranuras produce efectos direccionales en los mismos objetivos. Las cuatro familias de señales funcionan. Los efectos conductuales abarcan dominios factuales y cargados de valores.
El resultado de la transferencia es crítico para producción. Los prompts hipnóticos construidos contra un modelo retienen efectos direccionales cuando se ejecutan contra una familia diferente. Un atacante que obtiene una huella digital de las sensibilidades de un modelo puede reutilizar prompts construidos en diferentes despliegues sin reajustar. Para equipos que ejecutan canalizaciones de múltiples modelos — un modelo árbitro verificando salidas de un generador diferente, una capa de enrutamiento muestreando de dos proveedores, o configuraciones agénticas multiproveedor — la superficie de ataque no colapsa cuando se rotan modelos.
Los guardrails de bloqueo de tokens no proporcionan protección. La hipnosis de modelo opera en texto semánticamente neutral: paráfrasis, nombres de animales, variantes de puntuación, errores tipográficos. No hay tokens prohibidos, sin sufijos adversariales, sin violaciones de política que interceptar. Los clasificadores de contenido estándar pasan prompts hipnóticos. Los monitores del lado de la salida enfrentan la misma brecha: el modelo proporciona una respuesta confiante y sintácticamente limpia covertamente determinada por la pila de señales en contexto. La hipnosis de modelo es distinta del jailbreaking e impide la interpretabilidad mecanística porque la señal se distribuye en opciones de token inconspicuas en lugar de concentrarse en tramos detectables.
Los datos experimentales se publican completamente en Zenodo (DOI 10.5281/zenodo.21981022) en 280 MB comprimido, 1,5 GB sin comprimir, con canalización reproducible y explorador interactivo por celda. Los equipos pueden ejecutar la etapa de ajuste en CPU contra datos precolecionados para auditar las sensibilidades por señal de su propio modelo sin acceso a GPU.
Si su pila de guardrails opera en identidad de tokens o clasificadores de contenido semántico, no cubre esta clase de ataque. Auditar la hipnosis de modelo requiere medición empírica de sensibilidad a señales a nivel de modelo, no inspección de reglas a nivel de entrada.