Investigadores de la Universidad Politécnica de Madrid y Purdue University publicaron Decoding-Level Taboo, una herramienta de diagnóstico que mide cómo funcionan los LLMs en implementaciones de producción real en lugar de condiciones de benchmark. Los sistemas de producción no envían solicitudes limpias. Superponen instrucciones del sistema, barreras de seguridad y reglas de salida estructurada que empujan la generación fuera del camino de entrenamiento del modelo.
El mecanismo de Taboo es directo. En lugar de crear solicitudes adversariales, la prueba interviene en el espacio de logit en tiempo de ejecución. En cada límite de palabra, Taboo enmascara los tokens candidatos principales del modelo, forzando circunlocución—expresar la misma intención semántica a través de vocabulario secundario. El resultado es una señal clara sobre la calidad de generación fuera del camino sin verificadores externos, datos etiquetados o jueces ajustados. El único costo es la inferencia.
En familias de modelos de peso abierto, los autores encuentran dos controladores dominantes de robustez fuera del camino: escala de parámetros y alineación de instrucciones post-entrenamiento. Los modelos más grandes funcionan mejor. Los modelos mejor alineados también funcionan mejor, en gran medida independientemente del tamaño. El artículo no publica una puntuación de tabla de clasificación compuesta, por lo que los equipos no pueden comparar directamente puntos de control en un índice Taboo. La comunidad necesita ejecuciones públicas de Taboo en puntos de control nombrados antes de que alimenten canalizaciones de selección de modelos.
La brecha benchmark-implementación que Taboo aborda está ampliamente documentada. Las clasificaciones MMLU públicas no predicen el desempeño de carga de trabajo porque las entradas empresariales—solicitudes del sistema largas, contexto RAG, esquemas de salida estructurada, historial multiturno—difieren radicalmente de los benchmarks estandarizados. Los proveedores actualizan el comportamiento del modelo bajo números de versión estables sin siempre comunicar cambios. Un modelo que pasó la evaluación interna hace tres meses puede manejar la composición de solicitud del sistema de manera diferente hoy. Taboo proporciona a los equipos una sonda de tiempo de ejecución repetible que no depende de conjuntos de evaluación fijos, lo que la hace más robusta contra la contaminación que los benchmarks estáticos.
Las aplicaciones secundarias son potencialmente tan valiosas como el diagnóstico principal. Al forzar circunlocución, Taboo genera diversidad natural en datos de entrenamiento sintético—útil para conjuntos de datos de ajuste fino que necesitan variedad léxica sin deriva semántica. También prueba barreras de seguridad bajo estrés directamente. Si un modelo bajo restricción evita el vocabulario disparador de una barrera, esa es una señal que vale la pena detectar antes de la implementación. Kalvium Labs midió tasas de evasión de barreras en cuatro proyectos de clientes: filtros de entrada basados en expresiones regulares capturaron el 60–70% de intentos de inyección, mientras que clasificadores basados en LLM alcanzaron 89–94%. Ninguno de los dos tiene en cuenta cambios de comportamiento del modelo inducidos por restricciones de salida estructurada—que Taboo investiga.
Taboo no requiere acceso a los pesos del modelo. La intervención en el espacio de logit funciona contra cualquier modelo que exponga salidas de logit o probabilidades de token, cubriendo cada pila de servicio de peso abierto importante (vLLM, TGI, Ollama) y cualquier proveedor que exponga log-probs a través de API. Los equipos que ejecutan su propia inferencia en familias Llama, Mistral o Qwen pueden integrar Taboo en una lista de verificación previa a la implementación sin modificar la arquitectura o reentrenar.
Taboo es la primera herramienta barata y libre de verificador para medir cómo se degrada elegantemente un modelo cuando restricciones estructurales estrechan su corredor de generación. Ejecute antes de confirmar un punto de control a producción y nuevamente después de cualquier actualización del proveedor.