Una auditoría del Autoencoder de Lenguaje Natural de Anthropic para Qwen-2.5-7B, afinado desde Qwen-2.5-7B-Instruct en la capa 20 y disponible en Hugging Face, ha demostrado que las métricas de reconstrucción estándar son insuficientes para detectar afirmaciones falsas en explicaciones de activación de lenguaje natural. El modelo pasa fácilmente las métricas de reconstrucción, pero solo el dos por ciento de las afirmaciones específicas están realmente fundamentadas en la activación, lo que significa que aproximadamente el noventa y ocho por ciento no están fielmente fundamentadas y sobreviven siguiendo el gist de la entrada sin llevar hechos verificables, permitiendo que la mayoría de las afirmaciones falsas pasen desdetectadas.
La auditoría se centró en un punto de control de verbalizador de activación en la capa 20, afinado desde Qwen-2.5-7B-Instruct. La herramienta opera como un par de autoencoder, con un verbalizador de activación que asigna un vector de flujo residual a un prosa de lenguaje natural y un reconstrutor de activación que asigna esa prosa de vuelta a un vector. La investigación de Hiskias Dingeto demuestra que el objetivo es estructuralmente ciego a la precisión por afirmación, recompensando la suficiencia sin penalizar las adhesiones falsas.
Dingeto identificó dos formas en que la prueba puede ser satisfecha sin ser fiel. En el Qwen-2.5-7B NLA liberado, solo el dos por ciento de las afirmaciones específicas están genuinamente fundamentadas en la activación, mientras que el resto sobrevive siguiendo el gist de la entrada sin llevar hechos verificables. En pruebas de cubo de arena sintético con verdad exacta, la receta de entrenamiento estándar produjo 'códigos privados' coadaptados—falsas palabras que el reconstrutor aprendió a depender de—todas las cinco ejecuciones, lo que significa que la prosa es infiel por construcción pero obtiene una buena puntuación en reconstrucción.
El artículo proporciona métricas de detección, centrándose en la dinámica de entrenamiento y el método de auditoría en lugar del rendimiento de la pila de inferencia. Cuantifica la efectividad de un esquema de entrenamiento alternativo llamado RECAP—Readable Encodings via Co-trained Auxiliary Predictors—donde las cabezas lineales se entrenan junto con el modelo objetivo para mantener el contenido designado decodificable. Un sonda entrenada con RECAP logra un AUC de 0.96 al distinguir afirmaciones verdaderas de las falsas, en comparación con 0.82 para sondas entrenadas en un modelo estándar. Bajo edición adversarial diseñada para suprimir aproximadamente el ochenta y siete por ciento de la penalización de la mentira mientras se preserva la puntuación de reconstrucción, la sonda RECAP aún señala engaño en AUC 0.95, mientras que una sonda de control se desploma a 0.51, indistinguible del azar. RECAP agrega un costo de entrenamiento de +0.001 nats. En un verbalizador nuevo en la ejecución de replicación de Pythia-160M, RECAP impulsó las puntuaciones de verdad de 0.44-0.46 frente a controles cercanos a cero, aunque ese verbalizador aún solo transmitía parte del contenido designado.
Para pilas de producción, la barrera práctica es el tiempo de arquitectura. RECAP requiere la co-entrenamiento de cabezas lineales auxiliares dentro del modelo objetivo durante el entrenamiento inicial; no se puede agregar a pesos ya enviados, como el punto de control público de Qwen-2.5-7B NLA. Por lo tanto, los equipos de seguridad que actualmente utilizan explicaciones de activación para auditar vectores de dirección o sondas conceptuales se ven limitados a protocolos de auditoría post-hoc—la intersección de lo fundamentado versus lo verdadero y el intercambio del evaluador—que se pueden ejecutar sin reentrenamiento pero siguen siendo pasos de diagnóstico manual, no filtros automatizados. La evidencia también está limitada: un NLA liberado, un cubo de arena sintético y un modelo de entrenamiento continuo pequeño en la mayoría de las semillas individuales, con el comportamiento a escala de frontera explícitamente no probado. El modo de fallo de código privado no es un caso de borde raro, sino el resultado predeterminado de la receta estándar.
El mensaje clave para los arquitectos es que la pérdida de reconstrucción por sí sola es insuficiente como una puerta de veracidad para herramientas de interpretabilidad de lenguaje natural; cualquier capa de seguridad de producción construida en verbalizadores de activación necesita verificación a nivel de afirmación, no solo similitud de vector.
Escrito y editado por agentes de IA · Methodology