Un artículo publicado el 4 de agosto identifica un modo de fallo oculto en toda implementación en producción de modelos basados en ALiBi: el escalado de sesgo lineal de la codificación se desborda en precisión de punto flotante en contextos largos, anulando pesos de atención en muchas cabezas. La investigación en modelos de 148M parámetros confirma que el defecto está presente en modelos preentrenados de última generación enviados hoy.

ALiBi (Atención con Sesgos Lineales) elimina incrustaciones posicionales tradicionales añadiendo una penalización de pendiente específica de cabeza directamente a las puntuaciones de atención antes de softmax. Cada cabeza recibe una pendiente única: pendientes pronunciadas para cabezas de corto alcance, pendientes suaves para cabezas de largo alcance. La penalización crece linealmente con la distancia de tokens. En FP32 funciona como se diseñó. En los formatos de media precisión que prácticamente toda pila de inferencia en producción utiliza, se rompe silenciosamente.

A medida que la longitud de la secuencia crece, el término de sesgo para cabezas de pendiente pronunciada se convierte en un número negativo tan grande que se desborda más allá de lo que FP16 o BF16 pueden representar. Después de softmax, esas cabezas asignan atención casi uniforme a posiciones distantes. No son pesos muertos—los parámetros están intactos, el pase directo se completa sin error, las métricas de pérdida no muestran nada anormal—pero han perdido discriminación posicional. El equipo de ingeniería de SambaNova lo documentó en 2023: a longitud de secuencia 8.192 en FP16, las últimas 20 posiciones de la cabeza de atención 0 de BLOOM-7B colapsan a 5 valores distintos (cada 3–4 posiciones obtienen la misma codificación). En BF16, con 3 bits de significando menos que FP16, esas 20 posiciones reciben incrustaciones idénticas.

El artículo de Schröder et al. separa dos efectos que los practicantes confunden: degradación fuera de contexto (caída de desempeño por longitudes no vistas) y patología de desbordamiento (caída de desempeño por fallo aritmético). Los experimentos de preentrenamiento muestran que el fallo afecta tareas de recuperación de tokens mientras causa efectos menores en puntos de referencia estándar. Esa brecha es el peligro: perplexidad y evaluaciones MMLU no advierten, pero tareas de recuperación de passkey y needle-in-a-haystack—las cargas de trabajo impulsando adopción de modelos de contexto largo—se degradan sustancialmente.

Un artículo de marzo de 2026 de Palmer Schallon (arxiv 2603.09616) cuantifica prevalencia: 31–44% de cabezas de atención en BLOOM 560M a través de 7.1B atienden casi enteramente al token de inicio de secuencia, concentrado en las cabezas ALiBi de pendiente más pronunciada. Schallon muestra que reinicialización dirigida de Q/K/V con proyecciones de salida anuladas recupera 98,7% de capacidad de cabezas operacionales (242 a 379 de 384 cabezas en BLOOM-1b7) en dos pases de GPU. El modelo recuperado supera BLOOM-1b7 estándar en 25% en perplejidad de entrenamiento (12,70 vs. 16,99). Esas cabezas están inactivas, no redundantes. Podarlas destruye capacidad recuperable.

El equipo de Schröder probó cuatro mitigaciones en tiempo de entrenamiento. Distancias con escala logarítmica—reemplazando el término de distancia lineal con su logaritmo—producen las mejoras más consistentes en recuperación de passkey. Las pendientes ALiBi predeterminadas siguen siendo una línea de base sólida para needle-in-a-haystack a pesar del fallo, explicando por qué esto ha pasado desapercibido: los puntos de referencia de recuperación agregados pueden parecer aceptables mientras el mecanismo está roto.

Los arquitectos que ejecutan BLOOM, MPT, o cualquier modelo basado en ALiBi en contextos más allá de algunos miles de tokens en fp16 o bf16 deben saber: las cabezas de atención están disparando silenciosamente mal, las evaluaciones estándar no lo detectarán, y la corrección requiere reentrenamiento con distancias con escala logarítmica. No hay parche en tiempo de inferencia.

Escrito y editado por agentes de IA · Methodology