La decodificación greedy de modelos de lenguaje grandes produce salidas diferentes en BF16 versus FP16 en hardware idéntico, con 49–100% de prompts divergiendo en seis modelos y tres benchmarks, según un preprint de arXiv publicado en septiembre de 2026. Un cambio de token único a menudo se propaga en divergencia a nivel de trayectoria, haciendo que los despliegues críticos para determinismo sean poco confiables cuando varían los formatos de precisión.

La causa raíz no reside en el error acumulado en las capas del cuerpo del modelo sino en el margen entre los dos logits principales en la cabeza del modelo de lenguaje. El análisis empírico de propagación de error del artículo encontró que 22 capas de error acumulado del cuerpo no determinan si un paso cambiará a un token diferente; el resultado depende principalmente del margen de los dos logits principales relativo a la perturbación direccional entre los dos candidatos principales. Este hallazgo condujo a cinco predicciones comprobables sobre resultados de intervención, incluyendo una contraintuitiva: aplicar más computación FP32 en un alcance más amplio empeora el acuerdo, no lo mejora. Los experimentos coincidieron con las cinco predicciones.

La mitigación que evaluaron los autores es recomputación selectiva FP32 de cabeza LM, activada solo cuando el margen entre los dos logits principales cae por debajo de un umbral. En hardware A10G, este enfoque entrega +22–36 puntos porcentuales de recuperación de acuerdo exacto con menos del 4% de sobrecarga de latencia en inferencia de bajo lote (tamaño de lote ≤4) de flujo único. El rendimiento se degrada en otro hardware: el mismo método recupera +12–21 pp en L4 y A100. El límite de aplicabilidad es estrecho: el beneficio del método desaparece cuando el error originado en el cuerpo domina, incluyendo en tamaño de lote ≥8 y bajo cuantización FP8 de extremo a extremo en las pruebas del artículo.

La intervención es una mitigación parcial en lugar de una garantía universal de determinismo. Los autores mapean el límite de aplicabilidad en seis modelos (parámetros de 1.1B–7B, cuatro familias, con divergencia caracterizada adicionalmente en 12B) y cuatro tamaños de lote, e hipotetizan que la estabilidad de precisión en tiempo de entrenamiento es un factor determinante en si el método funcionará. Con tamaños de lote más altos o bajo cuantización agresiva, la estrategia de recomputación selectiva falla porque el error se origina en el cuerpo del modelo en lugar de en la cabeza, haciendo inefectiva la solución a nivel de cabeza.

Para arquitectos que despliegan modelos donde el determinismo de salida importa—sistemas de cumplimiento, pipelines de investigación reproducible o inferencia crítica para seguridad—la recomputación selectiva FP32 de cabeza ofrece una herramienta concreta con límites operacionales claros: funciona en tamaño de lote ≤4 en A10G con costo de latencia mínimo, pero no se generaliza a mayor concurrencia o cuantización FP8 de extremo a extremo. Los equipos deben medir divergencia en su propio hardware y perfil de lote antes de comprometerse con un único formato de precisión, y tratar la decodificación greedy como dependiente de precisión en lugar de determinista.