A decodificação gulosa de modelos de linguagem grandes produz saídas diferentes em BF16 versus FP16 no mesmo hardware, com 49–100% dos prompts divergindo em seis modelos e três benchmarks, de acordo com um preprint do arXiv publicado em setembro de 2026. Uma única inversão de token frequentemente cascateia em divergência no nível da trajetória, tornando implantações críticas para determinismo não confiáveis quando os formatos de precisão variam.
A causa raiz não reside no erro acumulado nas camadas do corpo do modelo, mas na margem entre os dois logits principais na cabeça do modelo de linguagem. A análise empírica de propagação de erro do artigo descobriu que 22 camadas de erro acumulado no corpo não distinguem se uma etapa vai inverter para um token diferente; o resultado depende principalmente da margem dos dois principais logits em relação à perturbação direcional entre os dois principais candidatos. Essa descoberta levou a cinco previsões testáveis sobre resultados de intervenção, incluindo uma contraintuitiva: aplicar mais computação FP32 em um escopo mais amplo piora o acordo, não melhora. Os experimentos corresponderam a todas as cinco previsões.
A mitigação que os autores avaliaram é a recomputação seletiva FP32 da cabeça LM, acionada apenas quando a margem entre os dois principais logits cai abaixo de um limite. Em hardware A10G, essa abordagem entrega +22–36 pontos percentuais de recuperação de acordo exato com menos de 4% de overhead de latência em inferência de fluxo único com lote baixo (tamanho de lote ≤4). O desempenho se degrada em outro hardware: o mesmo método recupera +12–21 pp em L4 e A100. O limite de aplicabilidade é estreito: o benefício do método desaparece quando o erro originado no corpo domina, incluindo em tamanho de lote ≥8 e sob quantização FP8 de ponta a ponta nos testes do artigo.
A intervenção é uma mitigação parcial em vez de uma garantia universal de determinismo. Os autores mapeiam o limite de aplicabilidade em seis modelos (1.1B–7B parâmetros, quatro famílias, com divergência adicionalmente caracterizada em 12B) e quatro tamanhos de lote, e levantam a hipótese de que a estabilidade de precisão em tempo de treinamento é um fator determinante para se o método funcionará. Em tamanhos de lote mais altos ou sob quantização agressiva, a estratégia de recomputação seletiva falha porque o erro origina-se no corpo do modelo em vez de na cabeça, tornando a correção no nível da cabeça ineficaz.
Para arquitetos que implantam modelos onde o determinismo de saída importa—sistemas de conformidade, pipelines de pesquisa reproduzível ou inferência crítica para segurança—a recomputação seletiva FP32 da cabeça oferece uma ferramenta concreta com limites operacionais claros: funciona em tamanho de lote ≤4 em A10G com custo mínimo de latência, mas não generaliza para concorrência mais alta ou quantização FP8 de ponta a ponta. As equipes devem medir divergência em seu próprio hardware e perfil de lote antes de se comprometer com um único formato de precisão, e tratar a decodificação gulosa como dependente de precisão em vez de determinística.