<cite index="56-1,56-2">Meta lançou modelos Llama 4 Scout e Maverick com pesos abertos; a partir de meados de 2026, Behemoth ainda está em pré-visualização/treinamento interno com números de benchmark iniciais mostrando que supera GPT-4.5, Claude 3.7 Sonnet e Gemini 2.0 Pro em tarefas de raciocínio STEM</cite>. <cite index="60-2">Llama 4 Scout apresenta 17 bilhões de parâmetros ativos, 16 especialistas e 109 bilhões de parâmetros totais, enquanto Maverick tem 17 bilhões de parâmetros ativos, 128 especialistas e 400 bilhões de parâmetros totais</cite>. <cite index="60-3">Scout atinge uma janela de contexto de 10 milhões de tokens sem precedentes, muito além da janela de contexto de 128K do Llama 3, permitindo processamento de livros inteiros ou bases de códigos em um único prompt</cite>.
<cite index="51-2">Llama 4 usa camadas alternadas densas e de mistura de especialistas (MoE) para eficiência de inferência, com 128 especialistas roteados e um especialista compartilhado, permitindo que apenas um subconjunto de parâmetros totais se ative durante o serviço; Maverick pode rodar em um único host NVIDIA H100 DGX para fácil implantação ou inferência distribuída</cite>. <cite index="60-4">Meta treinou usando precisão FP8 sem sacrificar qualidade, alcançando 390 TFLOPs/GPU durante o pré-treinamento do modelo Behemoth em 32K GPUs, e desenvolveu MetaP, uma nova técnica de treinamento que define confiavelmente hiperparâmetros críticos como taxas de aprendizagem por camada</cite>.
<cite index="60-1">Llama 4 Maverick oferece uma razão de preço-desempenho aproximadamente 9-23x melhor comparado ao GPT-4o mantendo desempenho comparável ou melhor na maioria dos benchmarks</cite>. Porém, <cite index="58-2">as comunidades de código aberto não ficaram totalmente satisfeitas com o custo e intensidade de memória de modelos MoE esparsos, que precificam participantes em GPUs limitadas comparado a alternativas densas de menor escala como Qwen 2.5</cite>.