<cite index="56-1,56-2">Meta lanzó modelos Llama 4 Scout y Maverick con pesos abiertos; a mediados de 2026, Behemoth aún está en vista previa/entrenamiento interno con números de benchmark iniciales mostrando que supera GPT-4.5, Claude 3.7 Sonnet y Gemini 2.0 Pro en tareas de razonamiento STEM</cite>. <cite index="60-2">Llama 4 Scout cuenta con 17 mil millones de parámetros activos, 16 expertos y 109 mil millones de parámetros totales, mientras que Maverick tiene 17 mil millones de parámetros activos, 128 expertos y 400 mil millones de parámetros totales</cite>. <cite index="60-3">Scout logra una ventana de contexto de 10 millones de tokens sin precedentes, muy por encima de la ventana de contexto de 128K de Llama 3, permitiendo procesar libros completos o bases de códigos en un solo prompt</cite>.
<cite index="51-2">Llama 4 usa capas alternas densas y de mezcla de expertos (MoE) para eficiencia de inferencia, con 128 expertos enrutados y un experto compartido, permitiendo que solo un subconjunto de parámetros totales se active mientras se sirve; Maverick puede ejecutarse en un único host NVIDIA H100 DGX para fácil implementación o inferencia distribuida</cite>. <cite index="60-4">Meta entrena usando precisión FP8 sin sacrificar calidad, logrando 390 TFLOPs/GPU mientras preentrenaba el modelo Behemoth en 32K GPUs, y desarrolló MetaP, una nueva técnica de entrenamiento que establece confiablemente hiperparámetros críticos como tasas de aprendizaje por capa</cite>.
<cite index="60-1">Llama 4 Maverick ofrece una relación de precio-rendimiento aproximadamente 9-23x mejor en comparación con GPT-4o mientras mantiene un rendimiento comparable o mejor en la mayoría de los benchmarks</cite>. Sin embargo, <cite index="58-2">las comunidades de código abierto no estaban completamente satisfechas con el costo e intensidad de memoria de los modelos MoE dispersos, que precios para participantes en GPUs limitadas en comparación con alternativas densas a menor escala como Qwen 2.5</cite>.