Meta lanzó Muse Spark 1.2, una actualización enfocada en codificación para su modelo Muse Spark, y Muse Code, el primer agente de codificación de la empresa, el 5 de agosto de 2026 mientras se esfuerza por competir mejor con laboratorios de IA de frontera como OpenAI y Anthropic. Meta co-entrena el modelo con Muse Code, utilizando trayectorias de arneses muestreadas por rechazo para objetivos, compactación de contexto y subagenetes—significando que el modelo fue explícitamente ajustado para desempeño óptimo dentro de esta herramienta en particular. En el Índice de Inteligencia de Análisis Artificial, Muse Spark 1.2 logró una puntuación de 54, empatando con Grok 4.5 de SpaceXAI y alcanzando el tercer lugar entre empresas estadounidenses, por encima de la puntuación de 43 de Muse Spark 1.0 lanzado en abril y 51 de la versión 1.1 lanzada en julio.
En la prueba de codificación Terminal-Bench 2.1 propia de Meta, Muse Spark 1.2 obtuvo 82,9%, por encima del 76,2% para la versión 1.1, con una mejora de 6,7 puntos medida de la misma manera en el mismo arnés un mes después. Sin embargo, en la prueba de codificación interna propia de Meta, Muse Spark 1.2 obtuvo 70,6%, superando cómodamente a GPT-5.6 Terra en 65,4% y Gemini 3.6 Flash en 63,9%, pero aún ubicado casi nueve puntos por debajo de la puntuación de 79,4% de Opus 5. Muse Code caracterízase por registro de eventos local a prueba de bloqueos que registra cada llamada de modelo, ejecución de herramienta, aprobación y edición, permitiendo a los usuarios reanudar desde el punto de interrupción si ocurre un bloqueo.
En GDPval-AA v2, que evalúa capacidades de ejecución de tareas del mundo real, Muse Spark 1.2 obtuvo 1631, con solo Claude Opus 5 en 1852, Claude Fable 5 en 1743, GPT-5.6 Sol en 1730, y Kimi K3 en 1685 obteniendo puntuaciones más altas. Para constructores evaluando agentes de codificación, la transparencia de Meta al publicar finales en segundo lugar en pruebas internas es notable—la empresa posicionó esto como "un claro segundo lugar fuerte" en lugar de la estructura típica "mejor de su clase". El modelo se presenta a $1,25/$4,25 por millón de tokens de entrada/salida, pero un nivel de colaborador con precio más bajo en $0,10/$0,20 está disponible.