DeepReinforce lanzó Ornith-1.5 el 19 de agosto de 2026, una familia de código abierto bajo licencia MIT que abarca tres tamaños: un flagship mixture-of-experts de 397B, un MoE de 35B que activa solo 3B parámetros por token, y un modelo denso de 9B con una variante cuantizada para móvil. La característica principal es un bucle de automejoría de entrenamiento cerrado donde el modelo no solo resuelve tareas creadas por humanos—propone sus propias tareas, construye andamios específicos de tareas para abordarlas, y genera rollouts de aprendizaje reforzado que se retroalimentan al entrenamiento.
En benchmarks, el flagship de 397B puntúa 86.1 en Terminal-Bench 2.1 y 56 en DeepSWE, igualando o superando ligeramente a Claude Opus 4.8 en 85.0 y 59.0. El MoE de 35B supera modelos densos más grandes como Gemma 4-31B y Muse Glimmer de Meta en codificación agentia (68.5 vs. 43.4 en Terminal-Bench 2.1). El modelo 9B se ejecuta en una sola GPU con compilaciones cuantizadas dirigidas a iPhone y Android. Todos los pesos están disponibles en Hugging Face con soporte de primer día en GGUF, MLX, FP8 y NVFP4.
Para constructores de agentes de codificación e IA agentica, la significancia de Ornith-1.5 no es solo la paridad de benchmark con Claude Opus. Es el bucle de automejoría—donde la generación de tareas, andamios y rollouts de soluciones se entrenan juntos—que elimina el conjunto fijo de tareas curado por humanos. La verificación de benchmark independiente aún está pendiente, pero el modelo ya ha llegado a Hacker News y se ha enviado con soporte de producción en vLLM, Ollama y OpenCode. El 35B es donde implementas.