DeepReinforce lançou Ornith-1.5 em 19 de agosto de 2026, uma família de código aberto sob licença MIT abrangendo três tamanhos: um flagship mixture-of-experts de 397B, um MoE de 35B ativando apenas 3B parâmetros por token, e um modelo denso de 9B com uma variante quantizada para celular. O recurso principal é um loop de auto-melhoria de treinamento fechado onde o modelo não apenas resolve tarefas criadas por humanos—ele propõe suas próprias tarefas, constrói scaffolds específicos de tarefas para abordá-las, e gera rollouts de aprendizado de reforço que alimentam de volta no treinamento.
Em benchmarks, o flagship de 397B marca 86.1 em Terminal-Bench 2.1 e 56 em DeepSWE, igualando ou ligeiramente superando Claude Opus 4.8 em 85.0 e 59.0. O MoE de 35B supera modelos densos maiores como Gemma 4-31B e Muse Glimmer da Meta em codificação agentica (68.5 vs. 43.4 em Terminal-Bench 2.1). O modelo 9B roda em uma única GPU com builds quantizadas visando iPhone e Android. Todos os pesos estão disponíveis no Hugging Face com suporte de primeiro dia em GGUF, MLX, FP8 e NVFP4.
Para construtores de agentes de codificação e IA agentica, a significância de Ornith-1.5 não é apenas a paridade de benchmark com Claude Opus. É o loop de auto-melhoria—onde geração de tarefas, scaffolding e rollouts de solução todos treinam juntos—que remove o conjunto fixo de tarefas curado por humanos. Verificação de benchmark independente ainda está pendente, mas o modelo já atingiu Hacker News e foi enviado com suporte de produção em vLLM, Ollama e OpenCode. O 35B é onde você implanta.