aiexpert
Início / Notícias / Nota
Research · 21 de ago. de 2026, 00:03 · 4 fontes

Modelos Ornith-1.5 de código aberto igualam Claude Opus 4.8 via loop de auto-melhoria—licença MIT, 9B a 397B

DeepReinforce lançou Ornith-1.5 em 19 de agosto de 2026, uma família de código aberto sob licença MIT abrangendo três tamanhos: um flagship mixture-of-experts de 397B, um MoE de 35B ativando apenas 3B parâmetros por token, e um modelo denso de 9B com uma variante quantizada para celular. O recurso principal é um loop de auto-melhoria de treinamento fechado onde o modelo não apenas resolve tarefas criadas por humanos—ele propõe suas próprias tarefas, constrói scaffolds específicos de tarefas para abordá-las, e gera rollouts de aprendizado de reforço que alimentam de volta no treinamento.

Em benchmarks, o flagship de 397B marca 86.1 em Terminal-Bench 2.1 e 56 em DeepSWE, igualando ou ligeiramente superando Claude Opus 4.8 em 85.0 e 59.0. O MoE de 35B supera modelos densos maiores como Gemma 4-31B e Muse Glimmer da Meta em codificação agentica (68.5 vs. 43.4 em Terminal-Bench 2.1). O modelo 9B roda em uma única GPU com builds quantizadas visando iPhone e Android. Todos os pesos estão disponíveis no Hugging Face com suporte de primeiro dia em GGUF, MLX, FP8 e NVFP4.

Para construtores de agentes de codificação e IA agentica, a significância de Ornith-1.5 não é apenas a paridade de benchmark com Claude Opus. É o loop de auto-melhoria—onde geração de tarefas, scaffolding e rollouts de solução todos treinam juntos—que remove o conjunto fixo de tarefas curado por humanos. Verificação de benchmark independente ainda está pendente, mas o modelo já atingiu Hacker News e foi enviado com suporte de produção em vLLM, Ollama e OpenCode. O 35B é onde você implanta.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source ornith.ai
  2. 02 saascity.io saascity.io “397B MoE scores 86.1 on Terminal-Bench 2.1 and 56.0 on DeepSWE, matching Claude Opus 4.8”
  3. 03 ornith.ai ornith.ai “the model proposes new tasks, generates task-specific scaffolds, and produces solution rollouts for reinforcement learning”
  4. 04 datanorth.ai datanorth.ai “9B dense model shipping with a quantized Mobile build for iPhone and Android”