A Cognition lançou SWE-2, um modelo de geração de código pós-treinado a partir de Kimi K3, uma base com 2,8 trilhões de parâmetros, alcançando 50.0% no FrontierCode 1.1 Main enquanto custa 64% menos que Fable 5.1 no mesmo score. O modelo introduz uma abordagem de aprendizado por reforço que treina múltiplos níveis de esforço em uma única execução, avançando toda a fronteira custo-desempenho em vez de otimizar para um único ponto.
SWE-2 é construído sobre Kimi K3, que já havia passado por extenso RL para codificação agêntica. O pós-treinamento da Cognition adiciona 5–6 pontos em muitos benchmarks aplicando uma função de recompensa penalizada por custo que trata cada nível de esforço independentemente. A fórmula de recompensa R=S−λeC penaliza o custo linearmente por nível de esforço, com cada penalidade ajustada para corresponder à inclinação local da fronteira de Pareto do modelo base. Esta abordagem é derivada de primeiros princípios: apenas uma penalidade linear produz o mesmo resultado se aplicada antes ou depois de calcular a média de custo, garantindo que o objetivo de RL se alinhe diretamente com a posição do modelo no plano custo-desempenho.
No FrontierCode 1.1 Main, SWE-2 medium marca 50.0% enquanto leva 58% menos turnos e custa 81% menos em média que SWE-1.7. Os ganhos de eficiência vêm de exploração focada: maior inteligência permite ao modelo julgar quais partes da base de código importam para uma tarefa, permitindo que faça sua primeira edição real após uma mediana de 18 passos comparado com 48 para SWE-1.7. No DeepSWE 1.1, SWE-2 marca 73.0%, igualando GPT-5.6 Sol em 72.7% enquanto supera SWE-1.7's 37.7%. No Terminal-Bench 2.1, SWE-2 atinge 92.8% versus 81.5% de SWE-1.7.
A camada de serving usa decodificação especulativa DSpark com um modelo draft treinado usando SpecForge durante RL para rastrear mudanças de política. A Cognition usa kernels NVFP4 e FP8 com treinamento consciente de quantização para reduzir uso de memória e manter a inferência numericamente próxima ao treinamento. Um delayer de prefill agrupa requisições próximas, melhorando throughput por GPU em 10–20%, embora ao custo de tempo aumentado até o primeiro token.
Os dados de treinamento escalaram significativamente: a Cognition triplicou o número de ambientes de RL, adicionou overlays de seguimento de instruções e construiu um flywheel alimentado por checkpoints anteriores de SWE-2 para iterativamente enrijecer verificadores e prevenir reward hacking. O modelo também introduz uma baseline de recompensa ponderada por comprimento derivada de primeiros princípios, que reduz variância de gradiente sem custo extra e estabiliza significativamente o treinamento mantendo divergência KL de inferência-treinamento baixa.
A parte difícil é que a vantagem de custo de SWE-2 depende inteiramente de qual nível de esforço um arquiteto escolhe. SWE-2 medium é 81% mais barato que SWE-1.7 no FrontierCode 1.1 Main, mas SWE-2 high e max requerem mais planejamento e exploração em tarefas complexas, estreitando a diferença de custo. O modelo está disponível em Devin Desktop e CLI com rollout em Devin Web e Fusion, mas o post não traz números de latência de inferência, limites de token ou preço por token—apenas custo por tarefa em benchmarks específicos. Equipes comparando SWE-2 com Fable 5.1 ou GPT-Astra precisam medir sua própria distribuição de carga de trabalho entre níveis de esforço para saber se os ganhos de Pareto se traduzem em seu caso de uso.
Para equipes escolhendo entre modelos de código fechados e open-weight, o aprendizado é que escalar RL para o regime de múltiplos trilhões de parâmetros com penalidades de custo principiadas pode igualar desempenho frontier por uma fração do preço, mas apenas se sua distribuição de tarefas se alinhar com o nível de esforço onde essa vantagem se sustenta.