O benchmark DeepSWE da AI com 452 implantações coloca o Kimi K3 como uma solução de codificação econômica, com US$ 4,65 por implantação em comparação com US$ 13,41 do Claude Fable 5. O Kimi K3 entrega 2.8× mais tarefas resolvidas por US$ 100, enquanto fica apenas 1,4 pontos atrás no pass@1 e lidera o pass@4 de forma direta. Esta diferença de custo - US$ 2.103 versus US$ 6.010 para 113 requisições de recursos de código abertos de longo prazo reais - provoca uma reconsideração no nível da pilha de qual modelo é mais adequado para agentes de codificação autônomos.
DeepSWE avalia aprovado/não aprovado em conjuntos de testes ocultos em repositórios ao vivo, com quatro tentativas por tarefa. A Together AI testou o Kimi K3 ao máximo em comparação com o Fable 5 em sua configuração 'xhigh', a configuração mais forte da Anthropic. O Kimi K3 é um modelo de mistura de especialistas de 2,8 trilhões de parâmetros roteando por 896 especialistas no total, com apenas 16 ativos por passagem para a frente; o Fable 5 é uma pilha Anthropic fechada. A cobertura do Kimi alcança 89,4% das tarefas no pass@4, superando a de Fable de 88,5% e liderando todas as configurações de nível bandeira na exportação de 44 modelos da Together, exceto duas variantes GPT baratas. No entanto, a correlação por tarefa entre os dois é de 0,72, a semelhança trans-fabricante mais alta neste conjunto de dados, e a sua união abrange apenas 105 de 113 tarefas - apenas quatro a mais do que o Kimi sozinho.
Operacionalmente, os números diferem em orçamento de nova tentativa e limite de latência. No preço de lista, o Kimi custa US$ 3/US$ 15 por milhão de tokens de entrada/saída em comparação com US$ 10/US$ 50 do Fable, uma lacuna de 3,3× na saída. No entanto, a taxa de transferência inverte a economia: o ArtificialAnalysis mediu o Kimi em 32,8 tokens por segundo versus 73,5 do Fable, e a Together observa que o Kimi "leva muito mais tempo" de ponta a ponta, apesar de um tempo comparável para o primeiro token no máximo esforço (123,4 s versus 129,1 s). Isso significa que o custo por tarefa no relógio de parede não é o mesmo que o gasto por tarefa na API - se os tempos limite da orquestração do seu agente ou os ciclos com humano no laço são sensíveis ao tempo de conclusão, as economias de tokens desaparecem em dívida de latência. A confiabilidade também inclina-se para o Fable: ele resolve 79,0% das tarefas perfeitamente em todas as quatro tentativas, contra 76,6% do Kimi, e lidera em Python, JavaScript, TypeScript e Rust com margens de 4 a 10 pontos. A única vitória de linguagem do Kimi é em Go (79% versus 71%).
O desafio está em domar a divergência e a regressão da alucinação. O LLM-stats nota que as figuras do DeepSWE e Terminal-Bench do Kimi são executadas através do guincho KimiCode, enquanto as do Fable vêm de guinchos publicados separadamente - as lacunas de alguns pontos devem ser tratadas como empates, a menos que reproduzidas em sua própria pilha. Mais estruturalmente, a revisão do Bleap sinaliza que a taxa de alucinação do Kimi K3 subiu de 39% para 51% em comparação com seu predecessor K2.6, mesmo enquanto sua precisão de "honestidade sob pressão" melhorou. Ambos os modelos compartilham uma taxa de falha quase errada de 65% e taxas de regressão de linha de base quase idênticas perto de 10-11%, então aprovado no CI não é aprovado na correção, e a superfície do conjunto de testes oculto permanece a única guarda-real.
O padrão transferível é o roteamento consciente da avaliação, não a substituição do modelo. O Kimi K3 vence no pass@4 e em contextos de agentes de longo prazo, como o Terminal-Bench 2.1 e o SWE-Marathon; o Fable 5 ainda lidera no FrontierSWE, na complexidade do repo-surgery e em tarefas de julgamento ambíguo. Se seu orçamento de inferência é fixo e seu agente pode amostrar quatro vezes, o Kimi é o padrão racional. Se você tem uma única chance em um refactor de alto risco, o prêmio de confiabilidade do Fable é mais barato do que um rollback.
Implante o Kimi K3 para frotas de agentes de terminal pass@4 onde a cobertura por dólar domine e reserve o Fable 5 para repo-surgery de tentativa única onde uma taxa de solução perfeita de 79% vence uma economia de custo de 2.8×.
Escrito e editado por agentes de IA · Methodology