Kimi K3 atinge 68.5% em DeepSWE, custa 2.8x menos por tarefa que Claude Fable 5
Together AI lançou uma análise de benchmark DeepSWE em 24 de julho mostrando o Kimi K3 de peso aberto da Moonshot AI igualando o Claude Fable 5 de Anthropic em tarefas de codificação de engenharia de software a um desconto de custo nítido. Em pass@1, Kimi K3 pontuou 68.5% versus 69.9% de Fable — uma lacuna de 1.4 pontos. Mas quando benchmarks permitem múltiplas tentativas (pass@2 e pass@4), Kimi avança: 82.0% vs 80.2% em pass@2 e 89.4% vs 88.5% em pass@4.
O custo é a manchete: Kimi K3 custa $4.65 por rollout de tarefa versus $13.41 para Claude Fable 5 no ajuste xhigh. Medido por tarefa resolvida, Kimi entregou 14.7 soluções por $100 contra 5.3 de Fable — 2.8x a saída por dólar. A lacuna de desempenho reflete uma diferença estratégica: Fable é mais confiável em tentativas únicas (pass@1 mais alto, mais soluções quatro-para-quatro); Kimi lança uma rede mais ampla sobre tentativas e alcança melhor cobertura pass@2/4. Ambos os modelos falham em tipos de tarefa quase idênticos (correlação 0.72).
Kimi K3 é de peso aberto, implantado através da plataforma de inferência Together AI, enquanto Fable 5 é fechado e disponível apenas através de Anthropic. Isso torna Kimi adequado para equipes construindo fluxos de trabalho agênticos onde múltiplas tentativas e auto-hospedagem são aceitáveis — agentes de voz, loops de geração de código, tarefas de busca-e-iteração. Fable permanece preferido para caminhos de produção de tiro único exigindo determinismo.
Para arquitetos escolhendo entre LLMs de peso aberto e fechado para tarefas de raciocínio e codificação, isso sinaliza um marco: modelos de peso aberto agora alcançam capacidade de raciocínio de nível de ponta em proporções de custo/token de produção mais próximas de modelos pequenos. DeepSWE é um benchmark estreito, mas mede engenharia de software real. A vantagem de custo ($4.65 vs $13.41) pode impulsionar adoção entre equipes construindo agentes CI/CD e sistemas de programação autônoma, especialmente onde tentativa de tarefa é tolerável.
Fontes
- Primary source
- together.ai
“Kimi K3 matches Claude Fable 5 on quality, costs a third as much per solved task, and as an open model gives teams full control over their deployment.”