Kimi K3 logra 68.5% en DeepSWE, cuesta 2.8x menos por tarea que Claude Fable 5
Together AI lanzó un análisis de benchmark DeepSWE el 24 de julio mostrando que Kimi K3 de Moonshot AI de peso abierto se iguala al Claude Fable 5 de Anthropic en tareas de codificación de ingeniería de software a un descuento de costo nítido. En pass@1, Kimi K3 anotó 68.5% versus 69.9% de Fable — una brecha de 1.4 puntos. Pero cuando los benchmarks permiten múltiples intentos (pass@2 y pass@4), Kimi adelanta: 82.0% vs 80.2% en pass@2 y 89.4% vs 88.5% en pass@4.
El costo es el titular: Kimi K3 cuesta $4.65 por lanzamiento de tarea versus $13.41 para Claude Fable 5 en su configuración xhigh. Medido por tarea resuelta, Kimi entregó 14.7 soluciones por $100 contra 5.3 de Fable — 2.8x la salida por dólar. La brecha de desempeño refleja una diferencia estratégica: Fable es más confiable en intentos únicos (pass@1 más alto, más soluciones cuatro-para-cuatro); Kimi lanza una red más amplia en reintentos y logra mejor cobertura pass@2/4. Ambos modelos fallan en tipos de tareas casi idénticos (correlación 0.72).
Kimi K3 es de peso abierto, implementado a través de la plataforma de inferencia Together AI, mientras que Fable 5 es cerrado y disponible solo a través de Anthropic. Esto hace que Kimi sea adecuado para equipos que construyen flujos de trabajo agénticos donde múltiples intentos y alojamiento propio son aceptables — agentes de voz, bucles de generación de código, tareas de búsqueda-e-iteración. Fable sigue siendo preferido para rutas de producción de un solo disparo que requieren determinismo.
Para arquitectos que eligen entre LLM de peso abierto y cerrado para tareas de razonamiento y codificación, esto señala un hito: los modelos de peso abierto ahora logran capacidad de razonamiento de nivel de punta en proporciones de costo/token de producción más cercanas a modelos pequeños. DeepSWE es un benchmark estrecho, pero mide ingeniería de software real. La ventaja de costo ($4.65 vs $13.41) puede impulsar la adopción entre equipos que construyen agentes de CI/CD y sistemas de programación autónoma, especialmente donde el reintento de tarea es tolerable.
Fuentes
- Primary source
- together.ai
“Kimi K3 matches Claude Fable 5 on quality, costs a third as much per solved task, and as an open model gives teams full control over their deployment.”