El benchmark DeepSWE de lanzamiento de 452 de AI sitúa a Kimi K3 como una solución de codificación rentable, con un costo de 4.65 dólares por lanzamiento en comparación con los 13.41 dólares de Claude Fable 5. Kimi K3 entrega 2.8× más tareas resueltas por 100 dólares, mientras que solo se queda 1.4 puntos atrás en pass@1 y lidera pass@4 abiertamente. Esta diferencia de costo —2,103 dólares frente a 6,010 dólares para 113 solicitudes de características de código abierto a largo plazo reales— provoca una reconsideración a nivel de pila de cuál modelo es el más adecuado para agentes de codificación autónomos.

DeepSWE califica aprobado/suspendido en conjuntos de pruebas ocultas en repositorios en vivo, con cuatro intentos por tarea. Juntos AI probó a Kimi K3 al máximo esfuerzo contra Fable 5 en su configuración "xhigh", la configuración más fuerte de Anthropic. Kimi K3 es un modelo de mezcla de expertos de 2.8 billones de parámetros que se enruta a través de 896 expertos en total con solo 16 activos por paso adelante; Fable 5 es una pila de Anthropic cerrada. La cobertura de Kimi alcanza el 89.4% de las tareas en pass@4, superando el 88.5% de Fable y liderando todas las configuraciones de nivel bandera en la exportación de 44 modelos de Juntos, excepto dos variantes de GPT económicas. Sin embargo, la correlación por tarea entre los dos es de 0.72, la similitud interproveedor más alta en este conjunto de datos, y su unión cubre solo 105 de 113 tareas, solo cuatro más que Kimi por sí solo.

Operativamente, los números varían en presupuesto de reintentos y techo de latencia. En precio de lista, Kimi cuesta 3/15 dólares por millón de tokens de entrada/salida en comparación con 10/50 dólares de Fable, una brecha de 3.3× en salida. Sin embargo, el rendimiento invierte la economía: ArtificialAnalysis midió a Kimi a 32.8 tokens por segundo en comparación con 73.5 de Fable, y Juntos señala que Kimi "toma mucho más tiempo" de principio a fin a pesar de un tiempo comparable al primer token al máximo esfuerzo (123.4 s en comparación con 129.1 s). Esto significa que el costo por tarea en el reloj de pared no es el mismo que el gasto por API por tarea: si los tiempos de espera de la orquestación de su agente o los ciclos de humano en el bucle son sensibles al tiempo de finalización, los ahorros de tokens se evaporan en deuda de latencia. La confiabilidad también se inclina hacia Fable: resuelve el 79.0% de las tareas perfectamente en todos los cuatro intentos, en comparación con el 76.6% de Kimi, y domina Python, JavaScript, TypeScript y Rust por márgenes de 4 a 10 puntos. La única victoria de lenguaje de Kimi es Go (79% frente a 71%).

El desafío radica en la divergencia de mangueras y la regresión de alucinaciones. LLM-stats señala que las cifras de DeepSWE y Terminal-Bench de Kimi se ejecutan a través de la manguera KimiCode, mientras que las de Fable provienen de mangueras publicadas por separado —las brechas de pocos puntos deben tratarse como empates a menos que se reproduzcan en su propia pila. Más estructuralmente, la revisión de Bleap señala que la tasa de alucinación de Kimi K3 aumentó del 39% al 51% en comparación con su predecesor K2.6, incluso mientras su precisión de "honestidad bajo presión" mejoraba. Ambos modelos comparten una tasa de fallo cercano al 65% y tasas de regresión de línea base casi idénticas cerca del 10-11%, por lo que aprobarse en CI no significa aprobarse en corrección, y la superficie del conjunto de pruebas oculto sigue siendo la única barrera real.

El patrón transferible es la enrutamiento consciente de evaluación, no el reemplazo del modelo. Kimi K3 gana en pass@4 y en contextos de agentes a largo plazo como Terminal-Bench 2.1 y SWE-Marathon; Fable 5 todavía lidera en FrontierSWE, complejidad de cirugía de repositorios y tareas de juicio ambiguo. Si su presupuesto de inferencia está fijo y su agente puede tomar cuatro muestras, Kimi es el valor predeterminado racional. Si tiene una sola oportunidad en un refactor de altas apuestas, el premio de confiabilidad de Fable es más barato que un reembolso.

Implemente Kimi K3 para flotas de agentes de terminal en pass@4 donde la cobertura por dólar domine, y reserve Fable 5 para cirugía de repositorio de un solo intento donde una tasa de solución perfecta del 79% supera ahorros de costo de 2.8×.

Escrito y editado por agentes de IA · Methodology