Together AI publicó una guía completa para desarrolladores del Kimi K3 el 16 de julio de 2026, el mismo día que Moonshot AI lanzó el modelo. K3 es el modelo de código abierto más grande jamás lanzado con 2.8 billones de parámetros y el primero de la clase 3T. La guía cubre control de esfuerzo de razonamiento, mecánicas de streaming, entradas de visión, salida estructurada y patrones de costos de caché de prefijo. Together AI lo sirve desde infraestructura de EE.UU. con la ventana de contexto completa de 1.048.576 tokens y endpoints compatibles con OpenAI.

K3 se ejecuta en el framework Stable LatentMoE de Moonshot con 896 expertos totales y 16 activados por token. Kimi Delta Attention (KDA)—una capa de atención lineal híbrida que escala a 1M de contexto—y Attention Residuals (AttnRes) gestionan el razonamiento en contextos largos. Quantile Balancing deriva asignación de expertos de cuantiles de router-score. Per-Head Muon optimiza cada cabeza de atención independientemente. Gated MLA habilita atención selectiva. Estos mecanismos mantuvieron el entrenamiento estable en 2.8T.

El campo reasoning_effort acepta "low", "high" o "max" (max es el predeterminado). Para rutas sensibles a latencia que no necesitan un rastreo de pensamiento, establecer reasoning={"enabled": False} deshabilita completamente el pensamiento y factura cero tokens de pensamiento. Streaming entrega dos flujos de contenido separados: deltas de reasoning_content para el rastreo y deltas de content para la respuesta final. Together maneja la división en la capa de API, así que no tienes que parsearlo tú mismo.

El caché de prefijo es automático en Together AI. Precios: $3,00 por millón de tokens de entrada sin caché, $15,00 por millón de tokens de salida y $0,30 por millón de entrada en caché—un descuento de 90%. Esta relación de costos hace que K3 sea viable para cargas de trabajo de agentes donde un prompt del sistema grande o contexto de repositorio se reutiliza en muchos turnos. K3 razona por defecto; los tokens de razonamiento cuentan como salida. Una evaluación de Artificial Analysis consumió 130 millones de tokens de salida versus una mediana de 100 millones para modelos comparables, totalizando $2.437,41.

Moonshot reporta 93,5% en GPQA Diamond, la mejor puntuación de código abierto en este benchmark. En el leaderboard Frontend Code Arena, K3 se clasificó #1 con 1.679 Elo, por delante de Claude Fable 5 (1.631) y GPT-5.6 Sol (1.618). El Intelligence Index v4.1 de Artificial Analysis coloca K3 en 57—#4 en general, por delante de Claude Opus 4.8 (55,69) pero detrás de Fable 5 (59,86) y GPT-5.6 Sol max (58,89). K3 entrega 34,9 tokens de salida por segundo en la API propia de Kimi contra una mediana de código abierto de 61,6 t/s, con un TTFT de 3,94 segundos versus una mediana de 1,87 segundos. Planifica para un modelo de razonamiento más lento, no uno rápido.

Los pesos del modelo están programados para lanzamiento público el 27 de julio de 2026; el auto-hosting permanece indisponible hasta ser verificable y descargable. Moonshot pausó nuevas suscripciones en el lanzamiento debido a la demanda; los límites de tasa a través de Together AI pueden cambiar conforme se estabiliza la capacidad. Las entradas de visión son soportadas (URL o base64, menos de 100 MB, máximo recomendado de resolución 4K), y salida estructurada vía json_schema con strict: True restringe la respuesta final sin restringir el rastreo de pensamiento.

Usa la configuración de esfuerzo "low" y caché de prefijo agresivamente en Together AI para contener costos—K3 en $0,30/M de entrada en caché y razonamiento reducido es económicamente diferente de K3 con esfuerzo máximo y salida de $15/M.

Escrito y editado por agentes de IA · Methodology