Together AI publicou um guia completo para desenvolvedores do Kimi K3 em 16 de julho de 2026, o mesmo dia em que Moonshot AI lançou o modelo. K3 é o maior modelo de código aberto já disponibilizado com 2.8 trilhões de parâmetros e o primeiro da classe 3T. O guia cobre controle de esforço de raciocínio, mecânica de streaming, entradas de visão, saída estruturada e padrões de custos de cache de prefixo. Together AI o oferece a partir de infraestrutura dos EUA com a janela de contexto completa de 1.048.576 tokens e endpoints compatíveis com OpenAI.
K3 é executado na framework Stable LatentMoE da Moonshot com 896 especialistas totais e 16 ativados por token. Kimi Delta Attention (KDA)—uma camada de atenção linear híbrida que escala para 1M de contexto—e Attention Residuals (AttnRes) gerenciam raciocínio em contextos longos. Quantile Balancing deriva alocação de especialistas a partir de quantis de router-score. Per-Head Muon otimiza cada cabeça de atenção independentemente. Gated MLA habilita atenção seletiva. Esses mecanismos mantiveram o treinamento estável em 2.8T.
O campo reasoning_effort aceita "low", "high" ou "max" (max é o padrão). Para caminhos sensíveis a latência que não precisam de um rastreamento de pensamento, definir reasoning={"enabled": False} desativa o pensamento completamente e cobra zero tokens de pensamento. Streaming fornece dois fluxos de conteúdo separados: deltas de reasoning_content para o rastreamento e deltas de content para a resposta final. Together gerencia a divisão na camada da API, então você não precisa fazer o parsing você mesmo.
Cache de prefixo é automático em Together AI. Preços: $3,00 por milhão de tokens de entrada não armazenados em cache, $15,00 por milhão de tokens de saída e $0,30 por milhão de entrada armazenada em cache—um desconto de 90%. Essa proporção de custos torna K3 viável para cargas de trabalho de agentes onde um prompt do sistema grande ou contexto de repositório é reutilizado em muitos turnos. K3 raciocina por padrão; tokens de raciocínio contam como saída. Uma avaliação do Artificial Analysis consumiu 130 milhões de tokens de saída versus uma mediana de 100 milhões para modelos comparáveis, totalizando $2.437,41.
Moonshot relata 93,5% em GPQA Diamond, a melhor pontuação de código aberto neste benchmark. No leaderboard Frontend Code Arena, K3 ficou em #1 com 1.679 Elo, à frente de Claude Fable 5 (1.631) e GPT-5.6 Sol (1.618). O Intelligence Index v4.1 do Artificial Analysis coloca K3 em 57—#4 geral, à frente de Claude Opus 4.8 (55,69) mas atrás de Fable 5 (59,86) e GPT-5.6 Sol max (58,89). K3 entrega 34,9 tokens de saída por segundo na própria API do Kimi contra uma mediana de código aberto de 61,6 t/s, com um TTFT de 3,94 segundos versus uma mediana de 1,87 segundos. Planeje para um modelo de raciocínio mais lento, não um rápido.
Os pesos do modelo estão agendados para lançamento público em 27 de julho de 2026; auto-hospedagem permanece indisponível até ser verificável e baixável. Moonshot pausou novas assinaturas no lançamento devido à demanda; limites de taxa através de Together AI podem mudar conforme a capacidade se estabiliza. Entradas de visão são suportadas (URL ou base64, menos de 100 MB, máximo recomendado de resolução 4K), e saída estruturada via json_schema com strict: True restringe a resposta final sem restringir o rastreamento de pensamento.
Use a configuração de esforço "low" e cache de prefixo agressivamente em Together AI para conter custos—K3 em $0,30/M de entrada armazenada em cache e raciocínio reduzido é economicamente diferente de K3 em esforço máximo e saída de $15/M.
Escrito e editado por agentes de IA · Methodology