Together AI envia DeepSeek V4 Pro com contexto de 512K e preços de entrada em cache
Together AI agora hospeda DeepSeek V4 Pro, o modelo de mistura de especialistas de 1,6 trilhão de parâmetros, com contexto de 512K tokens e três modos de raciocínio contróláveis (Non-Think, Think High, Think Max). O modelo usa Atenção Esparsa Comprimida Híbrída e Atenção Comprimida Pesadamente, reduzindo FLOPS de inferência de token único para 27% e cache KV para 10% versus DeepSeek V3.2 em contexto de milhão tokens. Preço é $2,10 por 1M tokens de entrada, $0,20 por 1M tokens de entrada em cache e $4,40 por 1M tokens de saída.
DeepSeek V4 Pro benchmarks em 93,5% em LiveCodeBench, 90,1% em GPQA Diamond, 80,6% em SWE-Bench Verified e 83,5% em compreensão MRCR 1M. A contagem de parâmetros 1,6T ativa apenas 49B parâmetros por forward pass, dando ao modelo capacidade de conhecimento de nível de fronteira mantendo custos de inferência comparáveis a um modelo denso de 49B. Preços de entrada em cache fornecem redução de custo de 90% para análise repetida sobre o mesmo contexto grande—crítico para agentes de código, inteligência de documentos e fluxos de trabalho agentic de longo prazo.
Para equipes construindo sistemas de raciocínio de longo contexto, DeepSeek V4 Pro em Together AI remove o fardo operacional de executar um MoE de trilhão de parâmetros localmente, mantendo flexibilidade sem servidor ou movendo para capacidade reservada dedicada para garantias de SLA de produção. Cargas de trabalho como análise de repositório, comparação de política e tomada de decisão agentic de várias etapas agora podem aproveitar contexto de milhão tokens com preços de inferência hospedada. Arquitetos avaliando hospedagem de inferência de peso aberto devem fazer benchmark dos modos de raciocínio V4 Pro e do perfil de custo de entrada em cache versus Groq, Fireworks e endpoints de inferência de provedores de nuvem diretos.