Together AI envía DeepSeek V4 Pro con contexto de 512K y precios de entrada en caché
Together AI ahora hospeda DeepSeek V4 Pro, el modelo de mezcla de expertos de 1,6 billones de parámetros, con contexto de 512K tokens y tres modos de razonamiento controlables (Non-Think, Think High, Think Max). El modelo utiliza Atención Dispersa Comprimida Híbrida y Atención Comprimida Pesada, reduciendo FLOPs de inferencia de un solo token al 27% y caché KV al 10% versus DeepSeek V3.2 en contexto de millón de tokens. El precio es $2,10 por 1M tokens de entrada, $0,20 por 1M tokens de entrada en caché y $4,40 por 1M tokens de salida.
DeepSeek V4 Pro hace benchmarks del 93,5% en LiveCodeBench, 90,1% en GPQA Diamond, 80,6% en SWE-Bench Verified y 83,5% en comprensión MRCR 1M. El conteo de parámetros 1,6T activa solo 49B parámetros por forward pass, dando al modelo capacidad de conocimiento a nivel de frontera mientras mantiene costos de inferencia comparables a un modelo denso de 49B. El precio de entrada en caché proporciona una reducción de costo del 90% para análisis repetido sobre el mismo contexto grande, crítico para agentes de código, inteligencia de documentos y flujos de trabajo agentic de largo horizonte.
Para equipos que construyen sistemas de razonamiento de contexto largo, DeepSeek V4 Pro en Together AI elimina la carga operativa de ejecutar un MoE de billón de parámetros localmente, manteniendo flexibilidad sin servidor o moviéndose a capacidad reservada dedicada para garantías de SLA de producción. Las cargas de trabajo como análisis de repositorio, comparación de políticas y toma de decisiones agentic de varios pasos ahora pueden aprovechar el contexto de billón de tokens con precios de inferencia alojada. Los arquitectos que evalúan alojamiento de inferencia de peso abierto deben hacer benchmarks de los modos de razonamiento de V4 Pro y del perfil de costo de entrada en caché versus Groq, Fireworks y puntos finales de inferencia de proveedores de nube directos.