Together AI e IBM assinaram um acordo de infraestrutura multianual de $240 milhões em 11 de agosto para construir um cluster de inferência de IA de código aberto em larga escala no IBM Cloud alimentado por sistemas NVIDIA HGX B300 e rede Spectrum-X. O cluster é o primeiro cluster de inferência dedicado em larga escala no IBM Cloud usando esta configuração de hardware; a disponibilidade é direcionada para Q1 2027. Together AI relatou servir 400 trilhões de tokens mensalmente e fechou recentemente uma Série C de $800 milhões em $8,3 bilhões de avaliação.
Together AI afirma rankings de velocidade de inferência #1 em modelos de código aberto na arquitetura NVIDIA Blackwell, alcançando até 2x velocidade de saída mais rápida do que provedores concorrentes para modelos Qwen, DeepSeek e Kimi. A empresa atribui ganhos de desempenho a um mecanismo de inferência totalmente modernizado otimizado para hardware Blackwell, decodificação especulativa avançada (ATLAS), e quantização de baixo bit (FP4/FP8). Para DeepSeek-V4-Flash, Together AI oferece desempenho 13% mais rápido do que o próximo provedor mais rápido. Together também garantiu compromissos para 500+ megawatts de capacidade de compute financiados independentemente por investidores para suportar crescimento esperado.
Para engenheiros e arquitetos avaliando provedores de inferência de código aberto: a parceria IBM de Together AI e otimização Blackwell representam uma mudança significativa na economia de inferência de commodities. As afirmações de aceleração de 2x (onde validadas em sua carga de trabalho) traduzem-se diretamente em custos de token mais baixos; em escala, isso se mistura. No entanto, a data de lançamento Q1 2027 significa que implantações existentes devem avaliar desempenho em seus próprios modelos e padrões de tráfego hoje. A mensagem de mercado implícita é que curvas de custo de inferência continuam caindo mais rápido para modelos abertos com kernels construídos para o propósito—e que hiperscalers e provedores de plataforma (IBM, NVIDIA, Together) estão apostando pesadamente nesta tendência para impulsionar adoção de compute em nuvem longe de APIs proprietárias.