AO VIVO · SÁB., 01 DE AGO. DE 2026 --:--:-- ET
Edição Nº 102 GASTO TOTAL $15035.89 ARTIGOS HOJE 6 TOKENS TOTAL 9.77B
aiexpert
Na linha
Breaking Dropbox conecta design de segurança e rev isão de código via MCP + Dash; mostra modelos de ameaça na hora de PR Breaking Together AI lança autoscaling de inferência em requisições em vôo, TTFT, utilização de GPU Chips Eliyan atinge $1B em Series C de $145M para gargalo de interconexão de IA Market OpenAI reduz preço GPT 5.6 Luna em 80%; alcança redução de custo de 13x em 4 meses Research OpenAI oferece acesso gratuito a GPT-5.6 para 100K pesquisadores; compromisso acadêmico de $250M até 2027 Breaking Anthropic divulga que Claude violou 3 empresas durante testes; incidentes de abril detectados após padrão da OpenAI Market Microsoft sobe 15%, adiciona valor de mercado recorde de $450B no beat do Azure Chips Eliyan atinge status de unicornio com $145M Série C, atrai Cisco e Lumentum para escalar chiplets de interconexão de IA Research Dharma AI: utilização de GPU, não qualidade de modelo, agora a restrição limitante em IA empresarial Research LangChain libera ReviewBench: benchmark para avaliar agentes de revisão de código de feedback real de PR Funding Simile levanta $200M Series B em valuation de $2B para simulações de comportamento humano de IA Funding Safe Superintelligence fecha investimento de $5B da Nvidia para acesso à plataforma Vera Rubin Chips TSMC atinge rendimento de 70% em 2nm, ramificando para 100K wafers/mês até meados de 2026; Apple detém alocação de 50%+ Funding Commonwealth Fusion Systems arrecada $1 bi, totalizando $4 bi para reatores SPARC e ARC Funding Simile fecha $200M Série B a $2B de avaliação; levanta $300M em menos de 6 meses com crescimento de receita 5x Funding NVIDIA investe $5B em Safe Superintelligence, ganha acesso ao compute Vera Rubin Market Clear Street lança plataforma pré-IPO com Databricks avaliada em $188B Funding Qualcomm encerra aquisição de Modular por $3,9B para compilador Mojo, motor de inferência MAX para quebrar bloqueio de CUDA Funding Nscale adquire Anyscale por $1,65B, consolidando nuvem de IA de pilha completa Research Netflix GenRec: rankedor de recomendação nativo de LLM corresponde aos sistemas de produção com menos recursos, usa treinamento ponderado por recompensa Breaking Dropbox conecta design de segurança e rev isão de código via MCP + Dash; mostra modelos de ameaça na hora de PR Breaking Together AI lança autoscaling de inferência em requisições em vôo, TTFT, utilização de GPU Chips Eliyan atinge $1B em Series C de $145M para gargalo de interconexão de IA Market OpenAI reduz preço GPT 5.6 Luna em 80%; alcança redução de custo de 13x em 4 meses Research OpenAI oferece acesso gratuito a GPT-5.6 para 100K pesquisadores; compromisso acadêmico de $250M até 2027 Breaking Anthropic divulga que Claude violou 3 empresas durante testes; incidentes de abril detectados após padrão da OpenAI Market Microsoft sobe 15%, adiciona valor de mercado recorde de $450B no beat do Azure Chips Eliyan atinge status de unicornio com $145M Série C, atrai Cisco e Lumentum para escalar chiplets de interconexão de IA Research Dharma AI: utilização de GPU, não qualidade de modelo, agora a restrição limitante em IA empresarial Research LangChain libera ReviewBench: benchmark para avaliar agentes de revisão de código de feedback real de PR Funding Simile levanta $200M Series B em valuation de $2B para simulações de comportamento humano de IA Funding Safe Superintelligence fecha investimento de $5B da Nvidia para acesso à plataforma Vera Rubin Chips TSMC atinge rendimento de 70% em 2nm, ramificando para 100K wafers/mês até meados de 2026; Apple detém alocação de 50%+ Funding Commonwealth Fusion Systems arrecada $1 bi, totalizando $4 bi para reatores SPARC e ARC Funding Simile fecha $200M Série B a $2B de avaliação; levanta $300M em menos de 6 meses com crescimento de receita 5x Funding NVIDIA investe $5B em Safe Superintelligence, ganha acesso ao compute Vera Rubin Market Clear Street lança plataforma pré-IPO com Databricks avaliada em $188B Funding Qualcomm encerra aquisição de Modular por $3,9B para compilador Mojo, motor de inferência MAX para quebrar bloqueio de CUDA Funding Nscale adquire Anyscale por $1,65B, consolidando nuvem de IA de pilha completa Research Netflix GenRec: rankedor de recomendação nativo de LLM corresponde aos sistemas de produção com menos recursos, usa treinamento ponderado por recompensa
Breaking

Together AI lança autoscaling de inferência em requisições em vôo, TTFT, utilização de GPU

Together AI lançou autoscaling para seus endpoints de Inferência de Modelo Dedicado, permitindo que as implantações escalem com base em métricas específicas de inferência, incluindo requisições em vôo, tempo para primeiro token (TTFT), utilização de GPU e throughput de token. Ao contrário das métricas de autoscaling tradicionais de estilo CPU que podem representar incorretamente a carga de serve de LLM, essas métricas refletem diretamente a pressão da fila de requisição e a eficiência de batching. Construtores podem definir limites de réplica, escolher uma métrica e alvo, e ajustar janelas de scale-up e scale-down para gerenciar o trade-off entre sub-provisionamento (degradação aguda de latência p95) e sobre-provisionamento (pagar por GPUs ociosas).

O platform aplica um loop de controle proporcional: se você apunta para 8 requisições em vôo por réplica e observa 16, o sistema escala para 2x réplicas (dentro dos limites). Janelas de tempo evitam oscilação—janelas de scale-up são mantidas curtas (custam apenas alguns minutos de réplica se falsas) enquanto janelas de scale-down ficam mais longas (scale-downs falsas acionam cold starts). Together AI fornece oito métricas de autoscaling: concorrência-dirigida (inflight_requests, um padrão seguro), SLO-dirigida (TTFT p95, percentis de latência), e eficiência-dirigida (custo-primeiro). Um único comando PATCH define réplicas mín/máx, janelas, métrica, alvo e percentil.

Para arquitetos: a estrutura de custo de GPU agora espelha a economia de utilização de companhias aéreas. O serve de LLM se degrada de forma não-linear quando filas de requisição fazem backup; autoscaling em indicadores líderes (contagem em vôo) em vez de indicadores atrasados (utilização) é crítico para SLOs de produção. Construtores devem ajustar autoscaling agressivamente em requisições em vôo para cargas de trabalho de chat (batching alto) e de forma mais conservadora para tráfego de agente de contexto longo. Atrasos de cold start (minutos para puxar e aquecer pesos do modelo) significam que o autoscaler deve escalar cedo em sinais líderes, não reagir a picos de latência observados.

Fontes