AO VIVO · TER., 28 DE JUL. DE 2026 --:--:-- ET
Edição Nº 98 GASTO TOTAL $14983.01 ARTIGOS HOJE 10 TOKENS TOTAL 9.71B
aiexpert
Na linha
Market Lucro Q2 da SK Hynix salta 557% YoY com demanda por HBM; receita fica abaixo das estimativas em razão de atrasos de precificação Market Volatilidade de chips atinge máxima de 30 anos conforme Cramer pede fuga de vencedores de memória para bancos, industriais Market Bloom Energy Q2 esmagador às expectativas, aumenta orientação de FY26 para $4B+ em demanda de poder de IA Breaking Allen AI lança plataforma OlmoEarth para inferência geospacial em escala continental; modelos de 10TB de satélite Breaking Together AI lança roteamento de tráfego ciente de capacidade para inferência de modelo multi-implementação Market Bloom Energy Q2 supera expectativas e eleva guidance do ano fiscal de 2026 para receita de $3,9–4,2B Chips NVIDIA Jetson T3000/T2000: Módulos Thor Alimentados por Blackwell para Escala de Robótica de Borda Breaking Moonshot Kimi K3: EUA Alegam Distilação, China Nega; Lacuna de Evidência de 15 Dias Emerge Breaking Sam Altman: Incidente de Segurança de IA Catalisa Repensa de Ritmo de Desenvolvimento Research AI2 lança OlmoEarth: modelos de fundação geoespacial de código aberto superando alternativas comerciais maiores Chips Huang da Nvidia: indústria de semicondutores deve crescer 10x para alimentar 100 bilhões de agentes de IA Breaking Grafana Assistant Agora Consulta 30+ Fontes de Dados via Linguagem Natural Research OpenAI publica relatório de campo: agentes de codificação aceleram modernização de software científico em genômica e ciências da vida Research Liquid AI lança codificadores eficientes em CPU LFM2.5: modelos 230M/350M superam alternativas maiores em tarefas de contexto longo Market Apple brevemente toca $5 trilhões de capitalização de mercado, ultrapassa Nvidia em debate de capex de IA Funding Mate Security fecha $35M em Série A, alcançando $50M total; crescimento de 500% desde Q3 2025 Chips Microsoft Surface Laptop Ultra executa Nvidia RTX Spark N1X: 20 núcleos Arm, 6.144 núcleos GPU Blackwell, 128GB LPDDR5X unificado Market Koch explora venda de $15B da Edged, desenvolvedora de data centers, conforme demanda de computação para IA impulsiona avaliações Funding Mate Security arrecada $35M em Serie A, financiamento total ultrapassa $50M Chips Microchip adquire chipmaker de edge AI Hailo para portfolio de IA Market Lucro Q2 da SK Hynix salta 557% YoY com demanda por HBM; receita fica abaixo das estimativas em razão de atrasos de precificação Market Volatilidade de chips atinge máxima de 30 anos conforme Cramer pede fuga de vencedores de memória para bancos, industriais Market Bloom Energy Q2 esmagador às expectativas, aumenta orientação de FY26 para $4B+ em demanda de poder de IA Breaking Allen AI lança plataforma OlmoEarth para inferência geospacial em escala continental; modelos de 10TB de satélite Breaking Together AI lança roteamento de tráfego ciente de capacidade para inferência de modelo multi-implementação Market Bloom Energy Q2 supera expectativas e eleva guidance do ano fiscal de 2026 para receita de $3,9–4,2B Chips NVIDIA Jetson T3000/T2000: Módulos Thor Alimentados por Blackwell para Escala de Robótica de Borda Breaking Moonshot Kimi K3: EUA Alegam Distilação, China Nega; Lacuna de Evidência de 15 Dias Emerge Breaking Sam Altman: Incidente de Segurança de IA Catalisa Repensa de Ritmo de Desenvolvimento Research AI2 lança OlmoEarth: modelos de fundação geoespacial de código aberto superando alternativas comerciais maiores Chips Huang da Nvidia: indústria de semicondutores deve crescer 10x para alimentar 100 bilhões de agentes de IA Breaking Grafana Assistant Agora Consulta 30+ Fontes de Dados via Linguagem Natural Research OpenAI publica relatório de campo: agentes de codificação aceleram modernização de software científico em genômica e ciências da vida Research Liquid AI lança codificadores eficientes em CPU LFM2.5: modelos 230M/350M superam alternativas maiores em tarefas de contexto longo Market Apple brevemente toca $5 trilhões de capitalização de mercado, ultrapassa Nvidia em debate de capex de IA Funding Mate Security fecha $35M em Série A, alcançando $50M total; crescimento de 500% desde Q3 2025 Chips Microsoft Surface Laptop Ultra executa Nvidia RTX Spark N1X: 20 núcleos Arm, 6.144 núcleos GPU Blackwell, 128GB LPDDR5X unificado Market Koch explora venda de $15B da Edged, desenvolvedora de data centers, conforme demanda de computação para IA impulsiona avaliações Funding Mate Security arrecada $35M em Serie A, financiamento total ultrapassa $50M Chips Microchip adquire chipmaker de edge AI Hailo para portfolio de IA
Breaking

Together AI lança roteamento de tráfego ciente de capacidade para inferência de modelo multi-implementação

Together AI anunciou um novo modelo de implementação para inferência de modelo configurável em sua plataforma, permitindo roteamento de tráfego ciente de capacidade em múltiplas combinações de modelo + hardware. A arquitetura desacopla endpoints (identidades API fixas), implementações (modelo + configuração + réplicas) e configs (engine, tipo/contagem GPU, paralelismo, perfil de otimização). Esta separação permite rollouts de modelo sem tempo de inatividade, testes A/B, experiências de sombra e escalonamento automático sem rebalanciamento manual de peso de tráfego.

Configs são imutáveis e emparelhadas com revisões de modelo certificadas; implementações são efemerá rias e criadas/destruídas rotineiramente. Divisões de tráfego pesam cada implementação por sua contagem de réplicas prontas e peso especificado, portanto o escalonamento automático ajusta automaticamente a parcela de tráfego: uma implementação dimensionando de 1 a 3 réplicas absorve 3x tráfego proporcionalmente. O eixo de otimização permite que os usuários escolham entre latência (lotes menores, tempo-para-primeiro-token mais rápido) e throughput (lotes maiores, max tokens/GPU-hora). O catálogo de modelo público da plataforma vem com configs pré-certificados para modelos principais (Qwen, Llama, variantes GLM) com perfiamento de hardware em H100, H200, B200.

Para arquitetos: Esta é table-stakes para maturidade de plataforma de inferência— Replicate e HuggingFace Inference endpoints têm primitivos similares, mas roteamento ciente de capacidade explícito do Together é elegante. O modelo weight-per-replica significa que load-balancing e escalonamento automático se compõem naturalmente. Se a plataforma é confiável e o catálogo de config cresce, isso se torna uma forma portátil, hardware-agñostica de gerenciar inferência multi-modelo. Observe a adoção por usuários de vLLM buscando inferência gerenciada sem reconstruir orquestração.

Fontes