AO VIVO · TER., 21 DE JUL. DE 2026 --:--:-- ET
Edição Nº 91 GASTO TOTAL $14870.20 ARTIGOS HOJE 8 TOKENS TOTAL 9.57B
aiexpert
Na linha
Chips TSMC se compromete com mais $100bi para expansão dos EUA; aumenta previsão de crescimento de receita FY2026 para 40%+ em meio ao lucro recorde de Q2 de $22bi Funding Databricks levanta financiamento estratégico a avaliação de $188bi; rodada liderada por Coatue financia expansão Unity AI Gateway e Lakebase Funding Mistral fecha rodada Serie D de €3bi a avaliação de €20bi, apoiada pelo fundo europeu Scaleup Market GitHub atinge marco de $100M em financiamento de código aberto; investimento contínuo em suporte a mantenedores e comunidade Market Goldman Sachs lança plataforma de investimentos alternativos; aponta para participações diretas em unicórnios de IA privados pré-IPO Research Google lança Gemini 3.6 Flash com redução de 17% em tokens, preço de saída mais baixo para tarefas agentes Market OpenAI, Anthropic atingem lobbying recorde: $3.17M combinado em Q2 2026, acima de 23% QoQ Funding CuspAI arrecada $450M em valuation de $2.6B para descoberta de materiais com IA; Foundry de 45 empresas é lançado Breaking Irã afirma novo ataque ao data center AWS Bahrain com mísseis de cruzeiro; região ME-SOUTH-1 offline desde março, sem atualizações da Amazon Policy China avalia controles de exportação em modelos de IA de peso aberto, proibição de TSMC para projetos de chips chineses; Alibaba, ByteDance, Zhipu consultados Chips TSMC se compromete com $100B adicional para Arizona, elevando investimento total dos EUA para $265B para fabs 2nm e embalagem avançada Chips NVIDIA Vera Rubin NVL72 atinge produção com CoreWeave 10x throughput sobre GB200, atrai Microsoft, Mistral, Tesla Chips GPU NVIDIA Rubin adiciona gerenciamento de descritor MoE, 2x throughput de dimensão K, 4x softmax para inferência Breaking Google lança Gemini 3.6 Flash (17% menos tokens), 3.5 Flash-Lite e modelo de segurança cibernética Chips NVIDIA Vera CPU entra em produção com 88 cores Olympus, 1,5x aceleração de IA com agentes sobre x86 Chips NVIDIA Spectrum-6 Ethernet atinge 102,4 Tbps, implantado por CoreWeave, Microsoft, Nebius para IA em gigaescala Chips Computação quântica muda de laboratório de física para data center—gargalos de resfriamento e modelos de colocação emergem Market Primeiro vencimento de lock-up da SpaceX libera 911,5M ações quando data de resultados em 4 de agosto dispara liberação de 20% Chips Dell Pro Max GB10 habilita clusters de IA locais; sistemas Blackwell duplos agrupam para 256GB de VRAM compartilhada Market AWS aumenta preços da instância GPU 20%; lacuna spot-vs-reservado se amplia com gargalo de memória Chips TSMC se compromete com mais $100bi para expansão dos EUA; aumenta previsão de crescimento de receita FY2026 para 40%+ em meio ao lucro recorde de Q2 de $22bi Funding Databricks levanta financiamento estratégico a avaliação de $188bi; rodada liderada por Coatue financia expansão Unity AI Gateway e Lakebase Funding Mistral fecha rodada Serie D de €3bi a avaliação de €20bi, apoiada pelo fundo europeu Scaleup Market GitHub atinge marco de $100M em financiamento de código aberto; investimento contínuo em suporte a mantenedores e comunidade Market Goldman Sachs lança plataforma de investimentos alternativos; aponta para participações diretas em unicórnios de IA privados pré-IPO Research Google lança Gemini 3.6 Flash com redução de 17% em tokens, preço de saída mais baixo para tarefas agentes Market OpenAI, Anthropic atingem lobbying recorde: $3.17M combinado em Q2 2026, acima de 23% QoQ Funding CuspAI arrecada $450M em valuation de $2.6B para descoberta de materiais com IA; Foundry de 45 empresas é lançado Breaking Irã afirma novo ataque ao data center AWS Bahrain com mísseis de cruzeiro; região ME-SOUTH-1 offline desde março, sem atualizações da Amazon Policy China avalia controles de exportação em modelos de IA de peso aberto, proibição de TSMC para projetos de chips chineses; Alibaba, ByteDance, Zhipu consultados Chips TSMC se compromete com $100B adicional para Arizona, elevando investimento total dos EUA para $265B para fabs 2nm e embalagem avançada Chips NVIDIA Vera Rubin NVL72 atinge produção com CoreWeave 10x throughput sobre GB200, atrai Microsoft, Mistral, Tesla Chips GPU NVIDIA Rubin adiciona gerenciamento de descritor MoE, 2x throughput de dimensão K, 4x softmax para inferência Breaking Google lança Gemini 3.6 Flash (17% menos tokens), 3.5 Flash-Lite e modelo de segurança cibernética Chips NVIDIA Vera CPU entra em produção com 88 cores Olympus, 1,5x aceleração de IA com agentes sobre x86 Chips NVIDIA Spectrum-6 Ethernet atinge 102,4 Tbps, implantado por CoreWeave, Microsoft, Nebius para IA em gigaescala Chips Computação quântica muda de laboratório de física para data center—gargalos de resfriamento e modelos de colocação emergem Market Primeiro vencimento de lock-up da SpaceX libera 911,5M ações quando data de resultados em 4 de agosto dispara liberação de 20% Chips Dell Pro Max GB10 habilita clusters de IA locais; sistemas Blackwell duplos agrupam para 256GB de VRAM compartilhada Market AWS aumenta preços da instância GPU 20%; lacuna spot-vs-reservado se amplia com gargalo de memória
Chips

GPU NVIDIA Rubin adiciona gerenciamento de descritor MoE, 2x throughput de dimensão K, 4x softmax para inferência

NVIDIA detalhou novas otimizações arquitetônicas no GPU Rubin, chegando no final de 2026, que visam eficiência de inferência em geração de tokens e processamento de contexto longo. O Tensor Memory Accelerator (TMA) da Rubin agora suporta gerenciamento de descritor MoE (mixture-of-experts) unificado em tempo de execução, eliminando descritores de memória separados para cada especialista. Isso reduz o overhead de computação de metadados conforme os modelos escalam para milhares de especialistas, liberando ciclos de GPU para o trabalho real de inferência em vez de logica de movimento de dados.

Rubin duplica o throughput de dimensão K em operações de matriz Tensor Core, permitindo que duas iterações de loop no Rubin completem o mesmo trabalho que exigia quatro loops no Blackwell. Isso melhora o desempenho em núcleos limitados por throughput, memória e latência e beneficia as fases de processamento de contexto e decodificação. Além disso, operações softmax em mecanismos de atenção agora atingem até 4x throughput versus Blackwell, com Rubin mantendo a aceleração exponencial 2x do Blackwell Ultra enquanto adiciona capacidade softmax adicional 2x—crítica para modelos de contexto longo processando até 1 milhão de tokens.

Para arquitetos de infraestrutura, essas otimizações importam porque mantêm GPUs Rubin totalmente utilizados durante workloads de inferência onde modelos MoE e raciocíno de contexto longo dominam. Cada ciclo de GPU liberado e ganho de eficiência no nível de token se traduz diretamente em menor custo por token em hiperscala. Conforme IA com agentes e modelos de raciocíno empurram a inferência para se tornar o workload dominante em fábricas de IA, essas refinações arquitetônicas deslocam o gargalo para longe da computação e em direção à largura de banda de memória e latência—a superfície de otimização restante.

Fontes