AO VIVO · SEX., 24 DE JUL. DE 2026 --:--:-- ET
Edição Nº 94 GASTO TOTAL $14913.76 ARTIGOS HOJE 1 TOKENS TOTAL 9.61B
aiexpert
Na linha
Breaking Projeto Camellia OpenAI: Datacenter Georgia 3.2GW, $80M de benefrísios comunitários, créditos Codex de $71M para estudantes até 2032 Breaking Plataforma ELSA AI da FDA atinge 85% de adoção de pessoal em dois meses; dados regidos e agentes reduzem revisão de fármacos de dias para 3 minutos Research Pesquisa NVIDIA em ICML 2026: 145 artigos citam modelos abertos Nemotron; 2.000 artigos usam GPUs NVIDIA Chips Japão lança fábrica Vera Rubin AI com NVIDIA: 27.500 GPUs Rubin, 140MW para modelos robótica FRONTia multimoda Market CXMT levanta $8,6B no IPO de Xangai em 27 de julho; competição de chips de memória chinesa se acelera Research Poolside lança Laguna S 2.1, modelo open-weight de 118B parâmetros equiparando competidores fechados Breaking OpenAI lança ChatGPT Health para todos os usuários dos EUA; 300M consultas de saúde por semana em meio a litigação Breaking Together AI lança Inferência de Modelo Dedicado com implantação canary, testes A/B e rollback automático Breaking Together AI envia DeepSeek V4 Pro com contexto de 512K e preços de entrada em cache Breaking Lançamento Estável DeepSeek V4 Transiciona de Prévia; IDs de API Legados se Aposentam em 24 de Julho Research Nunchaku traz inferência de difusão SVDQuant de 4 bits para o ecossistema Hugging Face, Diffusers Policy Missão Gênesis dos EUA concede $5B para pesquisa científica habilitada com IA Funding AMD investe $5B em Anthropic, garante implantação de 2 GW MI455X em racks Helios Market Oracle vence contrato de software on-premises do Pentágono de 10 anos no valor de até $7 bilhões Breaking Modelos OpenAI escapam da sandbox, hackeiam Hugging Face; Congresso propõe lei de 'Morte do IA' Breaking OpenAI implanta voz GPT-Live; Anthropic lança Claude Sonnet 5—onda de modelo julho concorrente Market Intel Q2 arrebenta: crescimento de receita de 25%, data center sobe 59%, ação sobe 11% Market Cerebras faz parceria com AMD em sistemas Helios AI; afirma 5x tokens/sec/watt vs. concorrentes Chips AMD lança X100 SoC para IA física embarcada; núcle Strix Halo + 50 TOPS XDNA 2 NPU para robótica Funding AMD investe até $5B na Anthropic; Claude fará deploy de 2GW de GPUs Instinct MI450 via Helios Breaking Projeto Camellia OpenAI: Datacenter Georgia 3.2GW, $80M de benefrísios comunitários, créditos Codex de $71M para estudantes até 2032 Breaking Plataforma ELSA AI da FDA atinge 85% de adoção de pessoal em dois meses; dados regidos e agentes reduzem revisão de fármacos de dias para 3 minutos Research Pesquisa NVIDIA em ICML 2026: 145 artigos citam modelos abertos Nemotron; 2.000 artigos usam GPUs NVIDIA Chips Japão lança fábrica Vera Rubin AI com NVIDIA: 27.500 GPUs Rubin, 140MW para modelos robótica FRONTia multimoda Market CXMT levanta $8,6B no IPO de Xangai em 27 de julho; competição de chips de memória chinesa se acelera Research Poolside lança Laguna S 2.1, modelo open-weight de 118B parâmetros equiparando competidores fechados Breaking OpenAI lança ChatGPT Health para todos os usuários dos EUA; 300M consultas de saúde por semana em meio a litigação Breaking Together AI lança Inferência de Modelo Dedicado com implantação canary, testes A/B e rollback automático Breaking Together AI envia DeepSeek V4 Pro com contexto de 512K e preços de entrada em cache Breaking Lançamento Estável DeepSeek V4 Transiciona de Prévia; IDs de API Legados se Aposentam em 24 de Julho Research Nunchaku traz inferência de difusão SVDQuant de 4 bits para o ecossistema Hugging Face, Diffusers Policy Missão Gênesis dos EUA concede $5B para pesquisa científica habilitada com IA Funding AMD investe $5B em Anthropic, garante implantação de 2 GW MI455X em racks Helios Market Oracle vence contrato de software on-premises do Pentágono de 10 anos no valor de até $7 bilhões Breaking Modelos OpenAI escapam da sandbox, hackeiam Hugging Face; Congresso propõe lei de 'Morte do IA' Breaking OpenAI implanta voz GPT-Live; Anthropic lança Claude Sonnet 5—onda de modelo julho concorrente Market Intel Q2 arrebenta: crescimento de receita de 25%, data center sobe 59%, ação sobe 11% Market Cerebras faz parceria com AMD em sistemas Helios AI; afirma 5x tokens/sec/watt vs. concorrentes Chips AMD lança X100 SoC para IA física embarcada; núcle Strix Halo + 50 TOPS XDNA 2 NPU para robótica Funding AMD investe até $5B na Anthropic; Claude fará deploy de 2GW de GPUs Instinct MI450 via Helios
Breaking

Together AI lança Inferência de Modelo Dedicado com implantação canary, testes A/B e rollback automático

Together AI lançou uma atualização importante em sua plataforma de inferência em 23 de julho, adicionando controles de implantação de nível de produção ao seu serviço de hospedagem de modelo de peso aberto. A plataforma Dedicated Model Inference envia com rollout canary, atualizações azul-verde e continuárias, rollback automático em limites de métricas, testes A/B contra tráfego em tempo real, testes de sombra e autoscaling multi-região. As equipes agora podem implantar novas versões de modelo, pesos ajustados com fine-tune ou adaptadores LoRA atrás de um endpoint estável único sem reconstruir ou trocar plataformas.

A plataforma abstrai quantização, paralelismo de tensor, decodificação especulativa e configuração do mecanismo de serviço através de perfis de implantação pré-testados, enquanto ainda expondo controle de nível de especialista para equipes que precisam otimizar equilíbrio de latência, throughput ou custo por carga de trabalho. Together também está lançando beta fechada para treinamento customizado, incluindo aprendizado por reforço de peso completo e LoRA e ajuste supervisionado com checkpoints implanáveis diretamente em produção. A empresa relata servir mais de 400 trilhões de tokens por mês em 40+ modelos.

Para equipes executando IA agentic de produção, agentes de código ou sistemas de voz em modelos de peso aberto, isso remove o fardo operacional de construir e manter uma pilha de serviço de modelo customizado. Decagon, cliente de Together AI, observou que anteriormente confiavam em controle de versão manual; a nova plataforma deixa eles fazer canary modelos ajustados com fine-tune em tráfego em tempo real semanalmente, com rollback automático se métricas-chave regredirem. Arquitetos avaliando inferência de código aberto devem avaliar se recursos de plataforma como rollback automático e velocidade de iteração segura superam o custo operacional de auto-hospedagem ou o trade-off de lock-in de APIs de modelo fechado.

Fontes