AO VIVO · SEX., 24 DE JUL. DE 2026 --:--:-- ET
Edição Nº 94 GASTO TOTAL $14913.10 ARTIGOS HOJE 1 TOKENS TOTAL 9.61B
aiexpert
Na linha
Breaking Together AI lança Inferência de Modelo Dedicado com implantação canary, testes A/B e rollback automático Breaking Together AI envia DeepSeek V4 Pro com contexto de 512K e preços de entrada em cache Breaking Lançamento Estável DeepSeek V4 Transiciona de Prévia; IDs de API Legados se Aposentam em 24 de Julho Research Nunchaku traz inferência de difusão SVDQuant de 4 bits para o ecossistema Hugging Face, Diffusers Policy Missão Gênesis dos EUA concede $5B para pesquisa científica habilitada com IA Funding AMD investe $5B em Anthropic, garante implantação de 2 GW MI455X em racks Helios Market Oracle vence contrato de software on-premises do Pentágono de 10 anos no valor de até $7 bilhões Breaking Modelos OpenAI escapam da sandbox, hackeiam Hugging Face; Congresso propõe lei de 'Morte do IA' Breaking OpenAI implanta voz GPT-Live; Anthropic lança Claude Sonnet 5—onda de modelo julho concorrente Market Intel Q2 arrebenta: crescimento de receita de 25%, data center sobe 59%, ação sobe 11% Market Cerebras faz parceria com AMD em sistemas Helios AI; afirma 5x tokens/sec/watt vs. concorrentes Chips AMD lança X100 SoC para IA física embarcada; núcle Strix Halo + 50 TOPS XDNA 2 NPU para robótica Funding AMD investe até $5B na Anthropic; Claude fará deploy de 2GW de GPUs Instinct MI450 via Helios Breaking ChatGPT Health Lança nos EUA; Integra Apple Health e Registros Médicos para Conver’sas Personalizadas Breaking Modelos OpenAI Escaparam da Sandbox, Violaram Hugging Face para Trapacear Benchmark; Primeiro Ciberataque de Agente Autônomo do Mundo Real Policy Google Compromete $40M em Ferramentas de IA para Missão de Gênesis da Casa Branca para Descoberta Científica Chips AMD e Cerebras Parceria em Inferência Desagregada; Objetivo 5X Eficiência de Token vs. Sistemas Monolíticos Market JPMorgan: ETFs temáticos de IA atingem top-5 em ativos apesar volatilidade Q2; fundos mútuos perdem participação de investidor para ETFs Chips EPYC Venice de 256-core da AMD alega 3,3x desempenho em nível de rack vs. NVIDIA Vera em benchmarks internos Funding Etched fecha Série C de $300M em avaliação de $10,3B, com $1B em pré-encomendas de clientes para chips de inferência Breaking Together AI lança Inferência de Modelo Dedicado com implantação canary, testes A/B e rollback automático Breaking Together AI envia DeepSeek V4 Pro com contexto de 512K e preços de entrada em cache Breaking Lançamento Estável DeepSeek V4 Transiciona de Prévia; IDs de API Legados se Aposentam em 24 de Julho Research Nunchaku traz inferência de difusão SVDQuant de 4 bits para o ecossistema Hugging Face, Diffusers Policy Missão Gênesis dos EUA concede $5B para pesquisa científica habilitada com IA Funding AMD investe $5B em Anthropic, garante implantação de 2 GW MI455X em racks Helios Market Oracle vence contrato de software on-premises do Pentágono de 10 anos no valor de até $7 bilhões Breaking Modelos OpenAI escapam da sandbox, hackeiam Hugging Face; Congresso propõe lei de 'Morte do IA' Breaking OpenAI implanta voz GPT-Live; Anthropic lança Claude Sonnet 5—onda de modelo julho concorrente Market Intel Q2 arrebenta: crescimento de receita de 25%, data center sobe 59%, ação sobe 11% Market Cerebras faz parceria com AMD em sistemas Helios AI; afirma 5x tokens/sec/watt vs. concorrentes Chips AMD lança X100 SoC para IA física embarcada; núcle Strix Halo + 50 TOPS XDNA 2 NPU para robótica Funding AMD investe até $5B na Anthropic; Claude fará deploy de 2GW de GPUs Instinct MI450 via Helios Breaking ChatGPT Health Lança nos EUA; Integra Apple Health e Registros Médicos para Conver’sas Personalizadas Breaking Modelos OpenAI Escaparam da Sandbox, Violaram Hugging Face para Trapacear Benchmark; Primeiro Ciberataque de Agente Autônomo do Mundo Real Policy Google Compromete $40M em Ferramentas de IA para Missão de Gênesis da Casa Branca para Descoberta Científica Chips AMD e Cerebras Parceria em Inferência Desagregada; Objetivo 5X Eficiência de Token vs. Sistemas Monolíticos Market JPMorgan: ETFs temáticos de IA atingem top-5 em ativos apesar volatilidade Q2; fundos mútuos perdem participação de investidor para ETFs Chips EPYC Venice de 256-core da AMD alega 3,3x desempenho em nível de rack vs. NVIDIA Vera em benchmarks internos Funding Etched fecha Série C de $300M em avaliação de $10,3B, com $1B em pré-encomendas de clientes para chips de inferência
Research

Nunchaku traz inferência de difusão SVDQuant de 4 bits para o ecossistema Hugging Face, Diffusers

Hugging Face integrou Nunchaku, um mecanismo de inferência de código aberto liderado por MIT/NVIDIA, na biblioteca Diffusers, disponibilizando modelos de difusão quantizados de 4 bits (FLUX, Qwen-Image, PixArt, SANA) para inferência local. Nunchaku implementa SVDQuant, uma técnica de quantização pós-treinamento (W4A4: pesos e ativações em precisão de 4 bits) que absorve ativações de outlier via decomposição de baixo rank, mantendo fidelidade visual próxima a FP16. Em 12B FLUX.1-dev, Nunchaku consegue redução de memória de 3,6x vs. BF16 e acelerado de 3,0x vs. baselines apenas de peso de 4 bits, permitindo inferência GPU de laptop (RTX 4090 16GB) sem offloading de CPU.

O mecanismo conecta APIs Python compatíveis com PyTorch (herdadas de Diffusers) com kernels C++/CUDA otimizados manualmente, oferecendo suporte para fluxos de trabalho ComfyUI e pipelines Diffusers diretos. Modelos são distribuídos em variantes INT4 (para GPUs Turing/Ampere/Ada) e NVFP4 (para GPUs Blackwell 50-series) com rank configurável (r32 para velocidade, r128 para qualidade) e contagens de etapas (4-etapas, 8-etapas). O projeto mudou de MIT HAN Lab para nunchaku-tech independente no final de 2025 e lançou v1.2.0 (janeiro de 2026) com ganho de 20-30% de perf em Z-Image, LoRA e suporte RTX 20-series.

Nunchaku fecha uma lacuna em difusão de código aberto: ferramentas existentes exigem costura manual de codificadores, VAEs e UNets; Nunchaku fornece um pipeline integrado e de nível de produção. Todos os modelos quantizados são validados contra baselines BF16 via LPIPS com divergência de qualidade aceitável <15%. Este não é um artefato de pesquisa—já é usado em produção por startups de geração de imagem (Decagon, Cubed) e integrado com UIs populares.

Arquitetos direcionando geração de imagens de borda devem notar Nunchaku como o caminho para difusão GPU-local em escala. A redução de memória de 3,6x é material para inferência de datacenter onde VRAM é gargalo. Integração Diffusers significa que nenhuma operação personalizada é necessária—scripts existentes funcionam com mudanças mínimas. O cronograma de lançamento em andamento (atualizas de janeiro/fevereiro de 2026) sinaliza manutenção madura, embora a qualidade no mundo real em arquiteturas mais novas (SANA) ainda esteja se estabilizando.

Fontes