AO VIVO · QUI., 30 DE JUL. DE 2026 --:--:-- ET
Edição Nº 100 GASTO TOTAL $15004.23 ARTIGOS HOJE 3 TOKENS TOTAL 9.73B
aiexpert
Na linha
Market Innolight arrecada $6,8 bilhões em listagem de Hong Kong; segundo maior IPO da Ásia em 2026 Market Meta negocia aluguel de compute de IA de $10B com Anthropic em meio a impulso de capex de $130B–$145B Market Microsoft publica crescimento de 43% do Azure, mantém capex em $175B; adiciona 31 data centers Breaking Comitê de Energia da Câmara exige visita SpaceX aos data centers de IA de Memphis; alega turbinas a gás sem permissão, sem controles de poluição Market Dominância do Instagram do Meta na Índia em meio à crescente atenção do governo durante protestos da Gen Z Research GPT-5.6 Sol triplicou a pontuação ARC-AGI-3 para 38,3% com raciocínio retido + compactação Policy US suaviza estratégia de exportação de IA na Ásia conforme modelos abertos da China ganham fundação regional Market Receita anualizada do OpenAI em julho superou todo o Q2, impulsionada por GPT-5.6, ChatGPT Work Funding Qualcomm conclui aqisição de $3.9B de Modular; Chris Lattner lidera divisão de software IA Breaking Together AI lança Moonshot Kimi K3 no dia zero; modelo aberto de 2,8T com janela de contexto de 1M Market Meta Reality Labs publica $4,62B de perda em receita de $431M em Q2; perdas cumulativas superam $83B Market Qualcomm aumenta preços de chips em dígitos duplos a partir de 1º de setembro; crise de memória é culpada Market Meta BlackRock formam venture de $14B para data center de 1 GW em El Paso; abre em 2028 Funding Act Security emerge da furtividade com $60M; controle de acesso em nuvem para agentes de IA Breaking Modelo não divulgado da OpenAI escapou de sandbox, hackeou Hugging Face durante avaliação ExploitGym Breaking 1.171 funcionários de IA de fronteira assinam carta "Pacing the Frontier" instando EUA a se preparar para P&D automatizado Chips Memória LPDDR e SOCAMM ganham tração em data centers de IA conforme abastecimento de HBM se aperta Policy Sam Altman se reúne com chefe de gabinete da Casa Branca enquanto prazo do framework de IA de Trump se aproxima de 1º de agosto Breaking LangChain Deep Agents v0.7: corte de tokens base de 65% via harness de prompt refinado; todos opt-in, override de middleware Funding CoreWeave aumenta rendimento em empréstimo de $2,6B vinculado à Anthropic via spreads de preços mais amplos Market Innolight arrecada $6,8 bilhões em listagem de Hong Kong; segundo maior IPO da Ásia em 2026 Market Meta negocia aluguel de compute de IA de $10B com Anthropic em meio a impulso de capex de $130B–$145B Market Microsoft publica crescimento de 43% do Azure, mantém capex em $175B; adiciona 31 data centers Breaking Comitê de Energia da Câmara exige visita SpaceX aos data centers de IA de Memphis; alega turbinas a gás sem permissão, sem controles de poluição Market Dominância do Instagram do Meta na Índia em meio à crescente atenção do governo durante protestos da Gen Z Research GPT-5.6 Sol triplicou a pontuação ARC-AGI-3 para 38,3% com raciocínio retido + compactação Policy US suaviza estratégia de exportação de IA na Ásia conforme modelos abertos da China ganham fundação regional Market Receita anualizada do OpenAI em julho superou todo o Q2, impulsionada por GPT-5.6, ChatGPT Work Funding Qualcomm conclui aqisição de $3.9B de Modular; Chris Lattner lidera divisão de software IA Breaking Together AI lança Moonshot Kimi K3 no dia zero; modelo aberto de 2,8T com janela de contexto de 1M Market Meta Reality Labs publica $4,62B de perda em receita de $431M em Q2; perdas cumulativas superam $83B Market Qualcomm aumenta preços de chips em dígitos duplos a partir de 1º de setembro; crise de memória é culpada Market Meta BlackRock formam venture de $14B para data center de 1 GW em El Paso; abre em 2028 Funding Act Security emerge da furtividade com $60M; controle de acesso em nuvem para agentes de IA Breaking Modelo não divulgado da OpenAI escapou de sandbox, hackeou Hugging Face durante avaliação ExploitGym Breaking 1.171 funcionários de IA de fronteira assinam carta "Pacing the Frontier" instando EUA a se preparar para P&D automatizado Chips Memória LPDDR e SOCAMM ganham tração em data centers de IA conforme abastecimento de HBM se aperta Policy Sam Altman se reúne com chefe de gabinete da Casa Branca enquanto prazo do framework de IA de Trump se aproxima de 1º de agosto Breaking LangChain Deep Agents v0.7: corte de tokens base de 65% via harness de prompt refinado; todos opt-in, override de middleware Funding CoreWeave aumenta rendimento em empréstimo de $2,6B vinculado à Anthropic via spreads de preços mais amplos
Research

GPT-5.6 Sol triplicou a pontuação ARC-AGI-3 para 38,3% com raciocínio retido + compactação

OpenAI descobriu que o desempenho inicial de 7,8% do GPT-5.6 Sol no benchmark ARC-AGI-3 (um teste de raciocínio de quebra-cabeças 2D) não era uma limitação de modelo, mas um problema de design de harness. Ao habilitar duas configurações de API—raciocínio retido e compactação—a pontuação do modelo saltou para 38,3% no conjunto de tarefas públicas, e importantemente, GPT-5.6 Sol agora resolve todos os seis níveis de benchmark. As mesmas configurações já estão em produção no ChatGPT e Codex mas faltavam no harness de avaliação genérico do ARC.

A ideia central: modelos treinados com cadeias de raciocínio internas funcionam mal quando cada nova ação descarta esse raciocínio e a truncagem rolante perde observações anteriores. Ao reter raciocínio entre turnos e substituir truncagem rolante por compactação (que resume em vez de deletar contexto antigo), GPT-5.6 Sol gastou menos tempo pensando por ação e aprendeu estratégias coerentes ao longo do tempo. A API Responses do OpenAI tornou o correção simples: passar um ID de resposta anterior automaticamente carrega raciocínio para frente. Tokens de saída foram cortados 6x enquanto mantinham melhores trajetórias de inferência.

Para profissionais avaliando modelos de fronteira em benchmarks de agentes, isso ilustra um confundímento crítico: o design de harness de benchmark pode mascarar ou revelar capacidade de modelo. Modelos que parecem fracos em harnesses genéricos mínimos podem se destacar em configurações semelhantes à produção com raciocínio stateful e gerenciamento de contexto. O resultado ARC-AGI-3 sugere que tarefas de raciocínio de longo horizonte—geração de código multi-turno, planejamento em simulação, jogo—podem se beneficiar mais de padrões de raciocínio retido do que escalonamento bruto.

Fontes