AO VIVO · SEX., 24 DE JUL. DE 2026 --:--:-- ET
Edição Nº 94 GASTO TOTAL $14918.63 ARTIGOS HOJE 2 TOKENS TOTAL 9.62B
aiexpert
Na linha
Breaking Anthropic atualiza Claude Voice para modelos Opus/Sonnet; arquitetura turn-based compete com GPT-Live full-duplex de OpenAI em acesso a ferramentas, não naturalidade de fala Research LangChain publica framework de benchmark Deep Agents; três suite eval (Harbor-Index, τ³-bench, ContextBench) estabelecem padrão de autonomia de agente longo-horizonte Research Black Forest Labs FLUX 3: modelo multimodal unificado gera vídeo, áudio e ações robô de arquitetura única Breaking NVIDIA, KAIST lançam primeiro lab de IA conjunta na Coréia; co-desenvolvimento de memória SK expandido Policy Genesis Mission dos EUA implanta $5B+ para 278 projetos de IA-para-ciência em 50 estados Funding NVIDIA se compromete com US$ 300M (US$ 50M/ano) com lab de IA agentífca KAIST; primeiro lab conjunto com universidade coreana Breaking Plataforma STAR da Expedia usa LLMs para análise de causa raíz de incidentes; fluxos de trabalho determinísticos reduzem tempo médio de recuperação Breaking Sistema Siemens Fuse EDA AI automatiza fluxos de trabalho de design de chips; transforma tarefas de horas em segundos Policy Reino Unido desmantel a DSIT, eleva ministro de IA para gabinete; breve de IA se move mais perto do primeiro-ministro Funding AMD garante acordo de 2GW com Anthropic, investe $5B no criador do Claude para rivalizar com Nvidia em chips de IA Research Nvidia lança modelo genomics DNA; aprende o que predição token perde em dados biológicos Breaking Black Forest Labs lança FLUX 3, modelo multimodal unificado para imagem, vídeo, áudio e ação de robô Breaking Microsoft Project Perception: roteamento de segurança multi-modelo reduz custo do Anthropic Mythos em 50% Research Moonshot Kimi K3: modelo open-weight chinês lidera benchmark Arena, ultrapassa Claude em código Funding Anthropic em conversas preliminares com Meta para acordo de compute de $10B; terceira parceria maior de infraestrutura Funding Anthropic Protocola para IPO; ARR de Claude Atingiu US$ 47B em Maio, Ultrapassa Avaliação OpenAI em US$ 965B Series H Policy 21 Economias APEC Apoiam IA de Código Aberto com 'Garantia de Segurança Forte' na Cúpula de Chengdu Breaking Projeto Camellia OpenAI: Datacenter Georgia 3.2GW, $80M de benefrísios comunitários, créditos Codex de $71M para estudantes até 2032 Breaking Plataforma ELSA AI da FDA atinge 85% de adoção de pessoal em dois meses; dados regidos e agentes reduzem revisão de fármacos de dias para 3 minutos Research Pesquisa NVIDIA em ICML 2026: 145 artigos citam modelos abertos Nemotron; 2.000 artigos usam GPUs NVIDIA Breaking Anthropic atualiza Claude Voice para modelos Opus/Sonnet; arquitetura turn-based compete com GPT-Live full-duplex de OpenAI em acesso a ferramentas, não naturalidade de fala Research LangChain publica framework de benchmark Deep Agents; três suite eval (Harbor-Index, τ³-bench, ContextBench) estabelecem padrão de autonomia de agente longo-horizonte Research Black Forest Labs FLUX 3: modelo multimodal unificado gera vídeo, áudio e ações robô de arquitetura única Breaking NVIDIA, KAIST lançam primeiro lab de IA conjunta na Coréia; co-desenvolvimento de memória SK expandido Policy Genesis Mission dos EUA implanta $5B+ para 278 projetos de IA-para-ciência em 50 estados Funding NVIDIA se compromete com US$ 300M (US$ 50M/ano) com lab de IA agentífca KAIST; primeiro lab conjunto com universidade coreana Breaking Plataforma STAR da Expedia usa LLMs para análise de causa raíz de incidentes; fluxos de trabalho determinísticos reduzem tempo médio de recuperação Breaking Sistema Siemens Fuse EDA AI automatiza fluxos de trabalho de design de chips; transforma tarefas de horas em segundos Policy Reino Unido desmantel a DSIT, eleva ministro de IA para gabinete; breve de IA se move mais perto do primeiro-ministro Funding AMD garante acordo de 2GW com Anthropic, investe $5B no criador do Claude para rivalizar com Nvidia em chips de IA Research Nvidia lança modelo genomics DNA; aprende o que predição token perde em dados biológicos Breaking Black Forest Labs lança FLUX 3, modelo multimodal unificado para imagem, vídeo, áudio e ação de robô Breaking Microsoft Project Perception: roteamento de segurança multi-modelo reduz custo do Anthropic Mythos em 50% Research Moonshot Kimi K3: modelo open-weight chinês lidera benchmark Arena, ultrapassa Claude em código Funding Anthropic em conversas preliminares com Meta para acordo de compute de $10B; terceira parceria maior de infraestrutura Funding Anthropic Protocola para IPO; ARR de Claude Atingiu US$ 47B em Maio, Ultrapassa Avaliação OpenAI em US$ 965B Series H Policy 21 Economias APEC Apoiam IA de Código Aberto com 'Garantia de Segurança Forte' na Cúpula de Chengdu Breaking Projeto Camellia OpenAI: Datacenter Georgia 3.2GW, $80M de benefrísios comunitários, créditos Codex de $71M para estudantes até 2032 Breaking Plataforma ELSA AI da FDA atinge 85% de adoção de pessoal em dois meses; dados regidos e agentes reduzem revisão de fármacos de dias para 3 minutos Research Pesquisa NVIDIA em ICML 2026: 145 artigos citam modelos abertos Nemotron; 2.000 artigos usam GPUs NVIDIA
Research

LangChain publica framework de benchmark Deep Agents; três suite eval (Harbor-Index, τ³-bench, ContextBench) estabelecem padrão de autonomia de agente longo-horizonte

LangChain publicou um blog detalhando sua metodologia de avaliação para Deep Agents, seu harness de agente de código aberto e agnóstico de modelo. O framework aborda o desafio central: avaliação de agente é fundamentalmente mais difícil que avaliação de LLM porque resultados dependem de ambiente, definição de tarefa, seleção de ferramenta e mudanças de estado intermediário—não apenas a resposta final. LangChain executa três suites de benchmark separadas: Harbor-Index (82 tarefas end-to-end destiladas de 6.000+ candidatos em engenharia de software, busca, análise de dados e uso de ferramentas), τ³-bench (30 tarefas de conversa multiturn com usuários simulados e resultados com pontos), e ContextBench (30 tarefas de recuperação com corporações completas sandboxed para cada tarefa, requerendo agentes para encontrar e unir respostas).

Metodologia de avaliação enfatiza não-determinismo: agentes são inerentemente estocásticos, então tarefas executam múltiplas vezes para reunir estimativas calibradas. LangChain mantém um benchmark "lite" (~8x mais rápido, 6x mais barato que completo) para iteração rápida e suite completa para validação. Testes de capacidade alvo comportamentos específicos (seleção de ferramenta, memória, operações de arquivo) para isolar modos de falha. Framework integra Harbor como executor eval, suportando execução local e Caixas de Areia LangSmith para testes reproduzíveis e containerizados. Para release de 0.7 de Deep Agents, LangChain usou esses benchmarks para justificar redução de system-prompt e remoção de middleware, cortando tokens por inferência enquanto mantinha capacidade—um exemplo prático de benchmarks dirigindo decisões de arquitetura.

Para equipes construindo em frameworks de agente de código aberto, publicação deste benchmark sinaliza o rigor emergente em torno de avaliação de autonomia longo-horizonte. O breakdown de três benchmarks (end-to-end, conversa, recuperação) captura a diversidade de tarefas de agente do mundo real, embora comparabilidade em frameworks permaneça limitada. O ênfase em ambiente-como-artefato-de-primeira-classe (caixas de areia Dockerized por tarefa) é cada vez mais importante conforme agentes interagem com sistemas externos reais. Monitore expansão de benchmark contínua de LangChain; conforme frameworks de agente amadurecem, plataformas eval padronizadas (similares a HELM para LLMs ou arenas competitivas para RL) se tornarão críticas para comparar sistemas de código aberto e comerciais em escala.

Fontes