AO VIVO · SEX., 31 DE JUL. DE 2026 --:--:-- ET
Edição Nº 101 GASTO TOTAL $15029.08 ARTIGOS HOJE 16 TOKENS TOTAL 9.76B
aiexpert
Na linha
Research Dharma AI: utilização de GPU, não qualidade de modelo, agora a restrição limitante em IA empresarial Research LangChain libera ReviewBench: benchmark para avaliar agentes de revisão de código de feedback real de PR Funding Simile levanta $200M Series B em valuation de $2B para simulações de comportamento humano de IA Funding Safe Superintelligence fecha investimento de $5B da Nvidia para acesso à plataforma Vera Rubin Chips TSMC atinge rendimento de 70% em 2nm, ramificando para 100K wafers/mês até meados de 2026; Apple detém alocação de 50%+ Funding Commonwealth Fusion Systems arrecada $1 bi, totalizando $4 bi para reatores SPARC e ARC Funding Simile fecha $200M Série B a $2B de avaliação; levanta $300M em menos de 6 meses com crescimento de receita 5x Funding NVIDIA investe $5B em Safe Superintelligence, ganha acesso ao compute Vera Rubin Market Clear Street lança plataforma pré-IPO com Databricks avaliada em $188B Funding Qualcomm encerra aquisição de Modular por $3,9B para compilador Mojo, motor de inferência MAX para quebrar bloqueio de CUDA Funding Nscale adquire Anyscale por $1,65B, consolidando nuvem de IA de pilha completa Research Netflix GenRec: rankedor de recomendação nativo de LLM corresponde aos sistemas de produção com menos recursos, usa treinamento ponderado por recompensa Breaking LangSmith lança LLM Gateway para governça do agente; apóia limites de gastos e redige PII na camada de solicitação Funding Cluster de financiamento de seed em proptech, biotech de câncer, space tech, robótica; acordos de $5M-$10M ainda viáveis Market Capex de grandes tecnologias acelera: $1,1T gasto em infraestrutura de IA desde 2023, $745B esperado em 2026 apenas Breaking Moonshot Kimi K3 atinge limites de capacidade com adoção em massa de empresas americanas de modelos abertos chineses Funding Startups de chip de IA arrecadaram $4,16B YTD 2026, 40× ritmo de 2025; rodada mediana atinge $350M Policy Departamento de Comércio concede $874M em fundos da Lei CHIPS para 7 empresas para P&D de semicondutores de IA Chips Roteiro de empilhamento 3D da CEA-Leti aborda gargalo de memória de IA com interconexões sub-micronicas Policy Departamento de Comércio concede $874M em incentivos de P&D da CHIPS Act para 7 empresas de infraestrutura de IA Research Dharma AI: utilização de GPU, não qualidade de modelo, agora a restrição limitante em IA empresarial Research LangChain libera ReviewBench: benchmark para avaliar agentes de revisão de código de feedback real de PR Funding Simile levanta $200M Series B em valuation de $2B para simulações de comportamento humano de IA Funding Safe Superintelligence fecha investimento de $5B da Nvidia para acesso à plataforma Vera Rubin Chips TSMC atinge rendimento de 70% em 2nm, ramificando para 100K wafers/mês até meados de 2026; Apple detém alocação de 50%+ Funding Commonwealth Fusion Systems arrecada $1 bi, totalizando $4 bi para reatores SPARC e ARC Funding Simile fecha $200M Série B a $2B de avaliação; levanta $300M em menos de 6 meses com crescimento de receita 5x Funding NVIDIA investe $5B em Safe Superintelligence, ganha acesso ao compute Vera Rubin Market Clear Street lança plataforma pré-IPO com Databricks avaliada em $188B Funding Qualcomm encerra aquisição de Modular por $3,9B para compilador Mojo, motor de inferência MAX para quebrar bloqueio de CUDA Funding Nscale adquire Anyscale por $1,65B, consolidando nuvem de IA de pilha completa Research Netflix GenRec: rankedor de recomendação nativo de LLM corresponde aos sistemas de produção com menos recursos, usa treinamento ponderado por recompensa Breaking LangSmith lança LLM Gateway para governça do agente; apóia limites de gastos e redige PII na camada de solicitação Funding Cluster de financiamento de seed em proptech, biotech de câncer, space tech, robótica; acordos de $5M-$10M ainda viáveis Market Capex de grandes tecnologias acelera: $1,1T gasto em infraestrutura de IA desde 2023, $745B esperado em 2026 apenas Breaking Moonshot Kimi K3 atinge limites de capacidade com adoção em massa de empresas americanas de modelos abertos chineses Funding Startups de chip de IA arrecadaram $4,16B YTD 2026, 40× ritmo de 2025; rodada mediana atinge $350M Policy Departamento de Comércio concede $874M em fundos da Lei CHIPS para 7 empresas para P&D de semicondutores de IA Chips Roteiro de empilhamento 3D da CEA-Leti aborda gargalo de memória de IA com interconexões sub-micronicas Policy Departamento de Comércio concede $874M em incentivos de P&D da CHIPS Act para 7 empresas de infraestrutura de IA
Research

LangChain libera ReviewBench: benchmark para avaliar agentes de revisão de código de feedback real de PR

LangChain lançou ReviewBench, um novo benchmark para avaliar agentes de revisão de código construido a partir de revisões reais de PR em sua própria base de código LangSmith. O benchmark contém 59 tarefas reproduzíveis derivadas de comentários curados por revisores confiáveis, medindo se os agentes podem identificar problemas de código substantivos—como restrições de inquilino perdidas em consultas de banco de dados ou regressões de paridade de API—em vez de apenas erros de sintaxe ou bugs óbvios. Cada tarefa inclui o contexto de PR congelado, um stub local do GitHub, o repositório semeado completo e um verificador que marca cobertura (se o agente encontrou o problema de base) e precisão (se as descobertas enviadas são corretas).

Os resultados mostram que os modelos atuais com um harness de agente básico recuperam apenas cerca de 30% dos problemas de base que revisores confiáveis encontraram. Luna e Terra tiveram desempenho mais baixo do que o esperado, mostrando estratégias de revisão mais estreitas que se concentraram em descobertas óbvias e pararam cedo, mantendo o custo de token baixo, mas prejudicando a cobertura. Uma configuração sintonizada com maior esforço de raciocínio e um prompt de revisão estruturado melhorou o desempenho de Luna, sugerindo que engenharia de prompt e design de harness importam significativamente para agentes de revisão de código.

Para arquitetos construindo fluxos de trabalho de agentes de revisão de código, ReviewBench fornece uma maneira agnóstica de modelo para medir se um LLM pode capturar problemas específicos de domínio que exigem entendimento de contratos de sistema implícitos—não apenas escanear por defeitos óbvios. O fato de que mesmo os melhores modelos estão perdendo 70% das edições de revisões reais sugere que agentes de revisão de código precisam de sintonia cuidadosa e sintonia específicas do domínio ou recuperação para serem prôntos para produção.

Fontes