EN VIVO · VIE, 31 JUL 2026 --:--:-- ET
Edición Nº 101 GASTO TOTAL $15029.08 ARTÍCULOS HOY 16 TOKENS TOTAL 9.76B
aiexpert
En vivo
Research Dharma AI: utilización de GPU, no calidad de modelo, ahora la restricción limitante en IA empresarial Research LangChain libera ReviewBench: benchmark para evaluar agentes de revisión de código desde feedback de PR real Funding Simile recauda $200M Series B a valuación de $2B para simulaciones de comportamiento humano de IA Funding Safe Superintelligence cierra inversión de $5B de Nvidia para acceso a plataforma Vera Rubin Chips TSMC alcanza rendimiento del 70% en 2nm, ramificando hacia 100K obleas/mes hacia mediados de 2026; Apple mantiene asignación del 50%+ Funding Commonwealth Fusion Systems recauda $1 mil millones, totalizando $4 mil millones para reactores SPARC y ARC Funding Simile cierra $200M Serie B a $2K de valoración; recauda $300M en menos de 6 meses con crecimiento de ingresos 5x Funding NVIDIA invierte $5K en Safe Superintelligence, obtiene acceso a compute Vera Rubin Market Clear Street lanza plataforma pre-IPO con Databricks valorizada en $188B Funding Qualcomm cierra adquisición de Modular por $3.9B para compilador Mojo, motor de inferencia MAX para romper bloqueo de CUDA Funding Nscale adquiere Anyscale por $1,65B, consolidando nube de IA de pila completa Research Netflix GenRec: rankedor de recomendación nativo de LLM coincide con sistemas de producción con menos características, usa entrenamiento ponderado por recompensa Breaking LangSmith lanza LLM Gateway para gobernanza de agentes; enforcement limites de gastos y redacta PII en capa de solicitud Funding Cluster de financiamiento de seed en proptech, biotech de cáncer, space tech, robótica; acuerdos de $5M-$10M aún viables Market Capex de grandes tecnologías acelera: $1,1T gastado en infraestructura de IA desde 2023, se espera $745B solo en 2026 Breaking Moonshot Kimi K3 alcanza límites de capacidad con adopción masiva de empresas estadounidenses de modelos abiertos chinos Funding Las startups de chips de IA recaudaron $4,16 mil millones YTD 2026, 40× ritmo de 2025; la ronda mediana alcanza $350M Policy El Departamento de Comercio otorga $874M en fondos de la Ley CHIPS a 7 empresas para I+D de semiconductores de IA Chips Hoja de ruta de apilamiento 3D de CEA-Leti aborda cuello de botella de memoria de IA con interconexiones submicronicas Policy El Departamento de Comercio otorga $874M en incentivos de I+D de la Ley CHIPS a 7 empresas de infraestructura de IA Research Dharma AI: utilización de GPU, no calidad de modelo, ahora la restricción limitante en IA empresarial Research LangChain libera ReviewBench: benchmark para evaluar agentes de revisión de código desde feedback de PR real Funding Simile recauda $200M Series B a valuación de $2B para simulaciones de comportamiento humano de IA Funding Safe Superintelligence cierra inversión de $5B de Nvidia para acceso a plataforma Vera Rubin Chips TSMC alcanza rendimiento del 70% en 2nm, ramificando hacia 100K obleas/mes hacia mediados de 2026; Apple mantiene asignación del 50%+ Funding Commonwealth Fusion Systems recauda $1 mil millones, totalizando $4 mil millones para reactores SPARC y ARC Funding Simile cierra $200M Serie B a $2K de valoración; recauda $300M en menos de 6 meses con crecimiento de ingresos 5x Funding NVIDIA invierte $5K en Safe Superintelligence, obtiene acceso a compute Vera Rubin Market Clear Street lanza plataforma pre-IPO con Databricks valorizada en $188B Funding Qualcomm cierra adquisición de Modular por $3.9B para compilador Mojo, motor de inferencia MAX para romper bloqueo de CUDA Funding Nscale adquiere Anyscale por $1,65B, consolidando nube de IA de pila completa Research Netflix GenRec: rankedor de recomendación nativo de LLM coincide con sistemas de producción con menos características, usa entrenamiento ponderado por recompensa Breaking LangSmith lanza LLM Gateway para gobernanza de agentes; enforcement limites de gastos y redacta PII en capa de solicitud Funding Cluster de financiamiento de seed en proptech, biotech de cáncer, space tech, robótica; acuerdos de $5M-$10M aún viables Market Capex de grandes tecnologías acelera: $1,1T gastado en infraestructura de IA desde 2023, se espera $745B solo en 2026 Breaking Moonshot Kimi K3 alcanza límites de capacidad con adopción masiva de empresas estadounidenses de modelos abiertos chinos Funding Las startups de chips de IA recaudaron $4,16 mil millones YTD 2026, 40× ritmo de 2025; la ronda mediana alcanza $350M Policy El Departamento de Comercio otorga $874M en fondos de la Ley CHIPS a 7 empresas para I+D de semiconductores de IA Chips Hoja de ruta de apilamiento 3D de CEA-Leti aborda cuello de botella de memoria de IA con interconexiones submicronicas Policy El Departamento de Comercio otorga $874M en incentivos de I+D de la Ley CHIPS a 7 empresas de infraestructura de IA
Research

LangChain libera ReviewBench: benchmark para evaluar agentes de revisión de código desde feedback de PR real

LangChain lanzó ReviewBench, un nuevo benchmark para evaluar agentes de revisión de código construido a partir de revisiones reales de PR en su propia base de código LangSmith. El benchmark contiene 59 tareas reproducibles derivadas de comentarios curados por revisores confiables, midiendo si los agentes pueden identificar problemas de código sustanciales—como restricciones de inquilino faltantes en consultas de base de datos o regresiones de paridad de API—en lugar de solo errores de sintaxis o errores obvios. Cada tarea incluye el contexto de PR congelado, un stub de GitHub local, el repositorio sembrado completo y un verificador que puntúa cobertura (si el agente encontró el problema de base) y precisión (si los hallazgos enviados son correctos).

Los resultados muestran que los modelos actuales con un arnés de agente básico recuperan solo alrededor del 30% de los problemas de base que los revisores confiables encontraron. Luna y Terra tuvieron un desempeño menor al esperado, mostrando estrategias de revisión más estrechas que se concentraron en hallazgos obvios y se detuvieron temprano, manteniendo bajo el costo de token pero perjudicando la cobertura. Una configuración ajustada con mayor esfuerzo de razonamiento y una solicitud de revisión estructurada mejoró el desempeño de Luna, sugiriendo que el ajuste de solicitudes y el diseño de arnés importan significativamente para los agentes de revisión de código.

Para arquitectos que construyen flujos de trabajo de agentes de revisión de código, ReviewBench proporciona una forma agnóstica del modelo para medir si un LLM puede capturar problemas específicos del dominio que requieren entender contratos de sistema implícitos—no solo escanear en busca de defectos obvios. El hecho de que incluso los mejores modelos están perdiendo el 70% de los problemas de revisiones reales sugiere que los agentes de revisión de código necesitan ajuste cuidadoso y ajuste o recuperación específicas del dominio para estar listos para producción.

Fuentes