EN VIVO · VIE, 24 JUL 2026 --:--:-- ET
Edición Nº 94 GASTO TOTAL $14918.63 ARTÍCULOS HOY 2 TOKENS TOTAL 9.62B
aiexpert
En vivo
Breaking Anthropic actualiza Claude Voice a modelos Opus/Sonnet; arquitectura turn-based compite con GPT-Live full-duplex de OpenAI en acceso a herramientas, no naturalidad del habla Research LangChain publica marco de benchmark Deep Agents; tres suites eval (Harbor-Index, τ³-bench, ContextBench) establecen estándar de autonomía de agente de largo horizonte Research Black Forest Labs FLUX 3: modelo multimodal unificado genera vídeo, audio y acciones de robot desde arquitectura única Breaking NVIDIA, KAIST lanzan el primer laboratorio de IA conjunto en Corea; desarrollo conjunto de memoria SK expandido Policy Genesis Mission de EE.UU. despliega $5B+ para 278 proyectos de IA-para-ciencia en 50 estados Funding NVIDIA se compromete con US$ 300M (US$ 50M/año) con lab de IA agentética KAIST; primer lab conjunto con universidad coreana Breaking Plataforma STAR de Expedia utiliza LLMs para análisis de causa raíz de incidentes; flujos de trabajo determinísticos reducen tiempo medio de recuperación Breaking Sistema Siemens Fuse EDA AI automatiza flujos de trabajo de diseño de chips; transforma tareas de horas en segundos Policy Reino Unido desmantel a DSIT, eleva ministro de IA a gabinete; breve de IA se traslada más cerca del primer ministro Funding AMD asegura acuerdo de 2GW con Anthropic, invierte $5B en creador de Claude para rivalizar con Nvidia en chips de IA Research Nvidia lanza modelo genomics DNA; aprende lo que la predicción de tokens pierde en datos biológicos Breaking Black Forest Labs lanza FLUX 3, modelo multimodal unificado para imagen, vídeo, audio y acción de robot Breaking Microsoft Project Perception: enrutamiento de seguridad multi-modelo reduce el costo de Anthropic Mythos en 50% Research Moonshot Kimi K3: modelo open-weight chino lidera benchmark Arena, supera Claude en código Funding Anthropic en conversaciones preliminares con Meta para acuerdo de cómputo de $10B; tercera asociación principal de infraestructura Funding Anthropic Presenta Solicitud de IPO; ARR de Claude Alcanzó US$ 47B en Mayo, Supera Valoración OpenAI en US$ 965B Series H Policy 21 Economías APEC Apoyan IA de Código Abierto con 'Garantía de Seguridad Fuerte' en Cumbre de Chengdu Breaking Proyecto Camellia de OpenAI: Centro de datos Georgia 3.2GW, beneficios comunitarios $80M, créditos Codex $71M para estudiantes hasta 2032 Breaking La plataforma ELSA AI de la FDA alcanza 85% de adopción del personal en dos meses; datos gobernados y agentes reducen revisión de fármacos de días a 3 minutos Research Investigación NVIDIA en ICML 2026: 145 artículos citan modelos abiertos Nemotron; 2.000 artículos usan GPUs NVIDIA Breaking Anthropic actualiza Claude Voice a modelos Opus/Sonnet; arquitectura turn-based compite con GPT-Live full-duplex de OpenAI en acceso a herramientas, no naturalidad del habla Research LangChain publica marco de benchmark Deep Agents; tres suites eval (Harbor-Index, τ³-bench, ContextBench) establecen estándar de autonomía de agente de largo horizonte Research Black Forest Labs FLUX 3: modelo multimodal unificado genera vídeo, audio y acciones de robot desde arquitectura única Breaking NVIDIA, KAIST lanzan el primer laboratorio de IA conjunto en Corea; desarrollo conjunto de memoria SK expandido Policy Genesis Mission de EE.UU. despliega $5B+ para 278 proyectos de IA-para-ciencia en 50 estados Funding NVIDIA se compromete con US$ 300M (US$ 50M/año) con lab de IA agentética KAIST; primer lab conjunto con universidad coreana Breaking Plataforma STAR de Expedia utiliza LLMs para análisis de causa raíz de incidentes; flujos de trabajo determinísticos reducen tiempo medio de recuperación Breaking Sistema Siemens Fuse EDA AI automatiza flujos de trabajo de diseño de chips; transforma tareas de horas en segundos Policy Reino Unido desmantel a DSIT, eleva ministro de IA a gabinete; breve de IA se traslada más cerca del primer ministro Funding AMD asegura acuerdo de 2GW con Anthropic, invierte $5B en creador de Claude para rivalizar con Nvidia en chips de IA Research Nvidia lanza modelo genomics DNA; aprende lo que la predicción de tokens pierde en datos biológicos Breaking Black Forest Labs lanza FLUX 3, modelo multimodal unificado para imagen, vídeo, audio y acción de robot Breaking Microsoft Project Perception: enrutamiento de seguridad multi-modelo reduce el costo de Anthropic Mythos en 50% Research Moonshot Kimi K3: modelo open-weight chino lidera benchmark Arena, supera Claude en código Funding Anthropic en conversaciones preliminares con Meta para acuerdo de cómputo de $10B; tercera asociación principal de infraestructura Funding Anthropic Presenta Solicitud de IPO; ARR de Claude Alcanzó US$ 47B en Mayo, Supera Valoración OpenAI en US$ 965B Series H Policy 21 Economías APEC Apoyan IA de Código Abierto con 'Garantía de Seguridad Fuerte' en Cumbre de Chengdu Breaking Proyecto Camellia de OpenAI: Centro de datos Georgia 3.2GW, beneficios comunitarios $80M, créditos Codex $71M para estudiantes hasta 2032 Breaking La plataforma ELSA AI de la FDA alcanza 85% de adopción del personal en dos meses; datos gobernados y agentes reducen revisión de fármacos de días a 3 minutos Research Investigación NVIDIA en ICML 2026: 145 artículos citan modelos abiertos Nemotron; 2.000 artículos usan GPUs NVIDIA
Research

LangChain publica marco de benchmark Deep Agents; tres suites eval (Harbor-Index, τ³-bench, ContextBench) establecen estándar de autonomía de agente de largo horizonte

LangChain publicó un blog detallando su metodología de evaluación para Deep Agents, su arnés de agente de código abierto y agnóstico del modelo. El marco aborda el desafío central: la evaluación del agente es fundamentalmente más difícil que la evaluación de LLM porque los resultados dependen del ambiente, la definición de tareas, la selección de herramientas y los cambios de estado intermedio—no solo la respuesta final. LangChain ejecuta tres suites de referencia separadas: Harbor-Index (82 tareas de extremo a extremo destiladas de 6.000+ candidatos en ingeniería de software, búsqueda, análisis de datos y uso de herramientas), τ³-bench (30 tareas de conversación multiturn con usuarios simulados y resultados puntuados) y ContextBench (30 tareas de recuperación con corpus completos en caja de arena para cada tarea, requiriendo que los agentes encuentren y unan respuestas).

La metodología de evaluación enfatiza la no determinism: los agentes son inherentemente estocásticos, por lo que las tareas se ejecutan varias veces para reunir estimaciones calibradas. LangChain mantiene un benchmark "lite" (~8x más rápido, 6x más barato que el completo) para iteración rápida y suite completa para validación. Las pruebas de capacidad se dirigen a comportamientos específicos (selección de herramientas, memoria, operaciones de archivo) para aislar modos de falla. El marco integra Harbor como ejecutor eval, soportando ejecución local y Areneros de LangSmith para pruebas reproducibles y containerizadas. Para la versión 0.7 de Deep Agents, LangChain usó estos benchmarks para justificar la reducción de system-prompt y la eliminación de middleware, reduciendo tokens por inferencia mientras mantenía capacidad—un ejemplo práctico de benchmarks impulsando decisiones arquitectónicas.

Para equipos que construyen sobre marcos de agentes de código abierto, esta publicación de puntos de referencia señala el rigor emergente en torno a la evaluación de la autonomía de largo horizonte. El desglose de tres puntos de referencia (extremo a extremo, conversación, recuperación) captura la diversidad de tareas de agentes del mundo real, aunque la comparabilidad entre marcos permanece limitada. El énfasis en ambiente-como-artefacto-de-primera-clase (areneros Dockerizados por tarea) es cada vez más importante a medida que los agentes interactúan con sistemas externos reales. Monitoree la expansión de puntos de referencia continua de LangChain; a medida que los marcos de agentes maduran, las plataformas eval estandarizadas (similares a HELM para LLM o arenas competitivas para RL) se volverán críticas para comparar sistemas de código abierto y comerciales a escala.

Fuentes