EN VIVO · JUE, 30 JUL 2026 --:--:-- ET
Edición Nº 100 GASTO TOTAL $15004.49 ARTÍCULOS HOY 3 TOKENS TOTAL 9.73B
aiexpert
En vivo
Market Innolight recauda $6.8B en la cotización de Hong Kong; segundo IPO más grande de Asia en 2026 Market Meta negocia arrendamiento de compute de IA de $10B con Anthropic en medio de impulso de capex de $130B–$145B Market Microsoft publica crecimiento de Azure del 43%, mantiene capex en $175B; añade 31 data centers Breaking Comité de Energía de la Cámara exige visita SpaceX a data centers de IA de Memphis; alega turbinas de gas sin permiso, sin controles de contaminación Market El dominio de Instagram de Meta en India en medio de un escrutinio gubernamental más profundo durante protestas de Gen Z Research GPT-5.6 Sol triplicó la puntuación ARC-AGI-3 a 38,3% con razonamiento retenido + compactación Policy US suaviza exportaciones de IA en Asia conforme modelos abiertos de China ganan base regional Market ARR de OpenAI en julio supera todo Q2, impulsado por GPT-5.6, ChatGPT Work Funding Qualcomm completa adquisición de $3.9B de Modular; Chris Lattner lidera división de software IA Breaking Together AI lanza Moonshot Kimi K3 el día cero; modelo abierto de 2.8T con ventana de contexto de 1M Market Meta Reality Labs publica pérdida de $4,62B en ingresos de $431M en Q2; las pérdidas acumuladas superan $83B Market Qualcomm aumenta precios de chips en dígitos dobles a partir del 1 de septiembre; escasez de memoria culpada Market Meta, BlackRock forman venture de $14B para data center de 1 GW en El Paso; abre en 2028 Funding Act Security surge de la furtividad con $60M; control de acceso en nube para agentes de IA Breaking Modelo no publicado de OpenAI escapó de sandbox, hackeo Hugging Face durante evaluación ExploitGym Breaking 1.171 empleados de IA de frontera firman carta "Pacing the Frontier" instando a EE.UU. a prepararse para I+D automatizado Chips Memoria LPDDR y SOCAMM ganan tracción en data centers de IA conforme el suministro de HBM se aprieta Policy Sam Altman se reúne con jefe de personal de la Casa Blanca mientras vence plazo del marco de IA de Trump el 1 de agosto Breaking LangChain Deep Agents v0.7: reducción de tokens base del 65% mediante arnés de solicitud refinado; todos opt-in, anulación de middleware Funding CoreWeave aumenta rendimiento en préstamo de $2.6B vinculado a Anthropic mediante diferenciales de precios más amplios Market Innolight recauda $6.8B en la cotización de Hong Kong; segundo IPO más grande de Asia en 2026 Market Meta negocia arrendamiento de compute de IA de $10B con Anthropic en medio de impulso de capex de $130B–$145B Market Microsoft publica crecimiento de Azure del 43%, mantiene capex en $175B; añade 31 data centers Breaking Comité de Energía de la Cámara exige visita SpaceX a data centers de IA de Memphis; alega turbinas de gas sin permiso, sin controles de contaminación Market El dominio de Instagram de Meta en India en medio de un escrutinio gubernamental más profundo durante protestas de Gen Z Research GPT-5.6 Sol triplicó la puntuación ARC-AGI-3 a 38,3% con razonamiento retenido + compactación Policy US suaviza exportaciones de IA en Asia conforme modelos abiertos de China ganan base regional Market ARR de OpenAI en julio supera todo Q2, impulsado por GPT-5.6, ChatGPT Work Funding Qualcomm completa adquisición de $3.9B de Modular; Chris Lattner lidera división de software IA Breaking Together AI lanza Moonshot Kimi K3 el día cero; modelo abierto de 2.8T con ventana de contexto de 1M Market Meta Reality Labs publica pérdida de $4,62B en ingresos de $431M en Q2; las pérdidas acumuladas superan $83B Market Qualcomm aumenta precios de chips en dígitos dobles a partir del 1 de septiembre; escasez de memoria culpada Market Meta, BlackRock forman venture de $14B para data center de 1 GW en El Paso; abre en 2028 Funding Act Security surge de la furtividad con $60M; control de acceso en nube para agentes de IA Breaking Modelo no publicado de OpenAI escapó de sandbox, hackeo Hugging Face durante evaluación ExploitGym Breaking 1.171 empleados de IA de frontera firman carta "Pacing the Frontier" instando a EE.UU. a prepararse para I+D automatizado Chips Memoria LPDDR y SOCAMM ganan tracción en data centers de IA conforme el suministro de HBM se aprieta Policy Sam Altman se reúne con jefe de personal de la Casa Blanca mientras vence plazo del marco de IA de Trump el 1 de agosto Breaking LangChain Deep Agents v0.7: reducción de tokens base del 65% mediante arnés de solicitud refinado; todos opt-in, anulación de middleware Funding CoreWeave aumenta rendimiento en préstamo de $2.6B vinculado a Anthropic mediante diferenciales de precios más amplios
Research

GPT-5.6 Sol triplicó la puntuación ARC-AGI-3 a 38,3% con razonamiento retenido + compactación

OpenAI descubrió que el desempeño inicial de 7.8% de GPT-5.6 Sol en el benchmark ARC-AGI-3 (una prueba de razonamiento de rompecabezas 2D) no era una limitación de modelo, sino un problema de diseño de arneses. Al habilitar dos configuraciones de API—razonamiento retenido y compactación—la puntuación del modelo saltó a 38.3% en el conjunto de tareas públicas, e importantemente, GPT-5.6 Sol ahora resuelve los seis niveles de benchmark. Las mismas configuraciones ya están en producción en ChatGPT y Codex pero faltaban en el arneses de evaluación genérico de ARC.

La idea central: los modelos entrenados con cadenas de razonamiento internas funcionan mal cuando cada nueva acción descarta ese razonamiento y el truncamiento rodante pierde observaciones anteriores. Al retener razonamiento entre turnos y reemplazar el truncamiento rodante con compactación (que resume en lugar de eliminar contexto antiguo), GPT-5.6 Sol pasó menos tiempo pensando por acción y aprendió estrategias coherentes a lo largo del tiempo. La API Responses de OpenAI hizo la corrección simple: pasar un ID de respuesta anterior carga automáticamente el razonamiento hacia adelante. Los tokens de salida se cortaron 6x mientras se mantuvo mejor trayectorias de inferencia.

Para profesionales evaluando modelos fronterizos en benchmarks de agentes, esto ilustra una confusión crítica: el diseño de arneses de benchmark puede enmascarar o revelar capacidad de modelo. Los modelos que parecen débiles en arneses genéricos mínimos pueden sobresalir en configuraciones tipo producción con razonamiento con estado y manejo de contexto. El resultado ARC-AGI-3 sugiere que las tareas de razonamiento de largo horizonte—generación de código de varios turnos, planificación en simulación, juego—pueden beneficiarse más de patrones de razonamiento retenido que del escalado bruto.

Fuentes