METR publicó una nota de investigación empírica el 14 de agosto midiendo si los LLM han curvado las curvas de descubrimiento en tres dominios: vulnerabilidades cibernéticas, matemáticas y optimización algorítmica. El hallazgo es mixto. Las vulnerabilidades se aceleran. Las matemáticas se aceleran débilmente. La optimización algorítmica no muestra aceleración detectable en siete benchmarks. Los autores Tom Cunningham y Nate Rush midieron cambios de pendiente en datos públicos utilizando agentes para recopilación y análisis.
La aceleración de vulnerabilidades es inequívoca. Las tasas reportadas en 2026 aumentaron en cURL, OpenSSL, Firefox y Microsoft. En cURL y OpenSSL, la mayoría de las nuevas divulgaciones llevan atribución de IA. En Firefox, Microsoft y agregados, los créditos de IA representan una pequeña parte—la mayoría sin etiquetar. Las bases de datos que rastrean vulnerabilidades activamente explotadas muestran un crecimiento significativamente menor año tras año que las bases de datos de vulnerabilidades conocidas. La IA encuentra más defectos de los que los adversarios pueden armar en registros públicos. Las categorías de mayor severidad muestran menos aceleración que los niveles inferiores, pero todas se aceleran.
La matemática Levent Alpöge de Anthropic refutó la conjetura jacobiana—Problema 16 en la lista de 1998 de problemas abiertos de Stephen Smale—el 19 de julio usando Claude. Publicó la refutación en X el 20 de julio. El contraejemplo es un mapa polinomial de tres variables con determinante jacobiano constante que asigna tres entradas distintas a una salida, demostrando no invertibilidad global. Verificado independientemente por varios matemáticos en pocas horas. Dos resoluciones adicionales siguieron de la lista de Ben Green: Problema 44 y parte del Problema 100. Los envíos de arXiv se duplicaron en algunas áreas en menos de 12 meses. METR califica la evidencia matemática como débil—las líneas de base históricas para resoluciones de problemas abiertos son demasiado escasas para estimaciones de pendiente confiables.
El hallazgo de optimización es más importante para los equipos de plataformas de ML. Siete benchmarks—CIFAR-10, compresión Hutter, programación entera mixta Gurobi, MIPLIB, speedrun nanoGPT, Stockfish y exponente de multiplicación de matrices—no muestran cambio de pendiente desde enero de 2026. Dos series que incluyen contribuciones de LLM no muestran aceleración. METR señala un acertijo: Yuksekgonul et al. reportaron en enero de 2026 que un modelo simple avanzó la frontera en cinco problemas de optimización. El resultado no ha aparecido en líneas de tendencia agregadas.
METR explica la división de dominios a través de verificabilidad. El descubrimiento de vulnerabilidades y los contraejemplos matemáticos comparten una propiedad: el progreso es barato de verificar. Un parche se prueba en segundos; un contraejemplo se verifica a mano en minutos. Los benchmarks de optimización requieren ejecuciones de entrenamiento costosas con señales ruidosas. Si la IA cierra el bucle de evaluación de manera económica por intento, la exploración se escala. Si cada intento cuesta cientos de horas de GPU, la ventaja se comprime. METR también plantea una posibilidad: los laboratorios de IA pueden descubrir ganancias algorítmicas internamente, no reflejadas en benchmarks públicos. El vacío de optimización puede ser un artefacto de medición, no un límite.
La nota enmarca la división de dominios como relevante para la auto-mejora recursiva. Si la IA aún no puede acelerar la optimización algorítmica de manera mensurable en datos públicos, no se cumplen las condiciones para un bucle de I+D autorreferenciador. METR reconoce que probablemente quedan errores en sus datos e invita correcciones.
Las pruebas públicas respaldan la aceleración del descubrimiento de vulnerabilidades y, débilmente, la búsqueda matemática en espacios grandes. No respalda esperar ganancias de eficiencia algorítmica en benchmarks públicos. La brecha entre anuncios de laboratorio y líneas de tendencia agregadas vale la pena seguir.