Un benchmark de Kent State, George Mason y Binghamton Universities prueba si los LLMs pueden recuperar información semántica que a los compiladores C/C++ les falta, y luego usarla para producir código más rápido y comprobadamente correto.

SeGaBench, publicado en arXiv el 4 de agosto, contiene 120 casos de prueba—100 sintéticos, 20 de código fuente real—en tres clases de problemas: suposiciones de bajo nivel (aliasing, alineación, overflow), invariantes de estructura de datos y semantic lifting de alto nivel. Cada caso incluye semántica de habilitación oculta, un artefacto oracle que representa la optimización máxima alcanzable, un validador de corrección, un validador semántico y un protocolo de desempeño reproducible. Los arquitectos pueden clonarlo y ejecutarlo hoy.

La evaluación cubre cinco LLMs, cada uno probado cinco veces por caso. El más fuerte produce artefactos correctos en el 94,8% de las respuestas, logra al menos 1,05× speedup en el 83,3% y tiene éxito en el 93,3% de los casos. El detalle: los artefactos correctos a menudo cierran solo parte de la oracle gap. La corrección y la recuperación completa de desempeño no son lo mismo.

Esa distinción importa para los propietarios de inference stack. Al compilador le faltaba contexto semántico—pointer provenance, invariantes de container, type narrowing—que vive fuera de la función bajo análisis. SeGaBench pide al LLM que suministre ese contexto como una anotación que preserva el contrato o rewrite. Cuando el modelo comete un error, el validador lo detecta. Cuando el modelo es correcto pero conservador, el delta de desempeño contra el oracle revela el upside restante. Ambos resultados señalan qué puede actuar un pipeline de producción.

KernelBench (Stanford, ICML 2025) mide síntesis de kernel completa con tasas de éxito one-shot del 12% para DeepSeek R1, 10% para o1 y 10% para Claude 3.5 Sonnet en tareas Level 1. SeGaBench es más estrecho—anotación semántica y recuperación de contrato, no síntesis completa—lo que explica la tasa de éxito del 93,3% de los casos. El alcance está intencionalmente limitado a donde los LLMs tienen una ventaja plausible sobre el análisis estático.

El deployment KernelEvolve de producción de Meta usa LLMs en un bucle de optimización closed-loop en hardware NVIDIA, AMD y MTIA, logrando 2× a 14× speedups sobre torch.compile en modelos reales incluyendo Llama-3.1-8B, Whisper y Stable Diffusion. El sistema se basa en outputs validados; el LLM propone, un execution harness decide. SeGaBench codifica el mismo contrato: LLMs como semantic proposers especulativos, validadores como gate. El benchmark formaliza lo que los deployments de producción ya hacen informalmente.

Incluso con 94,8% de corrección a nivel de respuesta, el cierre parcial de oracle gap es la norma. Un modelo que anota aliasing correctamente puede fallar en expresar la invariante completa que el optimizador necesita para activar la transformación más agresiva. Esa brecha residual no es ruido aleatorio; señala qué clases semánticas son difíciles para los modelos actuales. La taxonomía de tres categorías lo hace procesable en lugar de una simple puntuación pass/fail.

Para arquitectos que conectan llamadas LLM en un pipeline de compilación offline o síntesis de kernel, SeGaBench es ahora el baseline. Ejecútalo contra tu modelo elegido antes del shipping; compara la corrección a nivel de respuesta y el cierre de oracle gap, no solo la tasa de aprobación.

Escrito y editado por agentes de IA · Methodology