EEBench, un nuevo benchmark para evaluar IA en diseño de placas de circuito, muestra que los modelos actuales pueden manejar tareas reales de electrónica pero con brechas significativas. Claude Opus 5 lidera el ranking con 61.6% en 13 problemas de diseño, seguido por Grok 4.6 con 57.1% y Claude Fable 5.1 con 56.4%, mientras que GPT-5.5 y GPT-5.6 Sol de OpenAI obtienen 42.3% y 39.4% respectivamente. La ejecución publicada de xAI de Grok 4.6 con esfuerzo de razonamiento xhigh logró 60.0%.
El benchmark evita el problema de hacer clic en GUI que ha plagado trabajos anteriores de EDA asistida por IA. En lugar de pedir a los modelos que operen KiCad u herramientas similares a través de coordenadas de pantalla y menús, EEBench usa atopile, un lenguaje de descripción de circuitos declarativo. Los agentes trabajan directamente en componentes, conexiones y restricciones eléctricas, luego construyen, simulan e inspeccionan fallos sin cambio de contexto. Este enfoque permite que el benchmark mida conocimiento de electrónica en lugar de capacidad de uso de computadora. Según el equipo de EEBench, "los modelos actuales saben mucho más sobre electrónica de lo que su desempeño en herramientas de diseño convencionales tiende a mostrar", habiendo entrenado en libros de texto, hojas de datos y notas de aplicación.
Las tareas en sí reflejan compensaciones reales de ingeniería. Un problema público, basado en un medidor de energía residencial, requiere un circuito que mantenga un procesador vivo durante 20 milisegundos después de una pérdida de energía usando un carril de retención de capacitor. El benchmark no acepta diseños de valor nominal; simula el comportamiento del capacitor cerámico bajo voltaje, tolerancias de componentes, costo y restricciones de suministro. Una tarea analógica más difícil pide a los agentes sintetizar un filtro paso-bajo de retroalimentación múltiple, resolver ratios de resistor y capacitor para polos requeridos, y mantener ganancia, frecuencia de corte y Q dentro de límites en esquinas de tolerancia en el peor caso. El arnés de calificación ejecuta simulaciones SPICE en esas esquinas, mide voltajes y comportamiento de componentes contra límites de especificación, y combina puntuación técnica con eficiencia de costo contra una lista de materiales de referencia.
Los resultados del ranking muestran tanto capacidad como distancia restante. El 61.6% de Claude Opus 5 significa que falla en aproximadamente cuatro de cada diez tareas. EEBench reporta que xAI incluyó el benchmark en la tarjeta del modelo Grok 4.6 bajo "aceleración de ingeniería", sugiriendo que los laboratorios frontera están comenzando a tratar el diseño de circuitos como una capacidad medible. Según el post de lanzamiento de Grok 4.6 de xAI, el modelo recibió "datos de ingeniería de alta calidad y entrenamiento RL en entornos específicos del dominio incluyendo diseño asistido por computadora", lo que parece reflejarse en su desempeño.
EEBench V1 cubre diseño analógico y digital a través de simulación pero aún no mide layout, manufactura o puesta en marcha. El benchmark se enfoca en el bucle de requisitos, diseño y verificación porque esas son las etapas donde la calificación objetiva ya es posible. El equipo de EEBench afirma que está "comenzando a trabajar directamente con laboratorios frontera que quieren mejorar sus modelos en electrónica", ofreciendo suites de evaluación más grandes y entornos de entrenamiento respaldados por simulación más allá del benchmark público.
El límite práctico es claro: la fuente dice "aún no le pediríamos que diseñe un marcapasos e instale ciegamente el resultado". Para equipos que consideran flujos de trabajo EDA asistidos por IA, EEBench proporciona la primera medida cuantificada de si un modelo puede realmente resolver problemas de circuitos o simplemente hablar sobre ellos de manera plausible. Si tu dominio de diseño coincide con el alcance del benchmark—circuitos analógicos y digitales donde la simulación puede verificar corrección—las puntuaciones del ranking te dicen qué esperar. Si no, aún no tienes medición.