EEBench, um novo benchmark para avaliar IA em design de placas de circuito, mostra que os modelos atuais conseguem lidar com tarefas reais de eletrônica, mas com lacunas significativas. Claude Opus 5 lidera o ranking com 61.6% em 13 problemas de design, seguido por Grok 4.6 com 57.1% e Claude Fable 5.1 com 56.4%, enquanto GPT-5.5 e GPT-5.6 Sol da OpenAI marcam 42.3% e 39.4% respectivamente. A execução publicada da xAI do Grok 4.6 com esforço de raciocínio xhigh alcançou 60.0%.

O benchmark contorna o problema de clicar em GUI que afligiu trabalhos anteriores de EDA assistida por IA. Em vez de pedir aos modelos que operem KiCad ou ferramentas similares através de coordenadas de tela e menus, EEBench usa atopile, uma linguagem declarativa de descrição de circuitos. Agentes trabalham diretamente em componentes, conexões e restrições elétricas, depois constroem, simulam e inspecionam falhas sem troca de contexto. Essa abordagem permite que o benchmark meça conhecimento de eletrônica em vez de capacidade de uso de computador. De acordo com o time EEBench, "os modelos atuais sabem muito mais sobre eletrônica do que sua saída em ferramentas de design convencionais tende a mostrar", tendo treinado em livros didáticos, datasheets e notas de aplicação.

As tarefas em si refletem trade-offs reais de engenharia. Um problema público, baseado em um medidor de energia residencial, requer um circuito que mantenha um processador vivo por 20 milissegundos após perda de energia usando um capacitor de retenção. O benchmark não aceita designs de valor nominal; simula o comportamento de capacitor cerâmico sob tensão, tolerâncias de componentes, custo e restrições de fornecimento. Uma tarefa analógica mais difícil pede aos agentes que sintetizem um filtro passa-baixa com múltipla realimentação, resolvam razões de resistor e capacitor para polos necessários, e mantenham ganho, frequência de corte e Q dentro dos limites em cantos de tolerância no pior caso. O harness de classificação executa simulações SPICE nesses cantos, mede tensões e comportamento de componentes contra limites de especificação, e combina pontuação técnica com eficiência de custo contra uma lista de materiais de referência.

Os resultados do ranking mostram tanto capacidade quanto distância restante. Os 61.6% do Claude Opus 5 significam que ele falha em aproximadamente quatro de dez tarefas. EEBench relata que xAI incluiu o benchmark no cartão do modelo Grok 4.6 sob "aceleração de engenharia", sugerindo que labs de fronteira estão começando a tratar design de circuitos como uma capacidade mensurável. De acordo com o post de lançamento do Grok 4.6 da xAI, o modelo recebeu "dados de engenharia de alta qualidade e treinamento RL em ambientes específicos de domínio incluindo design auxiliado por computador", o que parece refletido em seu desempenho.

EEBench V1 cobre design analógico e digital através de simulação, mas ainda não mede layout, manufatura ou bring-up. O benchmark se concentra no loop de requisitos, design e verificação porque esses são os estágios onde classificação objetiva já é possível. O time EEBench afirma que está "começando a trabalhar diretamente com labs de fronteira que querem melhorar seus modelos em eletrônica", oferecendo suites de avaliação maiores e ambientes de treinamento com suporte de simulação além do benchmark público.

O limite prático é claro: a fonte diz "ainda não pediríamos que ele projetasse um marca-passo e instalasse o resultado às cegas". Para times considerando workflows de EDA assistida por IA, EEBench fornece a primeira medida quantificada de se um modelo consegue realmente resolver problemas de circuito ou apenas falar sobre eles de forma plausível. Se seu domínio de design corresponde ao escopo do benchmark—circuitos analógicos e digitais onde simulação pode verificar correção—as pontuações do ranking dizem o que esperar. Se não corresponde, você ainda não tem medição.