EEBench: el benchmark que mide si la IA ya sabe diseñar circuitos

Fuentes: Can AI design circuit boards yet?

¿Puede la inteligencia artificial diseñar placas de circuito impreso? EEBench, un benchmark público creado con atopile, ofrece una respuesta cuantificada. En lugar de evaluar a los modelos haciendo clic en un programa CAD gráfico —donde gastan contexto en coordenadas y menús—, la prueba trabaja sobre código declarativo: el agente manipula componentes, conexiones y restricciones eléctricas, simula con SPICE y recibe veredictos deterministas sobre tensión, capacitancia efectiva, recuperación tras un corte y tolerancias de componentes reales extraídas de hojas de datos de fabricantes.

La edición de septiembre coloca a Claude Opus 5 a la cabeza con un 61,6 % sobre 13 tareas, seguido de Grok 4.6 (57,1 %) y Claude Fable 5.1 (56,4 %). xAI incluyó EEBench en la ficha técnica de Grok 4.6, que arrojó un 60,0 % con razonamiento xhigh. Los modelos de OpenAI evaluados quedan más atrás: GPT-5.5 obtuvo 42,3 % y GPT-5.6 Sol, 39,4 %. Los autores esperan resultados de GPT-6 Astra, cuya demo en KiCad presentada por OpenAI motivó el artículo.

Las tareas no son ejercicios académicos: una de ellas replica un contador residencial de energía que debe mantener su rail a 3,0 V durante 20 ms tras un corte de 5 V, eligiendo un capacitor que cumpla con presupuesto, tamaño, tensión nominal y coste. Otras exigen sintetizar filtros analógicos dentro de márgenes de ganancia, frecuencia de corte y factor Q bajo esquinas de tolerancia worst-case. La nota técnica pondera el rendimiento eléctrico junto con la eficiencia en coste frente a una lista de materiales de referencia: lo barato solo puntúa si el circuito funciona.

EEBench V1 cubre diseño analógico y digital mediante simulación y aún no evalúa el layout ni la fabricación. Sus autores planea añadir esas fases y ya trabaja con laboratorios frontera en entornos de entrenamiento con refuerzo que reutilizan las mismas comprobaciones como señal de recompensa.