qec-evaluation-suite: banco de pruebas diagnósticas de tamaño finito para corrección cuántica de errores

Fuentes: qec-evaluation-suite: finite-size diagnostic wind tunnel for QEC decoders and geometries

qec-evaluation-suite es una herramienta de software de evaluación digital orientada al diagnóstico experimental de códigos de corrección de errores cuánticos (QEC) a escala finita. No ejecuta hardware cuántico, ni funciona como decodificador productivo, ni pretende demostrar umbrales asintóticos: se presenta como un "túnel de viento" de telemetría para comparar decodificadores y geometrías de forma honesta y reproducible.

La suite se organiza en tres capas. La capa A incluye pruebas de humo (smoke tests) con el código de superficie rotado de Stim, junto con un DEM tipo grafo y un decodificador MWPM; también incorpora un código Floquet panal de periodo 3, cuyo plan de medición es válido aunque no es comparable directamente con la superficie en términos de MWPM tipo grafo. La capa B ofrece un laboratorio geométrico educativo con invariantes de grafos, explícitamente fuera del ámbito QEC a nivel de circuito. La capa C implementa un modelo de red tensorial inspirado en HaPPY para la codificación bulk-boundary, con profundidades 1 (n=10, k=6) y 2 con tope (n=20, k=16), evaluado mediante recuperación voraz y una ablación GE sobre GF(2) con muestreo emparejado.

Los resultados destacan que GE no es un superconjunto de la estrategia voraz en esta instancia y que la brecha se amplía en profundidad 2 bajo el modelo lineal de parámetros de cara. En pruebas de estrés con k=4, la decodificación voraz presenta un comportamientoasimétrico entre modos uniforme y agrupado, mientras que GE se sitúa cerca del suelo en ambos casos, lo que sugiere que el rendimiento depende del par decodificador-patrón más que de una propiedad geométrica universal.

La suite incluye además un micro-laboratorio de BP min-suma sobre el código clásico Hamming [7,4], con métricas bien diferenciadas: GE mide recuperabilidad única por erasure, BP mide coincidencia con codeword bajo canal ruidoso y OSD mide compleción de lista válida de síndrome. Cada métrica aborda una pregunta distinta y no son intercambiables.

El repositorio se distribuye con datos congelados en public/data/ para auditoría sin reejecuciones costosas y remite a QEC_CLAIMS.md como referencia de honestidad experimental.