Ejercicios de benchmarking y evals, parte 7: DeepSWE, Senior SWE-Bench, cálculo mental y neumáticos de invierno

Fuentes: Exercises in benchmarking and evals, part 7: DeepSWE, Senior SWE-Bench, napkin math, and winter tires

Esta entrada forma parte de una serie dedicada al análisis crítico de benchmarks, evals y diseño experimental, y plantea tres ejercicios con respuesta antes de que el lector los vea: uno sobre el repositorio Napkin Math, otro sobre los benchmarks DeepSWE y Senior SWE-Bench, y un tercero sobre la afirmación de que los neumáticos de invierno son superiores a los all-season en temperaturas frías. En la sección dedicada a Napkin Math se analiza la tabla de latencias y rendimientos incluida en el README, recopilada para preparar entrevistas de rendimiento computacional. El autor, junto con un colaborador, identifica varios problemas: la cifra de latencia de acceso aleatorio a memoria aparece como 20 ns, cuando se esperaría alrededor de 100 ns para una lectura real de DRAM; además, el código de medición permite que el procesador ejecute varias cargas en paralelo porque no hay dependencia de datos entre iteraciones, por lo que el promedio no refleja la latencia real. También se cuestiona la generalidad del dato de 100 µs / 70 MB/s para lectura SSD aleatoria, dado que dispositivos rápidos como el Kioxia CD9P-P rondan los 30 µs y los resultados de benchmarks de disco dependen fuertemente del tamaño de lectura, la profundidad de cola y el número de jobs. En el resto de la entrada se introducen las preguntas 30 y 31, que se desarrollan en entregas posteriores. El texto se publica en Patreon con enlaces a las seis partes anteriores de la serie.