El equipo de tsbootstrap detectó, en una comparativa frente a la librería econométrica arch, que su motor de bootstrap por bloques era varias veces más lento en cargas realistas. El problema no era el intérprete: era estructural. La implementación previa materializaba todas las réplicas en un único tensor de 160 MB (10.000 observaciones × 2.000 réplicas en float64) que viajaba a memoria principal y regresaba para producir apenas 16 kB de resultado final, una intensidad aritmética mínima donde el cuello de botella son los bytes, no las operaciones en coma flotante.
La reescritura se articuló sobre dos principios: nunca materializar un array cuyo único consumidor sea una reducción y no arrastrar estado derivable. Se abandonó el bucle por bloques materializado y se pasó a procesar una réplica cada vez, manteniendo el conjunto de trabajo en caché, consumiendo cada remuestreo en el momento y descartándolo antes del siguiente. En una serie de n = 2.000 con B = 50.000, el pico de memoria cayó de 1,94 GB a 20 MB (≈97 veces menos).
El segundo frente fue el estado: objetos semilla y generadores que existían solo para producir aleatoriedad en el orden correcto. Eliminarlos dejó una celda problemática de 13,1 ms en 0,55 ms. En la cuadrícula de referencia, la ruta fusionada gana en todas las comparativas y sostiene aceleraciones de 3,1x a 20x en series largas. La ruta que sí materializa el tensor completo sigue siendo más lenta que la de arch y se imprime tal cual, porque la prioridad es no engañar al usuario.
