El repositorio xarray-sql incluye un script de benchmark, nn.py, que muestra cómo entrenar una red neuronal densa directamente con consultas SQL sobre un Dataset de xarray. El ejemplo carga el conjunto Fashion-MNIST (imágenes de 28x28 píxeles con diez clases) desde un almacén Zarr público en S3 y lo modela como dos tablas virtuales: "pixels" (sample, height, width) y "labels" (sample), de modo que los nombres de las dimensiones actúan como claves de join. La arquitectura es una red feed-forward de cuatro capas con anchuras 784-196-32-10, activaciones tanh en la capa oculta y softmax en la salida, definida como un único Dataset cuyas matrices de pesos (layer_i) y vectores de sesgo (bias_i) se exponen como tablas separadas.
El flujo selecciona en SQL una submuestra aleatoria de 700 imágenes con una división 70/30 entre entrenamiento y test, y materializa únicamente los píxeles correspondientes mediante un JOIN. Cada paso de entrenamiento (60 iteraciones, learning rate 0,5) se formula como consultas de forward pass y retropropagación encadenadas. El script documenta además una optimización específica: omitir las filas de píxeles con valor cero en la primera capa, ya que su contribución es nula. En Fashion-MNIST real, donde cerca del 50 % de los píxeles son negros, esa poda reduce el tiempo por paso de 2,56 s a 1,45 s, una aceleración de aproximadamente 1,8x sin alterar el resultado numérico. Si no se puede acceder a S3, el código activa un modo totalmente offline con plantillas sintéticas separables, lo que permite reproducir la demostración sin conexión a la red.
