ParqDB es un proyecto que permite realizar búsquedas semánticas sobre grandes volúmenes de texto sin necesidad de un servidor de consultas. La propuesta se ilustra con un caso de uso concreto: indexar los embeddings generados por el modelo MiniLM sobre 100.000 artículos de Wikipedia y publicarlos como ficheros Parquet inmutables en almacenamiento de objetos (por ejemplo, S3 o compatibles).
El flujo de trabajo se apoya en un índice IVF-LVQ8 que ParqDB construye sobre los vectores y vuelca a object storage. Cuando el usuario lanza una consulta desde el navegador, el propio cliente genera el embedding del texto en ONNX compilado a WebAssembly, descarga únicamente los rangos de bytes necesarios mediante peticiones HTTP Range, y calcula la distancia y el ranking también en WASM. El resultado es que ningún servidor intermediario ve la consulta ni los datos.
El proyecto incorpora además un perfilador integrado que muestra, en tiempo real, el número de peticiones HTTP, bytes transferidos, candidatos considerados y tiempo de consulta, junto con una traza de eventos de red y caché. La arquitectura lo hace atractivo para casos en los que se quiera montar búsqueda semántica barata sobre corpus públicos o privados: wikis internos, documentación técnica, catálogos de productos o archivos de conocimiento, manteniendo el control de los datos en el navegador del usuario y delegando solo el almacenamiento estático en una nube compatible con rangos HTTP.
