Bonsai ha identificado un problema extendido en la búsqueda vectorial al que denomina "Float Bloat": muchos clientes convierten y serializan los vectores de incrustación (que los modelos entregan en float32) como float64, duplicando precisión de forma inútil. El ancho extra no aporta exactitud, pero multiplica el espacio en disco y el tráfico de red. La compañía estima el impacto global en más de 20 petabytes de almacenamiento innecesario.
Para un corpus de un millón de vectores de 768 dimensiones, el JSON con precisión inflada ocupa 15,2 GB frente a 8,6 GB del texto en precisión correcta y 3,1 GB del binario float32; con 10 millones de vectores las cifras ascienden a 151,8 GB, 86 GB y 30,7 GB, respectivamente. En una muestra de 18 clústeres de búsqueda vectorial, 12 presentaban esta ineficiencia. Bonsai también la halló en SDKs de proveedores de embeddings, en la documentación de los principales hyperscalers y en cientos de tutoriales.
La causa es un comportamiento por defecto de lenguajes como Python, JavaScript y Ruby, donde el método que extrae valores de arrays tipados promueve el float32 a float64. La solución pasa por formatear explícitamente con 9 dígitos (%.9g, toPrecision(9)) o enviar binarios en base64. Bonsai lanzó además la herramienta bonsai-fix-float-bloat en GitHub.
