Manticore Search introduce una nueva funcionalidad que permite el chunking automático de documentos largos dentro de su sistema de búsqueda vectorial, eliminando la necesidad de pipelines de ingestión externos. Esta mejora resuelve una limitación crítica en el uso de modelos de lenguaje con ventanas de entrada limitadas, como los de 512 tokens, que truncaban información relevante en documentos extensos. Al definir una columna vectorial con la estrategia de chunking 'sentence', 'fixed' o 'recursive', el sistema divide cada documento en fragmentos, genera embeddings para cada uno y realiza búsquedas en todos ellos simultáneamente. El resultado final se agrupa por documento, devolviendo un solo hito con la distancia al fragmento más cercano. Esta arquitectura permite recuperar información de secciones profundas del texto que antes eran inaccesibles. En pruebas con un manual de 189 páginas, la recuperación (recall@5) de términos ocultos pasó del 55,1% al 83,3%, y la media de posición (MRR) de 0,44 a 0,70, a costa de un aumento de 2,5 veces en el uso de RAM y 4 veces en el tiempo de ingestión. La herramienta soporta cinco estrategias de chunking, incluyendo 'truncate' y 'mean' para columnas vectoriales simples, y ofrece parámetros de ajuste como el tamaño máximo de fragmentos y la superposición de tokens para optimizar la precisión y el rendimiento.
