Papero es una herramienta de código abierto diseñada para extraer texto, estructura y posición de bloques de documentos PDF, JSON, Word, Excel y PowerPoint. A diferencia de otras soluciones, Papero opera exclusivamente con CPU, sin utilizar modelos de aprendizaje automático ni librerías de Python complejas, lo que permite su ejecución en navegadores web, Python o como API REST. El proyecto destaca por su capacidad para preservar la jerarquía visual de los documentos, incluyendo orden de lectura en artículos de dos o tres columnas, detección precisa de tablas con celdas multi-línea, fórmulas matemáticas convertidas a LaTeX junto con imágenes vectoriales y figuras con etiquetas y leyendas. Cada bloque extraído incluye una caja de delimitación (bounding box) que permite citar la ubicación exacta en sistemas de recuperación de información (RAG) o para recortar imágenes. La herramienta integra Apache Tika para el procesamiento de formatos no PDF y Tesseract para el reconocimiento óptico de caracteres en páginas escaneadas. En términos de rendimiento, Papero logra una latencia media de 39 milisegundos por página en documentos densos de arXiv, sin errores en 54 pruebas. El proyecto ofrece una API unificada que soporta exportación a Markdown, HTML, JSON, CSV y ZIP, manteniendo la alineación y el espaciado en la exportación a Word. Aunque las herramientas basadas en IA pueden manejar layouts irregulares con mayor precisión, Papero ofrece una alternativa rápida y local que no requiere GPU, ideal para flujos de trabajo que priorizan la privacidad y la velocidad de procesamiento en hardware estándar.
