TypeSafe AI ha publicado un análisis técnico que explora la viabilidad de integrar Apache Arrow como formato de salida para su modelo Jev, diseñado para convertir lenguaje natural en decisiones tipadas. Actualmente, Jev entrega respuestas mediante JSON, lo que implica una deserialización innecesaria para muchas herramientas de análisis de datos. El artículo detalla cómo modelar las respuestas de Jev en un esquema de Arrow, utilizando tipos de datos fijos y metadatos para preservar la semántica de las probabilidades y las etiquetas de elección.
El texto identifica una limitación crítica en la API actual de TypeSafe: la ausencia de una operación de lote nativa. Para validar el modelo contra grandes volúmenes de datos históricos, los desarrolladores deben realizar miles de llamadas individuales, lo que es ineficiente. Para superar esta barrera, el equipo desarrolló Jevaro, un proxy en Python que agrupa múltiples estados y las mismas preguntas en una sola solicitud. Al devolver un flujo de datos en formato Arrow, Jevaro permite a consumidores como pandas, Polars, DuckDB y Apache DataFusion procesar los resultados sin copiar memoria ni reconstruir columnas tipadas. Esta aproximación alinea Jev con los flujos de trabajo de datos estructurados de alto rendimiento, facilitando pipelines probabilísticos y analíticos a gran escala.
