HFlow, un SDK abierto para pipelines de datos multimodales en robótica

Fuentes: HFlow: open-source SDK for scalable multimodal data pipelines in robotics

HFlow es un SDK de código abierto creado por Hebbian Robotics (YC S26) para construir pipelines de datos multimodales escalables en robótica e inteligencia artificial física. Su propósito es democratizar herramientas de procesamiento de datos que, hasta ahora, solo dominaban los grandes equipos de robótica, y ponerlas al alcance de equipos de cualquier tamaño.

El problema que aborda es el cuello de botella del procesamiento de datos: los corpus combinan vídeo, estado, acciones, marcas temporales y metadatos de múltiples sistemas de grabación. Cuando el conjunto crece, los scripts dispersos dificultan saber qué se ejecutó, auditar resultados o reproducir un conjunto de datos. HFlow ofrece verificaciones integradas, permite escribir transformaciones, controles, etiquetas y enriquecimientos propios, y se conecta con código ya existente mediante pequeños adaptadores, sin obligar a reescribirlo.

En su núcleo, HFlow trabaja sobre episodios en formato MCAP, el mismo contenedor que ROS 2 graba de forma nativa y que herramientas como Foxglove y Rerun abren directamente. Cada episodio procesado lleva metadatos de procedencia con esquema, pipeline y versiones de herramientas; el pipeline se visualiza como un grafo (genera DAGs de Airflow 3 para ejecuciones programadas) y los resultados de calidad se almacenan como evidencias consultables en un catálogo Parquet consultable con DuckDB. El ciclo de vida va de la recolección a la ingestión, la curación con SQL y la entrega final en MCAP canónico.

El proyecto se encuentra en fase pre-v1 (versión 0.2.0) con el ciclo de vida básico funcionando de extremo a extremo. Se instala con 'uv add hflow' e incluye un quickstart reproducible. El despliegue es single-tenant mediante Docker Compose o Airflow 3, sin cuentas de usuario ni control multiinquilino; existe una lista de espera para una futura versión alojada.