HFlow es un SDK de código abierto creado por Hebbian Robotics (YC S26) para construir pipelines de datos multimodales escalables en robótica e inteligencia artificial física. Su propósito es democratizar herramientas de procesamiento de datos que, hasta ahora, solo dominaban los grandes equipos de robótica, y ponerlas al alcance de equipos de cualquier tamaño.
El problema que aborda es el cuello de botella del procesamiento de datos: los corpus combinan vídeo, estado, acciones, marcas temporales y metadatos de múltiples sistemas de grabación. Cuando el conjunto crece, los scripts dispersos dificultan saber qué se ejecutó, auditar resultados o reproducir un conjunto de datos. HFlow ofrece verificaciones integradas, permite escribir transformaciones, controles, etiquetas y enriquecimientos propios, y se conecta con código ya existente mediante pequeños adaptadores, sin obligar a reescribirlo.
En su núcleo, HFlow trabaja sobre episodios en formato MCAP, el mismo contenedor que ROS 2 graba de forma nativa y que herramientas como Foxglove y Rerun abren directamente. Cada episodio procesado lleva metadatos de procedencia con esquema, pipeline y versiones de herramientas; el pipeline se visualiza como un grafo (genera DAGs de Airflow 3 para ejecuciones programadas) y los resultados de calidad se almacenan como evidencias consultables en un catálogo Parquet consultable con DuckDB. El ciclo de vida va de la recolección a la ingestión, la curación con SQL y la entrega final en MCAP canónico.
El proyecto se encuentra en fase pre-v1 (versión 0.2.0) con el ciclo de vida básico funcionando de extremo a extremo. Se instala con 'uv add hflow' e incluye un quickstart reproducible. El despliegue es single-tenant mediante Docker Compose o Airflow 3, sin cuentas de usuario ni control multiinquilino; existe una lista de espera para una futura versión alojada.
