Contexte et objectifs
Hebbian Robotics, promotion Y Combinator S26, propose HFlow, un SDK open source dédié aux pipelines de données multimodaux en robotique et IA physique. Le projet vise à réduire le goulot d'étranglement lié au traitement de corpus contenant vidéo, états, actions, horodatages et métadonnées provenant de systèmes d’enregistrement hétérogènes. En rendant accessibles les outils de contrôle qualité et d’orchestration habituellement réservés aux grandes équipes, HFlow cherche à uniformiser les pratiques de collecte et de curations de données.
Architecture et flux de données
Le cœur d’HFlow repose sur une chaîne d’étapes orchestrées qui exécutent des transformations, des vérifications et des enrichissements définis par l’utilisateur. Chaque étape s’appuie sur le format MCAP, désigné comme frontière d’entrée et de sortie v1. MCAP stocke de façon efficace les flux synchronisés de vidéo, d’état, d’action et d’autres séries temporelles, ce qui simplifie le décodage et la relecture. La modularité du SDK permet d’intégrer des scripts existants ou d’écrire de nouvelles fonctions sans modifier l’infrastructure sous‑jacente.
Le pipeline est matérialisé sous forme de graphe dirigé, chaque nœud représentant une transformation ou un contrôle. Cette représentation graphique facilite la visualisation du flux de données et la détection de cycles ou de dépendances non résolues. L’orchestration s’effectue localement, mais le design prévoit une extension vers des environnements cloud ou des clusters de calcul, grâce à une abstraction du stockage et à la capacité de versionner chaque épisode traité.
Gestion de la provenance et du catalogage
HFlow appose à chaque épisode un identifiant de provenance qui consigne l’ensemble des étapes, leurs paramètres et les versions de code utilisées. Ces métadonnées sont enregistrées dans un catalogue interrogeable, permettant aux ingénieurs de retracer l’origine d’un résultat, de reproduire un jeu de données ou d’auditer les transformations appliquées. Le catalogue stocke également les preuves de qualité (ex. détection de gel de caméra, désynchronisation de flux), ce qui rend possible une analyse post‑hoc sans recharger les enregistrements bruts.
État actuel et limites
Le projet est déclaré « pre‑v1 », avec le cycle de vie complet fonctionnant de bout en bout. HFlow peut être installé et exécuté localement sans matériel robotique, ce qui facilite les premiers essais. Cependant, l’absence de version stable implique que certaines fonctionnalités, comme la prise en charge native de formats autres que MCAP ou l’intégration automatisée avec des plateformes de cloud, restent à développer. De plus, la performance du pipeline dépend fortement de la capacité du système de stockage sous‑jacent à gérer les gros volumes de vidéo synchronisée, un point qui pourra limiter l’échelle dans des déploiements massifs. Les contributeurs sont invités à étoffer le code, à signaler les bugs et à enrichir la documentation afin de consolider la communauté open‑source autour de HFlow.