Contexte et objectifs

Le projet HomeBody, présenté par des chercheurs de Caltech et de Stanford, vise à remplacer la chaîne traditionnelle System 2 → System 1 → System 0 par un modèle où un VLM (Vision‑Language Model) de pointe orchestre directement une bibliothèque de compétences réutilisables. Le robot testé est le Unitree G1, un humanoïde bipède capable de marcher, de saisir et d’ouvrir des tiroirs. L’enjeu est de démontrer que, dans un environnement jamais vu (une cuisine), le VLM peut planifier et exécuter des tâches longues sans apprentissage de politique supplémentaire.

Architecture et flux de données

HomeBody intègre trois sources d’observation : une vidéo 0.5× capturée par un iPhone, les images RGB‑D du capteur Intel RealSense D435i et un scan LiDAR exploité par un algorithme SLAM. Ces flux alimentent le VLM GPT‑Astra, qui génère des appels à la bibliothèque de compétences. Chaque compétence expose une interface execute(target, feedback) et renvoie un statut d’erreur ou de succès, permettant au VLM de ré‑évaluer la séquence en temps réel.

Mémoire spatiale et Real2Sim

Après l’exploration initiale, HomeBody construit un jumeau numérique via Isaac Sim. Le processus « Real2Sim » utilise les cartes SLAM, les poses articulaires et les waypoints sélectionnés par Astra pour créer une représentation 3‑D cohérente du lieu. Cette mémoire persistante conserve les positions d’objets même lorsqu’ils sortent du champ de vision, ce qui est crucial pour des requêtes ambiguës comme « récupère mon médicament ». Le VLM interroge cette carte pour choisir des points d’accès (ex. poignée de tiroir) et planifier les déplacements.

Évaluation et limites

Dans la démonstration, le robot a nettoyé une cuisine en ramassant des sachets de café, en déposant les paquets sur l’îlot et en jetant des cartons périmés, puis a récupéré un médicament caché dans un tiroir hors‑vue. Les compétences de base (navigation, prise, placement, ouverture de tiroir) sont exécutées à des vitesses de 1.25× à 14× par rapport à la vitesse réelle, ce qui montre une accélération importante pour la visualisation mais ne reflète pas la latence réelle du système. L’absence de formation spécifique au scénario limite la robustesse face à des objets très variés ou à des environnements fortement encombrés. De plus, la dépendance à un VLM propriétaire (GPT‑Astra) rend difficile la réplication exacte sans accès au modèle.