Présentation

OpenWAM est un framework open‑source qui regroupe la prédiction vidéo et le contrôle robotique dans une architecture commune. Le projet s’appuie sur le modèle vidéo causal Wan2.2‑5B et introduit un expert d’actions de 2 M paramètres, tous deux intégrés dans une Mixture‑of‑Transformers (MoT). L’objectif est de fournir un socle de comparaison pour les World‑Action Models (WAM) en découpant les choix d’interaction, de supervision et d’inférence.

Architecture partagée

Le pré‑entraînement du backbone vidéo a été réalisé sur 3,34 M trajectoires représentant 14,64 k heures de séquences, issues de 49 jeux de données de manipulation (Open X‑Embodiment, AgiBot World Beta, Ego‑Exo4D, InternData‑A1, RoboCOIN, RoboMIND, FastUMI‑100K, etc.). Le processus a duré 14 jours sur 32 GPU NVIDIA B200. Aucun label d’action n’est utilisé à ce stade ; le modèle apprend uniquement à générer des flux vidéo de façon causale, chaque chunk pouvant s’appuyer sur les observations passées mais jamais sur le futur.

Après ce pré‑entraînement, le modèle vidéo de 5 B paramètres est couplé à l’expert d’actions de 2 B paramètres. Chaque expert conserve ses propres couches de normalisation, de projection et de feed‑forward, tandis qu’une couche d’attention partagée permet l’échange d’informations entre tokens vidéo et actions. Cette configuration conserve la spécialisation tout en offrant une interaction bidirectionnelle.

Programmes d’interaction vidéo‑action

OpenWAM propose quatre programmes d’interaction définis par l’ordre de génération et les masques d’attention :

VTA  →  Video‑then‑Action
ATV  →  Action‑then‑Video
Joint →  Denoising simultané
Decoupled →  Génération indépendante

Chaque programme reçoit la même instruction de tâche et l’historique observé, mais diffère par la façon dont les tokens futurs se conditionnent les uns aux autres. Tous utilisent le même objectif de latent flow matching avec quatre cadres vidéo latents alignés à chaque segment d’action de 16 pas, et intègrent la proprioception par segment.

Performances et analyses

Sur les suites de test LIBERO, le programme VTA a vu son taux de succès passer de 68,4 % à 97,8 % après adaptation du prédicteur vidéo au nouveau domaine. En mode transfert, un modèle inverse de dynamique « local‑context » gelé, entraîné uniquement sur des données contre‑factuelles générées par le prédicteur vidéo, atteint 84,0 % de succès moyen sur quatre tâches LIBERO‑90, contre 47,0 % pour un modèle inverse à contexte complet et 21,5 % lorsqu’il n’est entraîné que sur les démonstrations.

Pour la dynamique avant, la supervision contre‑factuelle réduit l’erreur de prédiction RGB de 34,5 % et augmente l’identification d’issues de 21,1 % à 71,3 % parmi 16 états identiques. Ces gains démontrent que l’adaptation du prédicteur vidéo, même sans ré‑entraînement des modèles de dynamique, améliore significativement la capacité de généralisation.

Perspectives

OpenWAM fournit un banc d’essai unifié pour comparer les architectures WAM et explorer l’apprentissage de la dynamique à partir de vidéos, au‑delà des seules démonstrations réussies. La modularité du cadre permet d’ajouter de nouveaux experts (par ex. de perception tactile) ou de tester d’autres stratégies d’interaction sans modifier le backbone vidéo. Le code et les modèles sont disponibles sur GitHub, facilitant la réplication et l’extension par la communauté de recherche.