Présentation de FLUX 3

FLUX 3 est un modèle multimodal qui génère du contenu audio-visuel de manière conjointe. Ce modèle a été développé en collaboration avec Mimic Robotics et a donné naissance à FLUX-mimic, un modèle d'action vidéo de nouvelle génération.

Fonctionnement de FLUX 3

FLUX 3 est entraîné sur des images, des vidéos et des données audio. La prédiction de vidéos est la partie la plus exigeante de son entraînement, représentant plus de 95% des coûts de calcul. Pour générer des vidéos réalistes, le modèle doit apprendre à rendre compte du contact, du mouvement, du poids, de la cause et de l'effet.

FLUX 3 est un modèle unique, entraîné de manière conjointe sur les images, les vidéos et les données audio.

Implications et limites

L'ajout de la prédiction d'actions à FLUX 3 n'a pas entraîné de coûts permanents en termes de capacité. Le modèle a simplement dû apprendre la structure de l'espace d'actions et aligner sa représentation interne du monde sur celle-ci. Après 3500 étapes, le modèle a retrouvé sa qualité initiale sur les tâches de génération de vidéos tout en prédissant des actions.

FLUX-mimic et son application

FLUX-mimic est un modèle d'action vidéo construit sur le backbone de FLUX 3. Il a été développé pour répondre à des tâches d'automatisation réelles sur des lignes de production. Le succès de cette approche dépend de la qualité du modèle du monde appris par FLUX et de la qualité de la représentation des caractéristiques de ce modèle du monde.