Présentation de FLUX 3

FLUX 3 est un nouveau modèle de fondation multimodal qui apprend conjointement à partir d'images, de vidéos et d'audio dans une architecture unifiée. Ce modèle vise à apprendre une représentation du monde, en tenant compte de la façon dont les objets s'assemblent, de la façon dont les choses bougent et de la façon dont les événements sonnent.

Fonctionnement de FLUX 3

FLUX 3 repose sur l'approche Self-Flow, qui permet d'aligner efficacement la génération et la compréhension multimodales dans la même architecture sous-jacente. Cette approche a été mise à l'échelle pour entraîner FLUX 3 sur des vidéos, des images et de l'audio en même temps. Les résultats préliminaires montrent que FLUX 3 peut créer des vidéos diverses avec de l'audio jusqu'à 20 secondes de longueur en une seule génération.

Capacités et évaluations de FLUX 3

FLUX 3 est capable de mixer des modalités et de générer des images et des vidéos avec de l'audio conjointement, à partir de prompts de texte ou d'images et de vidéos de référence. Les capacités clés de FLUX 3 incluent la génération de texte à vidéo, la génération d'image à vidéo, la génération de vidéo à vidéo et la génération de vidéo-audio à partir d'une vidéo et d'un audio de référence.

Implications et limites de FLUX 3

Les évaluations préliminaires montrent que FLUX 3 est préféré à d'autres modèles dans jusqu'à 93% des comparaisons. Cependant, les résultats sont encore préliminaires et des améliorations sont attendues pendant la phase d'accès anticipé. FLUX 3 est particulièrement fort dans la capture d'expressions faciales humaines, l'association de sons avec des événements physiques et les capacités multilingues.

FLUX 3 est construit sur l'approche Self-Flow, qui permet d'aligner efficacement la génération et la compréhension multimodales dans la même architecture sous-jacente.