Financement et valorisation
General Intuition Inc. a annoncé la levée de 220 millions de dollars auprès de Valor Equity Partners, Atreides, Seven Seven Six, Point72, Khosla Ventures et General Catalyst. Cette injection porte la valorisation post‑money à 6,2 milliards de dollars. Le tour de table intervient un an après la scission du projet de la startup de partage vidéo Medal B.V., qui fournissait l’infrastructure de capture de séquences de jeux. Le capital sera dédié principalement à l’embauche de chercheurs en IA et à l’expansion de la plateforme de génération vidéo synthétique.
Architecture de MIRA et approche de diffusion latente
L’algorithme phare, nommé MIRA, repose sur une technique de latent diffusion. Au lieu de traiter chaque image brute, le modèle opère sur un espace latent compressé, réduisant ainsi la charge mémoire et le temps de calcul. Cette stratégie contraste avec les générateurs vidéo traditionnels qui manipulent directement les pixels. MIRA compte 5,6 milliards de paramètres, ce qui représente une fraction des modèles de pointe qui dépassent souvent les dizaines de milliards de paramètres. La taille réduite contribue à la rapidité d’inférence.
Performances, limites et scénarios d’usage
Selon les données publiées, MIRA rend 20 images par seconde à une résolution de 720 × 576 pixels en s’appuyant sur une seule carte graphique NVIDIA B200. Le modèle se distingue par sa capacité à « tourner indéfiniment sans divergence », permettant la génération de séquences vidéo de durée arbitraire, contrairement aux générateurs classiques limités à quelques secondes ou minutes. Toutefois, la version actuelle ne peut synthétiser que le contenu d’un seul jeu vidéo, ce qui restreint son applicabilité immédiate. Les premiers tests commerciaux ciblent la robotique, la simulation industrielle et le divertissement, où la prévision de mouvements rapides et la prévention de collisions sont cruciales.
Perspectives et enjeux de recherche
Le financement ouvre la voie à l’élargissement du domaine de génération au‑delà du seul jeu vidéo, ainsi qu’à l’augmentation de la résolution et du débit d’images. La réduction du nombre de paramètres tout en maintenant une qualité visuelle soulève des questions sur la scalabilité du modèle vers des environnements plus complexes, notamment les scènes physiques réalistes. De plus, la dépendance à un GPU B200 pour atteindre 20 fps indique que des optimisations matérielles ou logicielles seront nécessaires pour concurrencer les solutions basées sur des clusters GPU. Enfin, la transition de démonstration de recherche à produit commercial exigera des protocoles de validation robustes afin de garantir que les séquences synthétiques ne introduisent pas de biais dans les pipelines d’entraînement robotique.