Contexte et enjeux du AI physique

Caterpillar possède déjà un écosystème numérique contenant environ 18 pétaoctets de données fédérées provenant de machines, concessionnaires et clients. Ces données, bien que volumineuses, ne représentent qu’une fraction du besoin réel pour entraîner une IA capable d’opérer sur des chantiers de construction, où chaque engin génère des téraoctets de données par jour (LIDAR, caméras, contrôles multi‑secondes et performances).

Le secteur de la construction, à l’inverse du minier, présente un environnement hautement non structuré, rendant la transposition d’une IA autonome plus complexe. La réduction du temps de boucle d’apprentissage devient donc un facteur critique pour rendre ces systèmes viables commercialement.

Architecture des données et infrastructure cloud

CoreWeave a lancé un service de Physical AI Field Engineering qui intègre ses ingénieurs aux experts métier du client. Le service s’appuie sur une capacité GPU importante, fournie en partenariat avec Nvidia, afin d’exécuter les modèles d’annotation et de labellisation des flux de données terrain. Cette infrastructure doit gérer à la fois le stockage massif (exigé par les téraoctets quotidiens) et la bande passante nécessaire à la synchronisation des données de perception avec les signaux de contrôle.

Les modèles d’IA sont entraînés en simulant des scénarios de creusement un million de fois, puis en appliquant du renforcement d’apprentissage. La disponibilité d’une plateforme cloud capable de traiter ces charges de travail à grande échelle permet de passer d’une phase de formation qui durait plusieurs mois à une phase de quelques semaines.

Accélération du cycle d’apprentissage

Grâce à la collaboration entre Caterpillar et CoreWeave, le délai entre la collecte de données sur le terrain et leur utilisation dans l’environnement de simulation a été réduit de mois à semaines, puis à quelques heures. Cette amélioration provient de deux leviers : d’une part, l’injection automatisée de données brutes dans les pipelines d’entraînement via les GPU Nvidia, et d’autre part, le service d’ingénierie de terrain qui accélère le processus d’annotation et de validation.

Le résultat est un feedback loop qui s’insère dans la même journée de travail, permettant aux équipes de construction d’ajuster rapidement les modèles d’autonomie et de les ré‑déployer sur les engins.

Perspectives et limites

Bien que la réduction du cycle d’apprentissage soit notable, la quantité de données requise reste gigantesque. Le stockage de plusieurs téraoctets par machine chaque jour implique des coûts d’infrastructure élevés et pose des défis de gestion de la latence lors du transfert vers le cloud. De plus, la dépendance à des GPU de pointe et à des services d’ingénierie spécialisés crée une barrière d’entrée pour les acteurs plus petits du secteur.

Enfin, la robustesse des modèles dans des environnements de construction extrêmement variables doit encore être validée à grande échelle, car les scénarios simulés ne couvrent pas toujours la totalité des imprévus du terrain.