Présentation du problème
Les entreprises d'intelligence artificielle (IA) font face à un défi similaire à celui de l'industrie aérienne : la gestion efficace de leurs ressources, en l'occurrence les cartes graphiques (GPUs) utilisées pour l'entraînement et l'exécution des modèles d'IA. Les coûts liés aux GPUs s'accumulent par heure calendrier, tandis que les revenus ne sont générés qu'par heure de calcul. Cela signifie que les heures pendant lesquelles les GPUs sont inactifs réduisent les revenus sans diminuer les coûts.
Contexte technique
Les premières générations d'IA d'entreprise se concentraient sur la qualité des modèles, avec des modèles plus grands et plus complexes entraînés sur plus de matériel de calcul. Cependant, cette approche a conduit à une dépendance à l'égard de matériel spécialisé, principalement des GPUs. Les GPUs sont coûteux, en rupture de stock et très demandés, même parmi les plus grandes entreprises. Par exemple, en 2020, Microsoft a construit un supercalculateur pour OpenAI avec plus de 10 000 GPUs et 285 000 cœurs CPU, qui était l'un des cinq plus grands systèmes au monde à l'époque.
Fonctionnement et gestion des GPUs
Les entreprises qui utilisent des modèles d'IA via des API rencontrent un problème de coût qui augmente linéairement avec l'utilisation. Cela les amène à acquérir leurs propres GPUs et à exécuter les modèles localement, échangeant ainsi un coût variable contre un coût fixe en capital. Cependant, cela pose un nouveau défi : maintenir les GPUs occupés. Les clusters de GPUs doivent être dimensionnés pour la croissance et les pics de demande, ce qui signifie qu’ils sont souvent sous-utilisés. La raison principale de cette sous-utilisation est que les GPUs fonctionnent en continu, tandis que la demande varie. De plus, les différents types de travailloads (comme l'inférence en temps réel, le traitement par lots, la formation et la quantification) ont des exigences différentes en termes de matériel, ce qui rend difficile l'optimisation de l'utilisation des GPUs.
Implications et limites
La gestion efficace des GPUs est cruciale pour les entreprises d'IA. Il est essentiel de comprendre les coûts et les contraintes liés à ces ressources pour optimiser leur utilisation. Cela nécessite une planification minutieuse, une gestion efficace de la capacité et une compréhension approfondie des différents types de travailloads et de leurs exigences en termes de matériel. Les entreprises doivent également développer des stratégies pour maintenir les GPUs occupés et minimiser les temps d'inactivité, ce qui peut inclure l'optimisation des workflows, l'amélioration de la prévision de la demande et le développement de systèmes de gestion de la capacité plus efficaces.