Contexte et enjeux

Le passage du proof‑of‑concept à la production expose les limites des modèles et des GPU. Selon les intervenants du Dell Technologies AI Leadership Symposium, les entreprises interrogent désormais qui contrôle l’IA, où elle s’exécute et sous quelle législation. Cette évolution est alimentée par la pression des factures de tokens, qui transforment les dépenses cloud en un problème de trésorerie à court terme. Le débat s’est déplacé de la simple performance algorithmique vers la gouvernance des agents autonomes et la maîtrise de l’infrastructure sous‑jacente.

Architecture rack‑scale et déploiement rapide

Dell mise sur des déploiements rack‑scale pour offrir un avantage de production. Sean O’Connor a indiqué que Dell peut installer 350 racks en deux semaines, grâce à des partenariats de puces de longue date. Cette capacité permet aux clients de migrer leurs preuves de concept vers des environnements de production sans délai, tout en conservant une chaîne d’approvisionnement stable. L’écosystème inclut des partenaires de capital risque, renforçant la disponibilité de solutions prêtes à l’emploi pour les charges de travail IA intensives.

Gouvernance runtime et modèles de tokenisation

Les agents autonomes fonctionnent en continu, ce qui impose une surveillance au runtime. Les fondateurs de MisaLabs, Singulr AI et Sycamore Labs soulignent que la gouvernance évolue d’un jeu de règles statiques vers une observation du comportement en temps réel, notamment au sein de clouds privés virtuels (VPC). Parallèlement, les budgets de tokens sont consommés en semaines alors qu’ils sont prévus pour des mois, poussant les organisations à tester les charges de travail on‑premise et à réévaluer le rôle du CPU dans les scénarios d’IA agentique.

Implications matérielles et économiques

Le retour du CPU, mis en avant par Helen O’Sullivan de Dell et Tim Wood d’Intel, montre que les CPU peuvent à nouveau être compétitifs pour l’IA agentique lorsqu’ils permettent de garder les données et le calcul proches, réduisant ainsi les coûts de transfert et de tokenisation. De plus, Deepgram a démontré que ses modèles de voix, entraînés sur l’infrastructure Dell, peuvent être exécutés nativement sur des ordinateurs portables air‑gappés, offrant une solution décentralisée qui évite les latences réseau et les exigences de conformité liées aux centres de données. Ces tendances indiquent que les décisions d’investissement se baseront davantage sur le contrôle des données et la maîtrise des dépenses que sur la simple puissance de calcul.