Contexte et objectifs

Face à la multiplication des modèles d’IA, les entreprises traitent le déploiement d’une AI Factory comme un problème de dimensionnement de charge plutôt que comme un projet d’infrastructure sur‑mesure. Broadcom, après son acquisition de VMware, et Cisco proposent une réponse combinée : un design validé qui associe VMware Cloud Foundation (VCF) à l’infrastructure Cisco Unified Computing System (UCS). L’enjeu est de faire correspondre chaque type de charge – inférence en périphérie, entraînement de gros modèles – à la plateforme matérielle adéquate, tout en conservant la flexibilité de localisation.

Architecture validée

Le design s’appuie sur le VMware Private AI Cloud, qui intègre l’AI Factory comme service de base. Au niveau matériel, Cisco propose trois segments : Unified Edge pour l’inférence locale, les configurations AI POD modulaires, et le serveur UCS C885A M8 équipé de huit GPU, destiné aux charges de travail de data‑center les plus exigeantes. Cette palette couvre des processeurs classiques pour les modèles légers jusqu’aux accélérateurs GPU denses, éliminant ainsi le besoin d’une architecture unique.

Méthodologie de dimensionnement

Le processus débute par l’identification de critères quantifiables : latence maximale, temps de réponse cible et nombre d’utilisateurs simultanés. Selon Jeff Nichols, responsable technique chez Cisco, ces paramètres déterminent le type de charge – inférence, génération augmentée par récupération (RAG), fine‑tuning ou entraînement complet – et, par conséquent, le matériel requis. VCF virtualise les ressources, permettant d’allouer dynamiquement des cœurs CPU ou des accélérateurs GPU en fonction de la demande réelle, sans reconfigurer l’infrastructure sous‑jacente.

Implications opérationnelles

Le concept d’AI Factory repose sur la livraison « prête à l’emploi » : les systèmes sont expédiés pré‑assemblés, pré‑configurés et intégrés à VCF, ce qui réduit le temps d’activation à un ou deux jours. Cette approche libère les équipes IT des tâches d’intégration continue et les transforme en simples consommateurs d’IA. En pratique, les entreprises peuvent déployer un AI POD ou un serveur UCS C885A M8, activer les profils de charge via l’interface VCF, et commencer immédiatement les expérimentations ou la production, tout en conservant la possibilité de migrer les workloads entre les différents nœuds matériels grâce à la couche d’abstraction logicielle.