Contexte et enjeux

Le modèle de facturation per‑token a facilité les premiers prototypes d’IA, mais le rapport Futurum « The Off Ramp From Per‑Token Pricing » montre que, lorsqu’on passe à des agents autonomes, la consommation de tokens explose. Selon l’étude, un agent peut consommer entre 10 et 100 fois plus de tokens qu’un appel d’inférence simple. Cette hausse massive rend les factures imprévisibles et met en danger la viabilité financière des projets d’entreprise.

Consommation de tokens des agents

Un agent exécute plusieurs sous‑tâches : il interroge un LLM, planifie des actions, appelle des outils externes, vérifie ses réponses, puis résume. Chaque étape génère des tokens, ce qui explique le facteur 10‑100. Futurum prévoit une croissance de 219 % de l’inférence agent‑et‑raisonnement pour l’année en cours, alors que les dépenses totales d’inférence devraient passer de 120 milliards de dollars en 2025 à 885 milliards en 2030. Si le prix reste linéaire par token, la facture croît plus vite que la valeur créée.

Modèles de capacité et stratégies d’infrastructure

Le même rapport révèle que 66 % de la consommation de calcul AI provient d’infrastructures réservées ou détenues en interne, contre 19 % pour le cloud à la demande. Une enquête auprès de 824 décideurs AI indique que 59 % exécutent leurs charges hors des hyperscalers publics, dans leurs data‑centers ou chez des fournisseurs de bare‑metal. Cette tendance n’est pas un rejet du cloud, mais une volonté de sécuriser la capacité lorsque la demande on‑demand n’est pas disponible.

Amberd.ai, citée dans le rapport, exploite un serveur Nvidia H200 à huit GPU partitionné en quatre environnements virtuels de deux GPU chacun. Le modèle de tarification tiered permet d’accueillir 30 à 35 clients sur le même serveur ; après les deux premiers, le serveur devient « gratuit » pour le fournisseur, chaque client supplémentaire générant du profit. Cette approche montre que la virtualisation personnalisée et la réservation d’infrastructure transforment un coût variable en coût fixe, à condition d’atteindre une utilisation supérieure à 60 %. En dessous de ce seuil, le GPU réservé reste l’actif le plus cher.

Implications économiques et limites

Le principal risque identifié n’est pas seulement la facture élevée, mais l’incapacité à prévoir les dépenses, ce qui peut entraîner l’abandon de projets utiles. Des organisations ont déjà abandonné des outils d’automatisation internes faute de justification budgétaire. Le passage à du bare‑metal réservé nécessite toutefois des compétences avancées en batching, quantisation, gestion de caches clé‑valeur. Les entreprises qui ne possèdent pas ces expertises risquent de voir leurs marges s’éroder malgré une meilleure utilisation des GPU.

Enfin, le rapport souligne que la stratégie de capacité dépend du type de modèle utilisé. Les modèles ouverts, déployables sur du matériel privé, bénéficient du modèle réservé. En revanche, les modèles de pointe accessibles uniquement via les API des fournisseurs restent soumis à la tarification per‑token, maintenant le dilemme entre performance et coût.