Contexte économique
Les plans d’abonnement représentent une part minoritaire du chiffre d’affaires global des laboratoires d’IA, mais ils consomment une proportion importante du calcul d’inférence. Selon le modèle tokenomics de SemiAnalysis, les abonnements d’Anthropic, qui ne représentent que 10 % du revenu total, utilisent plus de 40 % de la capacité de calcul et réduisent le revenu moyen par mégawatt (MW) d’environ 36 M$. Chez OpenAI, la part des abonnements dans le revenu total est plus élevée, ce qui accentue leur influence sur les marges.
Mécanisme de tarification des abonnements
Chaque abonnement mensuel attribue un nombre de « crédits ». La consommation de crédits dépend du couple (modèle, type de token). Les types de tokens sont : input (tokens entrants non mis en cache), cache write (tokens écrits dans le cache), cache read (tokens relus depuis le cache) et output (tokens générés). Les ratios de coût entre ces types peuvent diverger fortement des ratios de prix affichés dans les API publiques, ce qui fait varier la valeur effective d’un même abonnement selon le modèle et la charge de travail.
Méthodologie d’évaluation
Pour quantifier le taux de crédit par token, les chercheurs ont isolé chaque type de token dans des appels répétés. Input, cache write et cache read utilisent un extrait de War and Peace afin de garantir un texte cohérent, tandis que les appels d’output reposent sur un essai technique long. Chaque appel est identifié par un tag aléatoire (input) ou fixe (cache read) pour contrôler la mise en cache. Le processus d’estimation comporte trois étapes : mesurer le nombre de tokens entre deux incréments du compteur d’usage, enregistrer ces « steps », puis diviser le total des incréments par le nombre de tokens consommés. Les mesures excluent les premiers et derniers pas incomplets afin d’éviter un biais de sur‑estimation.
Analyse des résultats et limites
Le tableau de bord Subscriptions Dashboard de SemiAnalysis, actualisé quotidiennement, montre que le plan Claude à 200 $ / mois peut offrir une valeur API équivalente variant largement selon le modèle choisi. Par exemple, le même plan donne cinq fois plus d’usage pour un modèle orienté code que pour un modèle de génération de texte. Cette variabilité implique que les comparaisons simples « plan = valeur $ X » sont trompeuses sans le triplet (plan, modèle, charge). La méthodologie repose sur la visibilité du compteur d’usage, qui n’est pas exposée par OpenAI ; ils ne publient qu’un pourcentage d’utilisation sur des fenêtres de 5 heures ou 7 jours. De plus, la granularité du compteur (un pourcentage, un crédit ou un centime) introduit une incertitude d’un pas d’incrément, pouvant affecter la précision d’un appel isolé, mais l’erreur se dilue sur de nombreux pas consécutifs. Enfin, les fournisseurs peuvent modifier les coûts de crédit ou les limites d’abonnement sans préavis, ce qui nécessite une surveillance continue pour maintenir une estimation fiable.