Contexte économique

Les modèles de génération de texte consomment des tokens pour reconstituer le contexte d’une requête. Lorsque les données sont dispersées sur plusieurs systèmes, chaque appel supplémentaire génère des jetons supplémentaires, ce qui augmente le prix final. Dans ce cadre, le coût moyen d’une tâche IA est souvent mesuré en dollars par requête, un indicateur clé pour les entreprises qui déploient l’IA à grande échelle.

Mécanisme de réduction des coûts

Glean adopte une approche context‑first : il agrège les informations d’entreprise dans un référentiel unique, puis utilise un routage intelligent pour diriger chaque requête vers la source la plus pertinente. Cette architecture minimise le nombre de tours de dialogue nécessaires pour récupérer les données, limitant ainsi le nombre de tokens générés. En outre, le moteur de retrieval efficace exploite des indexations pré‑calculées, évitant les recompositions de contexte à chaque appel.

Évaluation comparative

Dans un benchmark publié par le sponsor, Glean a réalisé un coût moyen de 0,45 $ par tâche contre 1,84 $ pour Claude Cowork. Le ratio de 4 : 1 représente une économie de 75 % pour chaque opération. Cette différence provient directement de la réduction du nombre de tokens consommés : moins de requêtes de récupération et moins de génération de texte entraînent une facturation moindre selon le modèle tarifaire basé sur les tokens.

Limites et perspectives

Le test se limite à un scénario de comparaison de coûts sans divulguer les métriques de latence ni la précision des réponses. De plus, la performance de Glean dépend de la qualité de l’indexation des données d’entreprise ; des bases mal structurées pourraient réduire l’efficacité du routage. Enfin, l’étude ne précise pas si les économies sont maintenues à l’échelle de charges de travail plus complexes, où le volume de tokens requis pourrait augmenter de façon non linéaire.