Les investissements massifs dans l’infrastructure IA masquent un facteur de coût récurrent lié à la façon dont les données sont organisées.
Contexte et enjeux
Les conseils d’administration ont approuvé des budgets conséquents pour le matériel, les logiciels et les services IA, tandis que les services financiers ont construit les business cases. Un rapport de l’initiative NANDA du MIT publié en 2025 indique que 95 % des pilotes d’IA générative en entreprise n’ont généré aucun impact mesurable sur le compte de résultat. Le rapport attribue cet échec non pas à la qualité du modèle, mais à des lacunes d’intégration des données dans les processus opérationnels.
Mécanismes de la gravité des données
Le concept de « data gravity » décrit la tendance des grands volumes de données à attirer les applications vers eux plutôt qu’inversement. En pratique, les réglementations imposent que certains enregistrements restent dans des juridictions spécifiques, et les règles de souveraineté empêchent leur déplacement vers des datacenters moins coûteux. De plus, les unités métier qui ont construit une gouvernance autour d’un jeu de données pendant une décennie ne peuvent pas simplement transférer ces données vers un entrepôt central sans perdre des accords contractuels ou casser des applications dépendantes.
Coûts opérationnels et timing
Les dépenses liées à la gravité des données ne se manifestent pas comme une ligne budgétaire unique. Elles apparaissent sous forme de dizaines de petites exigences : création de pipelines pour extraire des données de systèmes non conçus pour ce trafic, synchronisation continue de chaque copie avec la source, application de contrôles de sécurité et de gouvernance à chaque point de stockage, et gestion d’ensembles de données additionnels pour le développement, les tests et la formation. Ces tâches, chacune modeste, s’accumulent en une « taxe » qui devient visible 12 à 24 mois après l’acquisition de la plateforme IA, moment où les indicateurs de succès initiaux ont déjà été communiqués.
Recommandations d'architecture
Plutôt que de centraliser les données, les organisations doivent bâtir une couche de contexte capable de découvrir, relier et récupérer l’information là où elle réside. Cette couche exploite les métadonnées et les vecteurs d’embedding pour permettre aux modèles d’accéder aux enregistrements sans les déplacer, tout en respectant les contraintes de réglementation, de souveraineté et de propriété. Avant de finaliser un investissement IA, il convient de répondre à quatre questions : quels jeux de données sont soumis à des restrictions de déplacement ? qui assure la gouvernance actuelle et comment gérer les copies ? comment garantir la synchronisation lors de l’évolution des sources ? et enfin, l’architecture permet‑elle à l’intelligence d’opérer sur les données in situ ? Une réponse affirmative transforme la gestion des données en une ligne budgétaire explicite, réduisant ainsi la charge cachée.