Contexte et objectifs

Plus d’une demi-douzaine d’organisations publiques et privées ont annoncé la création d’un consortium dédié à la production de jeux de données biologiques destinés aux modèles d’intelligence artificielle. Le financement total s’élève à 1,8 milliard de dollars, dont le plus gros apport provient du Department of Energy (DOE) avec plus de 500 millions de dollars répartis sur cinq ans. L’objectif déclaré est de fournir des ensembles de données suffisamment volumineux et détaillés pour entraîner une nouvelle génération de modèles d’IA optimisés pour la biologie, afin de remplacer, dans certains cas, les expériences en laboratoire qui peuvent durer plusieurs années et coûter plusieurs millions.

Méthodes d’acquisition et architecture des données

Le DOE consacrera une partie de son budget à l’achat d’équipements de microscopie avancée : diffusion de neutrons, rayons X et cryo‑microscopie électronique (cryo‑EM). Les deux premiers techniques identifient respectivement les éléments légers et les éléments lourds d’un échantillon, tandis que la cryo‑EM cartographie la structure interne des cellules. Biohub, soutenu par Mark Zuckerberg, investit 400 millions de dollars, dont 75 % pour la recherche interne et le reste pour des projets externes. Biohub utilisera la cryo‑tomographie électronique (cryo‑ET), qui fige les échantillons biologiques avant de les exposer à un faisceau d’électrons, afin de générer des images de millions à milliards de cellules. Le NIH met à disposition des jeux de données issus de plus de 500 millions de dollars d’investissements fédéraux antérieurs, et collabore avec Biohub pour structurer ces données afin qu’elles soient directement exploitables par les algorithmes d’apprentissage. Les géants technologiques – Google DeepMind, Isomorphic Labs (Alphabet) et Meta – apportent collectivement 300 millions de dollars, tandis que Nvidia fournit des accélérateurs GPU et des bibliothèques logicielles spécialisées pour le traitement des charges de travail d’entraînement.

Analyse des enjeux scientifiques et limites

La création de simulations cellulaires précises repose sur la disponibilité de données à la fois massives et de haute résolution. Les trois méthodes d’imagerie sélectionnées offrent des complémentarités : la diffusion de neutrons révèle la composition isotopique, les rayons X renseignent sur la densité électronique, et la cryo‑EM fournit la topologie tridimensionnelle. Cependant, chaque technique impose des contraintes : la diffusion de neutrons nécessite des sources nucléaires coûteuses, les rayons X exposent les échantillons à des doses potentiellement dommageables, et la cryo‑EM requiert des conditions de congélation rigoureuses pour éviter les artefacts. Le volume de données attendu (potentiellement plusieurs pétaoctets) impose des exigences de stockage, de bande passante et de puissance de calcul qui dépassent les capacités des infrastructures classiques, d’où le recours aux accélérateurs Nvidia. Enfin, la qualité des modèles d’IA dépendra de la capacité à harmoniser des jeux de données hétérogènes provenant de différents laboratoires et à gérer les biais introduits par les méthodes d’acquisition. Sans une normalisation rigoureuse, les prédictions pourraient rester limitées à des scénarios spécifiques, réduisant ainsi l’applicabilité des simulations numériques aux processus biologiques complexes.