Contexte et partenaires

Google DeepMind, Meta et la startup de découverte de médicaments Isomorphic Labs ont annoncé un investissement commun de 300 millions de dollars dans Biohub, l’organisation à but non lucratif fondée en 2016 par Mark Zuckerberg et Priscilla Chan. Cette contribution s’inscrit dans le cadre de l’initiative « Virtual Biology » d’un total de 1,8 milliard de dollars, visant à créer des jeux de données d’IA capables de simuler le comportement cellulaire. Le financement public complète le tableau : le Département de l’Énergie des États‑Unis prévoit plus de 500 millions de dollars sur cinq ans, tandis que les National Institutes of Health apportent des ensembles de données et des bases de connaissances issus de plus de 500 millions de dollars d’investissements antérieurs.

Objectifs scientifiques et architecture du modèle

Biohub ambitionne de produire un « modèle prédictif haute précision de la cellule », capable de reproduire numériquement les processus biologiques à l’échelle subcellulaire. Le modèle repose sur des réseaux de neurones profonds entraînés à partir de données multimodales : imagerie microscopique, séquençage d’ARN, mesures de protéomique et simulations physiques. La stratégie consiste à intégrer ces sources dans une architecture de type « multimodal transformer », où chaque modalité est encodée séparément avant d’être fusionnée dans un espace latent partagé. Cette approche permet de générer des prédictions sur la dynamique des voies métaboliques, la réponse aux médicaments ou l’effet de mutations génétiques, le tout sans expérimentation in vitro.

Enjeux techniques et limites

La création d’un tel modèle impose des exigences de calcul extrêmes : l’entraînement nécessite des clusters GPU/TPU capables de traiter plusieurs pétaoctets de données. La qualité des prédictions dépend directement de la densité et de la diversité des jeux de données, ce qui impose une coordination internationale pour standardiser les protocoles de collecte et d’annotation. De plus, la généralisation du modèle à des types cellulaires rares reste incertaine, car les ensembles de données publics couvrent majoritairement des lignées cellulaires bien étudiées. Enfin, le recours à des simulations numériques soulève la question de la validation expérimentale : chaque résultat doit être confronté à des mesures réelles pour éviter les dérives de modèle.