Contexte de la levée et valorisation

Snorkel AI a annoncé une levée de fonds de 350 millions de dollars en série E, menée par Insight Partners et S32. Cette injection porte la valorisation post‑money de la société à 3,5 milliards de dollars, soit près du triple du niveau atteint lors de la série D (1,3 milliard) levée 17 mois plus tôt. Les investisseurs historiques – Addition, Lightspeed, Greylock, GV et Wells Fargo – ont également participé, confirmant la confiance du capital‑risque dans le modèle de l’entreprise.

Modèle de données‑as‑a‑service et architecture hybride

Initialement centré sur l’automatisation du labellage, Snorkel a réorienté son offre en 2025 vers le « data‑as‑a‑service ». Le service combine deux leviers : un logiciel propriétaire qui génère des données synthétiques à partir de modèles de génération, et l’intervention de spécialistes du domaine qui valident ou enrichissent ces jeux de données. Cette approche hybride permet de réduire la dépendance à un marché purement humain tout en conservant la qualité attendue par les laboratoires d’IA. Les coûts liés aux experts sont ainsi comptabilisés dans le coût des marchandises vendues (COGS) plutôt que dans le chiffre d’affaires déclaré, ce qui explique la différence entre le revenu brut annoncé et le revenu net réel.

Analyse économique et comparaison sectorielle

Snorkel indique un revenu annuel récurrent (ARR) de 375 millions de dollars, soit une multiplication par 18 sur les 12 derniers mois. Cette croissance s’inscrit dans un contexte où d’autres acteurs du « AI data lab » affichent des chiffres similaires : Mercor atteint 2 milliards de revenu brut, Handshake franchit le seuil du milliard, et Micro1 se situe autour de 500 millions. Cependant, la plupart de ces entreprises versent 60 % à 70 % de leur chiffre d’affaires brut aux spécialistes du domaine, ce qui réduit fortement leur revenu net. Snorkel, en vendant des environnements d’apprentissage par renforcement (RL) et des jeux de données complets, intègre ces paiements dans le COGS, offrant ainsi une visibilité plus nette sur la rentabilité opérationnelle.

Limites et perspectives

Le modèle de Snorkel repose sur la capacité à produire des données synthétiques de qualité comparable à des données réelles. Cette dépendance technique expose l’entreprise aux limites des générateurs de données, notamment les biais inhérents aux modèles sous‑jacents et la difficulté de reproduire des distributions de données complexes. De plus, la forte concentration de la clientèle – principalement des laboratoires d’IA et de grandes entreprises technologiques – crée un risque de concentration de revenu. Enfin, l’absence de données publiques détaillées sur les marges nettes empêche une évaluation précise de la viabilité à long terme, même si le chiffre d’affaires affiché montre une dynamique impressionnante.