Contexte juridique
Un juge fédéral californien a validé un accord entre LinkedIn, ProAPIs et Netswift. L’accord impose l’arrêt du scraping à grande échelle, l’interdiction de vendre ou transférer les données collectées, la suppression des comptes factices et la destruction des informations déjà extraites. Cette décision fait suite à une plainte déposée par LinkedIn en octobre 2025, qui accusait les deux sociétés d’avoir créé un réseau de comptes fictifs capables de récupérer quotidiennement des centaines de profils.
Mécanismes de scraping à grande échelle
Selon la plainte, les acteurs impliqués maintenaient des millions de comptes factices. Chaque compte était utilisé pour accéder à des profils publics, extraire les sections membre, entreprise, école, réactions, commentaires et publications, puis stocker les données dans des pipelines internes. La création de centaines à plusieurs milliers de nouveaux comptes chaque jour permettait de contourner les filtres de LinkedIn, qui ne pouvaient bloquer les comptes que quelques heures après leur création. Cette cadence de création générait un volume de requêtes suffisant pour scraper plusieurs centaines de profils avant que les systèmes de détection ne réagissent.
Réponses techniques de LinkedIn
LinkedIn a indiqué qu’il détecte les comptes factices grâce à des algorithmes d’analyse comportementale, incluant la vitesse de création, la fréquence de requêtes et les modèles d’interaction atypiques. Une fois identifiés, les comptes sont désactivés et les adresses IP associées sont bloquées. Le rapport mentionne que la plateforme a pu « bloquer les comptes factices quelques heures après leur création », limitant ainsi le nombre de profils accessibles. Cependant, la rapidité de création de nouveaux comptes a rendu l’effort de blocage insuffisant pour empêcher le volume total de données extraites.
Implications et limites
L’ordonnance judiciaire contraint ProAPIs et Netswift à cesser toute activité de scraping et à supprimer les données déjà collectées. Sur le plan technique, la décision souligne les limites des solutions de détection basées uniquement sur le comportement en temps réel lorsqu’un acteur peut générer massivement de nouveaux identifiants. Elle incite les plateformes à renforcer les contrôles d’authentification, à intégrer des vérifications d’identité plus strictes et à surveiller les schémas de création de comptes à l’échelle du réseau. L’absence de détails sur les mesures de conformité post‑accord laisse incertain le degré de suivi et d’audit appliqué aux deux sociétés.