Présentation du problème
Une analyse approfondie des données d'entraînement publiques sur Hugging Face a révélé une quantité considérable de secrets et de clés d'accès sensibles. Les données scannées totalisent 7,6 pétaoctets répartis sur 187 millions de fichiers, ce qui constitue la plus grande analyse de secrets dans les données d'entraînement d'IA à ce jour.
Architecture et fonctionnement
Les chercheurs ont utilisé l'outil TruffleHog pour scanner les données et ont trouvé 221 303 clés d'accès uniques et actives dans 6 003 jeux de données. Ces clés donnent accès à divers services, notamment des buckets de stockage cloud, des bases de données hébergées, des clés d'administration cloud et des tokens pouvant pousser du code dans des logiciels utilisés par de nombreuses personnes.
Implications et limites
Les clés découvertes incluent des tokens GitHub personnels, des clés Docker Hub et des clés d'accès à des bases de données hébergées. Certaines de ces clés sont associées à des comptes ayant un accès élevé à des logiciels utilisés par des millions de personnes. Les chercheurs ont également trouvé des clés qui permettent de modifier des logiciels et des données sensibles, ce qui souligne les risques importants pour la sécurité et la confidentialité.
Conséquences et recommandations
Les résultats de cette analyse soulignent l'importance de la sécurité et de la confidentialité dans les données d'entraînement d'IA. Les entreprises et les développeurs doivent prendre des mesures pour protéger leurs clés d'accès et leurs données sensibles. Les chercheurs recommandent de travailler avec les fournisseurs de services pour révoquer les clés d'accès exposées et de mettre en place des mesures de sécurité robustes pour protéger les données d'entraînement d'IA.
Les clés découvertes incluent :
- 349 tokens GitHub personnels
- 318 clés Docker Hub
- 8 594 clés de base de données hébergée
- 5 885 tokens Slack et clés Mailgun
Les conséquences potentielles de ces failles de sécurité sont importantes, avec des pertes estimées à au moins 920 000 dollars par an en raison de l'utilisation non autorisée d'inférence d'IA.