Présentation du problème
Le blog de Terence Eden montre qu'un test reCAPTCHA affiché par Google demandait d'identifier des taxis jaunes, couleur typique des États‑Unis. L'utilisateur, habitué aux taxis noirs de Londres, a échoué, ce qui illustre que le défi repose sur une référence culturelle américaine plutôt que sur une tâche purement visuelle.
Mécanisme technique des CAPTCHAs visuels
reCAPTCHA v2 génère des images tirées d'un pool d'objets annotés par des humains. Un modèle de machine learning classe chaque image selon des labels (ex. « taxi », « panneau de signalisation »). Le serveur compare la sélection de l'utilisateur aux réponses attendues. Le processus dépend de la qualité du jeu de données d'entraînement ; si la majorité des annotations provient d'Américains, les catégories les plus fréquentes refléteront leurs habitudes (taxis jaunes, Twinkies, panneaux de signalisation US).
try { await navigator.share({url:u}); } catch { alert('Copied URl to clipboard'); }Ce fragment JavaScript, présent dans l'article, montre l'usage d'API web modernes pour le partage, mais n'affecte pas le mécanisme de validation du CAPTCHA.
Analyse de la dépendance culturelle
Plusieurs commentaires soulignent des références monétaires locales (groschen, tanner, pětka) qui ne figurent pas dans les jeux d'images. Un participant a indiqué que les défis se concentraient sur des panneaux de rue, mais que la définition exacte d'un « poteau » ou d'un « coin » variait selon le pays. Un autre a dû basculer vers Internet Explorer pour recevoir un défi « plus simple », ce qui montre que le système ajuste la difficulté en fonction du navigateur détecté, mais ne corrige pas le biais culturel.
Ces faits révèlent deux limites : (1) le modèle d'entraînement ne couvre pas la diversité des environnements urbains mondiaux, et (2) le système ne propose pas de fallback linguistique ou iconographique lorsqu'un objet n'est pas reconnu localement.
Conséquences et alternatives
Le biais entraîne des taux d'échec plus élevés pour les utilisateurs hors des États‑Unis, augmentant le risque de blocage légitime et de perte d'accès aux services. Du point de vue de la cybersécurité, un taux d'échec élevé peut pousser les utilisateurs à désactiver les protections ou à recourir à des solutions tierces, affaiblissant la barrière contre les bots.
Des alternatives existent : les CAPTCHAs basés sur le comportement (analyse du mouvement de la souris), les défis audio multilingues, ou les puzzles logiques dépourvus de références culturelles. L'intégration de jeux de données annotées de façon globale (ex. ImageNet) pourrait réduire le déséquilibre, à condition que les labels soient normalisés et que le système propose des variantes régionales.