Contexte juridique
Le 16 septembre 2026, le tribunal de district du Nord‑Californie a reçu la plainte Vredenburgh v. OpenAI OpCo, LLC (n° 3:26‑cv‑10527). La requête allègue qu’OpenAI aurait routé des conversations réelles d’utilisateurs de ChatGPT vers des contractuels externes, sans mentionner ce processus dans ses Conditions d’utilisation, sa Politique de confidentialité ou les pages dédiées à l’entraînement des modèles. La plainte, déposée deux jours après la publication d’une enquête de 404 Media, décrit le projet interne nommé « Project Lily ». Aucun groupe n’a encore été certifié, et aucune indemnisation n’est disponible.
Fonctionnement du pipeline de relecture humaine
Selon la plainte, OpenAI recrute des évaluateurs via la société de travail temporaire Crossing Hurdles. Chaque évaluateur accède à un tableau de bord où il sélectionne une tâche contenant le texte complet d’une conversation utilisateur. Le processus comporte plusieurs étapes : (1) rédaction d’un résumé de l’intention perçue de l’utilisateur, (2) lecture de quatre réponses générées par ChatGPT, (3) mise en évidence des passages conformes ou non aux objectifs d’OpenAI, (4) attribution d’un score de 1 à 7 à chaque réponse, et (5) rédaction d’une justification. Les scores et les résumés sont ensuite réinjectés dans le cycle d’entraînement du modèle.
Avant la présentation aux évaluateurs, les conversations passent par un « Privacy Filter » automatisé. La documentation publique de ce filtre le décrit comme un « redaction aid », non comme une garantie d’anonymisation totale. La plainte indique que les consignes aux évaluateurs les incitent à escalader les tâches contenant des informations personnelles, et que l’interface peut afficher un historique résumant l’usage antérieur du compte, révélant potentiellement le nom ou la localisation de l’utilisateur.
Analyse des risques de confidentialité
Le recours à des humains externes introduit plusieurs vecteurs de fuite de données. Premièrement, le filtre automatisé ne supprime pas systématiquement les identifiants, ce qui expose les évaluateurs à des informations sensibles. Deuxièmement, la possibilité d’escalade signifie que les données jugées « personnelles » sont explicitement signalées, augmentant la probabilité de traitement par des tiers non couverts par la politique de confidentialité actuelle. Enfin, la divulgation partielle dans la FAQ (« Do humans view my content? ») mentionne uniquement le personnel autorisé et les « trusted service providers », sans inclure les contractuels de labellisation, créant une incohérence juridique entre les déclarations publiques et les pratiques internes.
Réactions d’OpenAI et limites de la divulgation
OpenAI répertorie onze catégories d’entreprises tierces dans sa politique de confidentialité : hébergement, paiement, service client, analytique, vérification d’identité, etc. Aucune de ces catégories ne correspond à des fournisseurs de labellisation ou d’évaluation humaine. La page dédiée à l’entraînement des modèles décrit uniquement la rétention de données, la suppression automatisée d’informations personnelles et l’entraînement machine, sans référence à une relecture humaine. Une seule page mentionne la relecture humaine, mais elle se limite à la vérification de contenus signalés pour violation de politique, et non à l’entraînement du modèle. Cette omission constitue le cœur de la plainte, qui soutient qu’OpenAI a volontairement masqué l’existence du processus de revue humaine pour le modèle.