Contexte de l’expérimentation
Le projet a été mené pendant deux années dans 18 écoles intermédiaires du Tennessee. Il s’agit d’un essai randomisé en grappes où les élèves ont été assignés soit à un groupe utilisant Khan Academy avec le tuteur IA Khanmigo, soit à un groupe contrôle sans IA. Les séances concernées étaient les cours quotidiens de mathématiques de remédiation, déjà intégrés au programme scolaire.
Mécanisme de Khanmigo et configuration coaching
Khanmigo repose sur un modèle de génération de texte (probablement une version de GPT) intégré à la plateforme Khan Academy. Pour l’étude, le tuteur a été paramétré en mode « coach » : il propose des indices et des questions guidées sans fournir directement la réponse finale. Cette configuration vise à encourager la réflexion autonome, contrairement à un mode « answer » qui résout l’exercice à la place de l’élève.
Résultats quantitatifs et analyse statistique
Les élèves exposés à Khanmigo ont amélioré leurs scores de mathématiques de 1,3 point de percentile national par trimestre. Converti en écart-type, cela représente entre 0,06 et 0,08 σ sur une année scolaire, et 0,14 σ si l’on considère une participation active pendant toute l’année. Ces gains sont comparables à ceux observés avec la pratique standard de Khan Academy sans assistance IA, suggérant que l’effet provient davantage de la plateforme que du tuteur IA lui‑même.
Limites et perspectives d’engagement
Le facteur limitant principal est l’engagement des élèves. Bien que 96 % des participants aient essayé Khanmigo au moins une fois, le médian n’a interagi avec le tuteur que un tiers des jours de pratique et seulement 17 % des séances où il a commis une erreur. Les messages envoyés étaient majoritairement des réponses brutes ou des clics sur des invites suggérées, indiquant une utilisation superficielle du dialogue pédagogique. Cette faible fréquence d’interaction réduit la capacité du système à exercer son rôle de coach et explique la similitude des effets avec la version non‑IA. L’étude ne fournit pas de données détaillées sur le contenu des prompts ni sur les variations de performance selon le niveau de compétence initial, ce qui limite l’interprétation fine des résultats. Pour exploiter pleinement le potentiel de l’IA tutorielle, il faudra concevoir des incitations à l’usage, améliorer l’interface de dialogue et mesurer plus précisément la profondeur des échanges.