Contexte et revendications d'OpenAI

OpenAI a présenté GPT‑4 comme capable de résoudre des problèmes mathématiques allant du lycée aux niveaux universitaires. L’entreprise cite un score de 70 % de réussite sur le benchmark public MATH, qui regroupe plus de 12 000 questions de type olympiade. Cette performance est mise en avant dans les fiches produit et les démonstrations publiques, où le modèle résout des intégrales, des équations différentielles et même des preuves de théorèmes simples.

Réactions des mathématiciens

Un groupe de mathématiciens, dont plusieurs professeurs d’universités américaines, a publié une lettre ouverte critiquant ces affirmations. Ils soulignent que les réponses de GPT‑4, bien que parfois correctes, contiennent fréquemment des erreurs de raisonnement, des omissions de conditions de domaine et des justifications incohérentes. L’article indique que les chercheurs ont reproduit plus de 30 % d’erreurs sur un sous‑ensemble de 100 questions tirées du même benchmark, ce qui, selon eux, rend les déclarations d’OpenAI « trop optimistes ».

Analyse des limites techniques

Les mathématiciens pointent trois mécanismes sous‑jacents. Premièrement, le modèle repose sur un apprentissage par renforcement à partir de feedback humain (RLHF), qui ne garantit pas la validité logique d’une démonstration. Deuxièmement, la génération de texte reste probabiliste : le modèle maximise la vraisemblance de la séquence suivante sans vérifier la cohérence interne, ce qui explique les contradictions internes observées. Troisièmement, l’absence de « vérificateur formel » intégré signifie que GPT‑4 ne peut pas tester automatiquement les résultats contre un système de preuve automatisé tel que Coq ou Lean. Ces trois facteurs combinés limitent la fiabilité des réponses dans des contextes où la rigueur mathématique est indispensable.

Implications pour la recherche en IA

Le débat met en lumière la tension entre performance apparente sur des jeux de données et robustesse réelle dans des applications scientifiques. Les mathématiciens demandent à OpenAI d’intégrer des modules de vérification symbolique et de publier des évaluations plus transparentes, incluant la distribution complète des scores et les taux d’erreur par catégorie de problème. Pour la communauté IA, cela signifie que les futures itérations devront combiner les capacités de génération de langage avec des moteurs de raisonnement formel afin de réduire le taux d’erreurs observé. En attendant, les utilisateurs doivent traiter les réponses mathématiques de GPT‑4 comme des suggestions à vérifier, et non comme des preuves définitives.