Présentation

Une version interne du modèle Astra d'OpenAI a résolu 10 problèmes majeurs en mathématiques, complexité quantique et informatique théorique. Les résultats ont été évalués à l'aide de la rubrique OpenMath d'EpochAI Research.

Évaluation des résultats

Les modèles GPT-5.6 Sol Pro et Fable 5 Max ont classé les résultats en trois catégories : Solid Result, Major Advance et Breakthrough. Les deux modèles s'accordent pour dire que le résultat #3 est un Breakthrough et que au moins 7 résultats sont des Major Advancements.

Fonctionnement de l'évaluation

La rubrique OpenMath d'EpochAI Research définit les catégories de la manière suivante : Solid Result correspond à un résultat qui serait satisfaisant pour un chercheur expérimenté dans le domaine, mais qui ne susciterait pas beaucoup d'intérêt en dehors de son sous-domaine. Un Major Advance correspond à un résultat qui serait remarqué par un chercheur moyen dans un domaine plus large, tandis qu'un Breakthrough correspond à un résultat qui serait intéressant pour la majorité des mathématiciens, même s'il est en dehors de leur domaine.

Implications et limites

Les résultats montrent que les modèles de langage peuvent être utilisés pour résoudre des problèmes mathématiques complexes. Cependant, il est important de noter que les évaluations des résultats peuvent varier en fonction des modèles et des rubriques utilisés. Par exemple, Fable 5 pense que au moins 3 des résultats sont Borderline Breakthrough, ce qui souligne la nécessité d'une évaluation plus approfondie.