Présentation du projet Nemotron
Les équipes NVIDIA ont exploité la famille de modèles Nemotron‑3 pour créer des spécialistes capables de performances de niveau or aux deux olympiades internationales de 2026 : l’International Olympiad in Informatics (IOI) et l’International Mathematical Olympiad (IMO). Deux variantes du modèle ont été utilisées : Nemotron‑3‑Nano‑CC (30 milliards de paramètres totaux, 3 milliards actifs) et Nemotron‑3‑Ultra‑CC (550 milliards totaux, 55 milliards actifs). Les scores obtenus sont 535,4/600 à l’IOI (seuil or = 361,12, meilleur humain = 498,27) et 30/42 à l’IMO (seuil or = 29).
Méthodologie de spécialisation
Le processus repose sur une recette en quatre étapes : (1) choisir un modèle de base Nemotron solide, (2) rassembler des jeux de données spécifiques au domaine, (3) appliquer des techniques de post‑entraînement – fine‑tuning supervisé (SFT) et, le cas échéant, apprentissage par renforcement (RL) –, et (4) coupler le modèle spécialisé à une boucle d’inférence qui génère, évalue et affine les réponses. Pour l’IOI, 22 000 problèmes de programmation ont été sélectionnés et enrichis de traces de raisonnement synthétiques. Le Nano a reçu SFT puis RL, tandis que l’Ultra a été affiné uniquement par SFT. Pour l’IMO, le corpus SFT comprend 414 890 exemples de preuves de haute qualité couvrant 15 818 problèmes, et le RL a été entraîné sur 9 597 problèmes proches de la frontière de capacité du modèle.
Architecture de la boucle d’inférence GenCorrect
Les spécialistes sont intégrés dans un système « generate‑verify‑refine » appelé GenCorrect. À chaque problème, le modèle produit plusieurs preuves candidates, les note à l’aide d’un critique interne, puis ré‑élabore les meilleures. Un second stade de calcul intensif sélectionne la soumission finale. Aucun outil externe, preuve formelle ou accès à Internet n’est utilisé ; toute la chaîne repose sur le modèle et le prompt. Cette architecture a permis de transformer les gains du fine‑tuning en améliorations supplémentaires grâce à plusieurs cycles de feedback, notamment le passage de 468 points à 535,4 points à l’IOI.
Performances et analyse des résultats
Les expériences montrent que le SFT fournit la majeure partie des gains pour le Nano (de 130 à 280 points, puis 291 après RL), tandis que l’Ultra atteint déjà 502 points après un seul epoch de SFT, surpassant le Nano post‑entraîné sur plusieurs benchmarks (IOI, ICPC, LiveCodeBench Pro). Dans le cadre de l’IMO, le checkpoint SFT excelle lors du premier tour de recherche, alors que le checkpoint RL obtient le meilleur résultat global. Leur combinaison, associée au modèle général, maximise la qualité des preuves générées. Les scores dépassent les seuils or officiels, confirmant que la spécialisation ciblée, couplée à une recherche itérative, peut atteindre des performances comparables à celles des meilleurs humains sans recourir à de nouveaux modèles de fondation.