Présentation du nouveau modèle

GPT‑6.1 Sol, publié sept jours après GPT‑6 Sol, se positionne comme le successeur immédiat de la gamme Sol. Le modèle conserve le même tarif de base ($2/$10 par million de jetons d’entrée/sortie) mais augmente la remise de lecture du cache de 90 % à 95 %. Cette évolution tarifaire, combinée à des gains d’efficacité, rend le prix moyen par tâche d’environ $0,72 pour les charges d’intelligence maximale, soit moins d’un quart du coût du modèle de référence GPT‑6 Astra.

Performances mesurées

Sur l’Intelligence Index v4.3.2, GPT‑6.1 Sol obtient 4 points de plus que GPT‑6 Sol et 5 points au-dessus de GPT‑5.6 Sol, se situant à un point du score de GPT‑6 Astra. Les gains se traduisent dans plusieurs benchmarks : +12 points sur Terminal‑Bench 4.0, +5 points sur Humanity’s Last Exam, +6 points sur le test GDP.pdf et +8 points sur AA‑Omniscience Accuracy, avec une réduction du taux d’hallucination de 60 % à 54 %.

Dans le domaine du codage, le modèle progresse de 3 points sur l’Artificial Analysis Coding Agent Index par rapport à GPT‑6 Sol, restant 2 points en dessous de GPT‑6 Astra. En mode xhigh, il dépasse même GPT‑6 Astra d’un point tout en consommant moins de 15 % du coût par tâche.

Efficacité économique et tokenique

Le coût par tâche de GPT‑6.1 Sol est 31 % inférieur à celui de GPT‑6 Sol ($1,05) et 64 % inférieur à GPT‑5.6 Sol ($1,99). Tous les niveaux d’effort du modèle repoussent la frontière de Pareto : pour un niveau d’intelligence donné, aucun autre modèle n’est moins cher.

En revanche, le modèle consomme 10‑30 % de jetons de sortie supplémentaires que GPT‑6 Sol, ce qui reflète une stratégie d’augmentation de la profondeur de génération. Malgré cette hausse, les niveaux d’effort faible et moyen restent Pareto‑optimaux en termes d’efficacité tokenique grâce à l’amélioration du score d’intelligence.

Analyse des limites et perspectives

Les gains d’intelligence s’accompagnent d’une utilisation accrue de jetons, ce qui peut impacter les scénarios à budget strict. De plus, la réduction du taux d’hallucination, bien que notable, reste à 54 %, indiquant que les mécanismes de contrôle de génération ne sont pas encore pleinement résolus. L’absence de détails sur les modifications architecturales (par ex. taille du modèle, techniques de distillation ou de quantisation) empêche d’isoler les contributions exactes de l’optimisation logicielle versus l’ajustement des hyper‑paramètres.

En résumé, GPT‑6.1 Sol représente une avancée mesurable en intelligence et en coût, tout en introduisant un compromis tokenique et en conservant des marges d’amélioration sur la fiabilité des réponses.