Présentation
Des chercheurs ont créé un environnement de dessin pour tester les capacités de modèles d'IA tels que GPT-5.6, Claude, Gemini et Grok. Chaque modèle a reçu un canevas blanc et un ensemble d'outils de crayons de couleur pour reproduire la Joconde ou créer des dessins à partir de prompts textuels.
Fonctionnement
Les modèles ont utilisé les mêmes outils pour dessiner, notamment plan pour la planification, view_target pour visualiser l'image cible, set_color, set_brush et set_pressure pour configurer les outils, draw pour créer des traits, smudge pour estomper et erase pour effacer. Les modèles ont également utilisé view_canvas pour visualiser leur propre travail et décider quoi corriger.
Résultats
Les résultats montrent que les modèles ont utilisé les outils de manière différente. GPT-5.6 n'a jamais appelé set_color, set_brush ou set_pressure, tandis que Grok 4.5 a utilisé ces outils à 65% de ses appels. Claude Fable 5 a utilisé smudge à 123 reprises et a revu constamment son travail. Gemini 3.6 Flash a été le modèle le plus obsessif, avec près d'un tiers de ses appels étant des view_canvas.
Les coûts et les jetons utilisés par les modèles varient également. Claude Fable 5 a coûté environ 160$ pour ses sept dessins, tandis que GPT-5.6, Grok 4.5 et Gemini 3.6 Flash ont coûté respectivement 7,74$, 9,21$ et 12,87$. Les modèles ont également utilisé des quantités différentes de jetons, avec Grok 4.5 utilisant le plus de jetons (34 millions) mais restant le moins cher en raison de l'utilisation de lectures en cache.
Amélioration
Les résultats montrent que les modèles n'ont pas nécessairement amélioré leur travail en continuant à éditer. Les scores de similarité (SSIM) ont atteint un plateau tôt dans le processus, et les modèles ont souvent terminé avec un score inférieur à leur meilleur score atteint pendant le processus. Gemini 3.6 Flash a atteint le score le plus élevé (0,449) mais a terminé avec un score de 0,337.
SSIM = 0 à 1, plus haut est plus proche de l'image cible
Les résultats montrent que les modèles ont des forces et des faiblesses différentes, et que les coûts et les jetons utilisés varient en fonction de la stratégie employée. Les chercheurs soulignent que ces tests ne sont pas des tests objectifs de la capacité des modèles, mais plutôt des tâches ouvertes et floues qui permettent de mieux comprendre les capacités et les limites des modèles d'IA.