Présentation du test
Le test du pélican sur un vélo, créé par Simon Willison, est devenu un benchmark informel pour les modèles de langage. L'idée est de générer un SVG d'un pélican chevauchant un vélo.
Méthodologie de l'expérience
L'auteur a généré 1 008 SVG à l'aide de sept modèles de pointe, en utilisant une grille de 8 animaux et 6 véhicules. Chaque modèle a généré trois échantillons par prompt, avec une température de 1,0.
grid = 8 animaux × 6 véhicules = 48 prompts
Les images ont ensuite été évaluées à l'aide d'un juge LLM, qui a attribué des notes de 1 à 5 pour l'animal, le véhicule et la cohérence de l'action.
Résultats de l'expérience
Les résultats montrent que les laboratoires d'IA ne semblent pas optimiser spécifiquement pour le test du pélican sur un vélo. Les images de pélicans sur des vélos ne sont pas significativement meilleures que les autres combinaisons d'animaux et de véhicules.
Les notes moyennes pour les animaux et les véhicules montrent que les pélicans sont en sixième position sur huit, et les vélos sont en deuxième position à partir de la fin. Cela suggère que les laboratoires d'IA ne donnent pas la priorité à l'optimisation de ces éléments spécifiques.
Analyse statistique
Une régression à effets fixes a été effectuée pour analyser les résultats. Les résultats montrent que les effets de laboratoire pour les pélicans et les vélos sont faibles et non significatifs, ce qui suggère que les laboratoires d'IA ne bénéficient pas d'un avantage significatif en optimisant spécifiquement pour le test du pélican sur un vélo.