Présentation de la fonction Sketch

OpenAI a intégré Sketch dans ChatGPT Images 2.5, une interface qui permet à l'utilisateur de dessiner un croquis directement dans la fenêtre de conversation. L’activation se fait en saisissant

@Sketch
dans le champ de texte, ce qui ouvre un canvas où le dessin, même très rudimentaire, devient le point de départ du prompt visuel. L’utilisateur peut ensuite préciser des consignes textuelles, par exemple « transforme ce chat en photo réaliste », ou annoter des zones spécifiques pour modifier la couleur des yeux.

Mécanismes techniques de ChatGPT Images 2.5

Le croquis est converti en un vecteur d’image grâce à un encodeur de type diffusion conditionnée, similaire aux modèles de Stable Diffusion mais intégré au pipeline propriétaire d’OpenAI. Ce vecteur sert de condition initiale à un modèle de génération d’image qui combine le signal visuel du dessin avec le texte fourni par l’utilisateur. L’étape de fusion repose probablement sur un module de type CLIP, qui aligne les représentations textuelles et visuelles afin de garantir que les attributs décrits (par ex. « lumière naturelle », « textures riches ») soient reflétés dans le rendu final.

Images 2.5 introduit deux améliorations majeures : une meilleure gestion de l’éclairage et des textures, et une capacité à suivre des instructions d’édition sur plusieurs tours de conversation. Le système conserve le contexte de chaque modification grâce à un état persistant du prompt, ce qui évite de devoir reformuler l’ensemble du descriptif à chaque itération.

Analyse des performances et des limites

OpenAI indique une réduction de latence allant jusqu’à 50 % par rapport à Images 2.0. Cette amélioration peut résulter d’une optimisation du backend d’inférence (quantisation du modèle, parallélisation sur GPU, ou utilisation de serveurs plus proches géographiquement) ainsi que d’un pré‑traitement plus efficace du croquis, qui diminue le nombre d’étapes de diffusion nécessaires. La promesse de « lumière naturelle et textures plus riches » se traduit par une calibration plus fine des paramètres de bruit et de couleur pendant la diffusion, mais aucune métrique quantitative (par ex. FID ou CLIP‑Score) n’est fournie dans l’annonce.

La fonction reste dépendante de la clarté du dessin initial : un gribouillis très abstrait peut conduire à des interprétations erronées ou à des artefacts. De plus, l’absence de données publiques sur le modèle sous‑jacent (nombre de paramètres, jeu de données d’entraînement) limite l’évaluation de biais potentiels, notamment dans la représentation de sujets sous‑représentés. Enfin, la disponibilité actuelle se limite aux utilisateurs de ChatGPT, ChatGPT Work et Codex sur desktop, mobile et web, ce qui exclut les intégrations tierces via API.