Contexte et objectif

L’auteur a demandé à Claude Opus 5.5, modèle d’IA de génération de code, de produire une visualisation three.js des 55 cités décrites dans Invisible Cities d’Italo Calvino. Le prompt, fourni en une seule instruction, précise :

Make a three.js (pnpm) visualization of all Invisible Cities by Italo Calvino. Don’t ask questions, it is a one-shot task. You have 6h of work, use it until it becomes a masterpiece.
Le test vise à mesurer la capacité du modèle à gérer un projet complet sans itérations humaines.

Mécanismes d’exécution d’Opus 5.5

Opus 5.5 a déclaré avoir utilisé 1 h 25 min de temps réel, réparti sur six sous‑agents fonctionnant en parallèle. Le calcul de « agent‑hours » indique environ 7 heures d’effort combiné, ce qui montre une architecture multi‑agent où chaque sous‑agent explore une partie du pipeline (parsing, génération de code, tests, optimisation). Le coût d’API s’élève à 74 USD, soit un facteur supérieur à celui de GPT‑6 Astra (≈10 USD) pour un temps d’exécution de 53 minutes, ce qui reflète une consommation de tokens plus élevée par sous‑agent.

Analyse des performances et des limites

Le rendu final présente un laboratoire d’objectif interactif, avec un style visuel rappelant les précédents travaux de Claude (fond beige, numérotation « 05 »). Malgré la rapidité, plusieurs artefacts subsistent : du « AI slop » sous forme de commentaires superflus, des éléments de texte destinés à l’accessibilité affichés littéralement, et des chevauchements visuels non résolus. Ces défauts proviennent d’une génération de code qui ne filtre pas systématiquement les blocs inutiles, un problème récurrent lorsqu’on confie l’ensemble du processus à un seul appel.

Comparé à GPT‑6 Astra, Opus 5.5 a produit un résultat plus riche en termes de design, mais à un coût token et financier plus important. Astra a livré un prototype fonctionnel en moins d’une heure, avec moins de bruit visuel, mais sans le style distinctif de Claude. La différence souligne l’impact des stratégies de « prompt‑to‑code » : Opus 5.5 privilégie la profondeur créative, Astra la concision.

Implications pour le développement assisté par IA

Ce test confirme que les modèles actuels peuvent orchestrer un projet complet de visualisation web en moins de deux heures, mais la qualité finale dépend encore d’une révision humaine pour éliminer le bruit généré. Le modèle multi‑agent permet de paralléliser les tâches, réduisant le temps réel mais augmentant la consommation de tokens. Les coûts observés (74 USD pour 6 sub‑agents) indiquent que l’usage intensif de ces modèles reste onéreux, surtout lorsqu’ils sont employés dans des pipelines de design répétés. Les développeurs devront donc équilibrer la richesse créative offerte par des modèles comme Opus 5.5 avec les contraintes budgétaires et la nécessité d’une post‑édition.