Présentation du modèle

Claude Haiku 5.5 est le petit modèle d’Anthropic le plus rapide et le moins cher jamais commercialisé. Conçu pour des charges de travail à haut volume et à faible budget, il cible les tâches répétitives (résumés, requêtes de bases de données, classifications). Le modèle propose un réglage d’effort ajustable, permettant à l’utilisateur d’optimiser soit le coût, soit la précision selon le contexte d’utilisation.

Performances comparatives

Les benchmarks publiés montrent des écarts majeurs par rapport à la version précédente Haiku 4.5. Sur le test GDPval‑AA v2.1 (travail de connaissance), Haiku 5.5 atteint 1620 points contre 735 pour Haiku 4.5, soit plus du double, tout en restant légèrement en dessous du modèle haut de gamme Sonnet 5.5 (1840 points). Le benchmark AA‑Briefcase v1.1 suit la même tendance : 1578 contre 614. En computer use (OSWorld 2.1), Haiku 5.5 obtient 72,4 % de réussite, contre seulement 15,7 % pour Haiku 4.5, alors que le leader GPT‑6 Luna atteint 83,9 %.

Dans le domaine du multidisciplinary reasoning (Humanity’s Last Exam), Haiku 5.5 réalise 45,9 % sans outils et 57,4 % avec outils, dépassant largement Haiku 4.5 (10,2 % sans outils) et se rapprochant du Sonnet 5.5 (56,9 % sans outils, 64,5 % avec outils). Le test Terminal‑Bench 4.0 d’agentic coding montre 39,2 % de réussite, contre 0 % pour Haiku 4.5 et 70,6 % pour GPT‑6 Luna. Enfin, en visual reasoning (Chartography), Haiku 5.5 obtient 46,4 % contre 6,4 % pour Haiku 4.5, confirmant une progression de plus de sept fois.

Analyse de l’ajustement d’effort et du coût

Le réglage d’effort permet de moduler le coût par tentative (USD) sur une échelle logarithmique. À faible effort, Haiku 5.5 conserve une précision supérieure à Haiku 4.5 tout en réduisant le coût de 75 % en moyenne. Cette économie se traduit par un prix par million de tokens nettement inférieur, particulièrement avantageux pour les prompts jusqu’à 100 000 tokens, qui représentent environ 90 % des requêtes du modèle précédent.

La réduction du prix des lectures de cache de Claude Sonnet 5.5 (environ 20 % de baisse) complète la stratégie de compression des dépenses, offrant une gamme de modèles où le petit modèle Haiku 5.5 devient le choix par défaut pour les tâches à forte intensité de volume.

Retours clients et limites observées

Des entreprises testées confirment les gains annoncés : Asana rapporte plus de 30 % de réduction de latence et jusqu’à 2,5 × d’inférence plus rapide par tour d’agent. HubSpot note un score moyen de 92,8 % sur son suite CRM, avec le meilleur temps d’exécution et le taux de faux positifs le plus bas. AlphaSense observe une amélioration de 0,84 contre 0,76 sur 400 requêtes documentaires. Box indique une hausse de 11 points de score avec moitié de latence. Rogo souligne la pertinence du modèle pour les sous‑agents de recherche rapide dans des documents financiers. Cognition mentionne un score FrontierCode de 66,2 % lorsqu’il est couplé à Haiku 5.5, tout en réduisant coût et latence.

Les limites restent liées à la capacité de raisonnement profond sans outils, où les modèles plus grands conservent un avantage. De plus, les évaluations publiques ne couvrent pas encore les scénarios de dialogue long ou les contextes multimodaux, ce qui laisse une marge d’incertitude pour certaines applications critiques.