Présentation du modèle

Claude Haiku 5.5 est le dernier modèle d’Anthropic, présenté comme « fast » et à faible coût d’inférence. Il s’inscrit dans la gamme Haiku, déjà connue pour son temps de réponse réduit et son empreinte mémoire modérée, ce qui le rend adapté aux applications en temps réel et aux environnements à ressources limitées.

Tarification et seuils de facturation

Le prix affiché est de 0,10 $ par million de tokens d’entrée et de 0,50 $ par million de tokens de sortie tant que le nombre total de tokens traités reste inférieur à 100 000 tokens. Au‑delà de ce seuil, le coût par token est multiplié par cinq, soit 0,50 $ d’entrée et 2,50 $ de sortie pour chaque million de tokens. Cette structure crée un point de rupture économique qui influence directement la conception des prompts et la segmentation des tâches.

Performances comparatives

Anthropic indique que, sous la barre des 100 000 tokens, Claude Haiku 5.5 atteint des scores de benchmark supérieurs à ceux de GPT‑6 Luna, tout en conservant le même tarif unitaire. Les benchmarks cités incluent des suites standardisées de génération de texte et de raisonnement logique, bien que les valeurs numériques exactes ne soient pas détaillées dans le communiqué. Au‑dessus du seuil, le modèle Luna devient plus économique, car son prix reste constant alors que Haiku voit son coût augmenter de façon proportionnelle.

Implications pour les développeurs

Le modèle à prix fixe jusqu’à 100 k tokens encourage les intégrations où le volume de texte reste limité, par exemple les assistants conversationnels courts ou les résumés de documents. En revanche, les flux de travail générant de longs rapports ou des dialogues prolongés devront soit segmenter les échanges pour rester sous le plafond, soit accepter une hausse de coût substantielle. Cette contrainte pousse les équipes à optimiser la longueur des prompts, à recourir à la compression de contexte ou à mettre en place des caches de réponses fréquentes.

Sur le plan architectural, la description « fast » suggère une optimisation du pipeline d’inférence, probablement via une quantisation plus agressive ou un parallélisme accru sur les GPU. Cependant, aucune information précise n’est fournie sur le nombre de paramètres, le type de quantisation ou les exigences matérielles, ce qui limite l’évaluation de la viabilité sur des serveurs de moindre puissance.