Contexte et objectifs

AWS propose Strands Harness pour répondre à la difficulté rencontrée par les développeurs lorsqu’ils passent d’un prototype d’agent IA exécuté localement à une infrastructure cloud évolutive. Les outils courants comme Claude Code d’Anthropic ou Codex d’OpenAI fonctionnent bien sur une machine locale, mais leur migration vers un environnement multi‑cloud entraîne des problèmes d’intégration et de scalabilité. Strands Harness se veut une solution prête à l’emploi, capable de fonctionner tant sur les plateformes AWS, Google Cloud, Microsoft Azure, Modal ou Cloudflare, ainsi que sur des installations locales via Ollama.

Architecture et fonctionnalités

Le framework repose sur le Strands Harness SDK, un ensemble open‑source dédié à la gestion de patterns multi‑agents. Il accepte les modèles de pointe d’Anthropic, OpenAI, Amazon Bedrock et Google, tout en permettant l’utilisation d’un modèle Ollama auto‑hébergé. Parmi les composants fournis, on trouve des capacités de lecture, d’écriture, d’édition, d’accès shell et de recherche web. Plutôt que d’ajouter des outils spécifiques à chaque tâche, le système exploite les fonctions déjà connues du modèle sous‑jacent, simplifiant ainsi le développement.

La gestion du contexte est optimisée : les résultats d’outils sont stockés dans des fichiers séparés et les parties réutilisées d’une requête sont mises en cache, ce qui réduit le nombre de tokens consommés. Un mécanisme de mémoire à long terme conserve les sessions via des identifiants, permettant à l’agent de reprendre une conversation précédente. Un agent auxiliaire intégré peut recevoir des sous‑tâches ouvertes et les exécuter selon une checklist automatisée. Les développeurs peuvent enrichir le système avec des « Agent Skills » et connecter des serveurs Model Context Protocol pour étendre les capacités.

pip install strands-agents-harness
npm install strands-agents-harness

Performances et limites

Les benchmarks publiés par AWS indiquent que Strands Harness atteint une efficacité supérieure de 26 % par rapport à des agents construits avec d’autres frameworks lorsqu’ils utilisent le même modèle sous‑jacent. Sur le modèle Anthropic Fable 5, le coût d’exécution est inférieur de 77 % à celui de Claude Code, tout en obtenant un score plus élevé sur le benchmark Terminal Bench 2.1. Ces gains proviennent principalement de la réduction du trafic de tokens grâce à la mise en cache et à la délégation de résultats d’outils vers le système de fichiers.

Le principal cas d’usage annoncé est le prototypage rapide d’applications IA. L’équipe AWS a illustré cette approche avec le Strands CLI, qui accepte des commandes en langage naturel, sélectionne le modèle, ajoute les prompts et outils, puis génère le code d’agent en Python ou TypeScript via la commande /export. Cette méthode accélère le passage du concept à un prototype fonctionnel, mais elle dépend de la qualité du modèle choisi et de la pertinence des outils intégrés. Aucun détail n’est fourni sur la charge maximale supportée ni sur les exigences de latence dans des environnements très distribués, ce qui laisse une marge d’incertitude pour les déploiements à grande échelle.