Contexte et objectifs
Unreal Labs a développé Unreal Agent, un harness destiné aux agents IA qui vise à diminuer les dépenses liées aux appels d'outils. Les auteurs constatent que les agents traditionnels gaspillent des tokens en gérant les attentes, les sondages et les battements de cœur des outils. En réponse, le harness propose une gestion asynchrone des appels, permettant à l'utilisateur de diriger l'agent sans attendre la fin d'une tâche longue.
Architecture asynchrone du harness
Le cœur du système consiste en un journal d'événements où chaque appel d'outil crée immédiatement une entrée « in‑progress ». Le modèle LLM continue son traitement pendant que l'outil s'exécute en arrière‑plan. Dès que le résultat final est disponible, une seconde entrée est ajoutée et déclenche un nouveau tour de modèle. Cette séparation évite le besoin de polling explicite, réduit le nombre de tours de modèle et préserve la cohérence du cache, un problème d’ingénierie souligné par les auteurs.
Le harness repose sur des prompts très simples, des résultats d'outil optimisés en tokens et l'absence de sous‑agents ou de workflows complexes. Le SDK fourni comprend une bibliothèque Go, un exécutable runner similaire à claude -p et un benchmark runner compatible avec la plateforme Harbor.
Analyse des performances et benchmarks
Les mesures publiées montrent des économies de coût allant jusqu'à 40 % par rapport à Codex et jusqu'à 20 % par rapport à Pi. Sur le benchmark Terminal‑Bench 4.0, Unreal Agent atteint un taux de réussite de 57,9 % avec un coût total de 1 428 $, contre 2 350 $ pour Codex (même taux) et 1 827 $ pour Pi (taux 55 %). Le nombre de tours de modèle est de 28 contre 0 pour les comparateurs, tandis que le nombre d'outils invoqués passe à 37, démontrant une utilisation plus dense des appels d'outil par tour.
Sur le benchmark SWE‑Atlas, le taux de réussite passe à 65,8 % pour Unreal Agent avec un coût de 936 $, contre 63,3 % et 1 303 $ pour Codex. Le nombre de tours chute à 16, et les outils à 27, indiquant une meilleure efficacité tokenique. Le benchmark DeepSWE 1.1 montre un taux de 72,4 % et un coût de 1 367 $, contre 69,0 % et 1 633 $ pour Codex, avec 26 tours et 38 outils. Enfin, dans l'examen final des agents, Unreal Agent obtient un taux de passage de 30,0 % avec un coût de 59,7 $, légèrement supérieur à Codex (29,0 % / 58,1 $) et comparable à Pi (29,0 % / 59,2 $).
Ces résultats confirment que la réduction du nombre de tours de modèle et l'optimisation des tokens d'entrée/sortie sont les leviers principaux de la réduction de coût, tout en maintenant des performances de réussite similaires ou supérieures.
Disponibilité et perspectives
Le SDK est disponible en open source, avec une bibliothèque Go intégrable directement dans les projets et un exécutable runner pour les tests rapides. Les auteurs soulignent que le design du harness constitue un domaine de recherche à part entière, avec des améliorations potentielles telles que la prise en charge explicite du champ function_call_output dans les API de réponses et une meilleure standardisation des mises à jour d'état « in‑progress ». Unreal Labs invite les partenaires à explorer ces optimisations pour des déploiements à grande échelle.