Présentation
Holo4 est la nouvelle série de modèles agentiques proposée par Hugging Face. Deux variantes sont commercialisées : un modèle dense de 27 milliards de paramètres (Holo4‑27B) et un modèle Mixture‑of‑Experts de 35 milliards (Holo4‑35B‑A3B). Une version allégée, Holotron4 Nano, accompagne la gamme. Tous les modèles sont accessibles via l’API H Models et fonctionnent sur desktop, web, Android, sandbox de code ou API d’entreprise, sans besoin de sélectionner un modèle différent selon la plateforme.
Architecture et entraînement
Holo4 repose sur l’architecture Qwen, enrichie par un affinement supervisé puis par du reinforcement learning (RL) sur un vaste corpus d’environnements générés par l’« Agentic Task Factory ». Le jeu de données inclut des tâches GUI (clics, frappes), du code exécutable, des appels MCP et des requêtes API. Cette diversité oblige le modèle à apprendre à choisir dynamiquement le canal d’interaction le plus adapté, ce qui contraste avec les modèles spécialisés qui ne supportent qu’une seule interface.
Build a 3D model of the Eiffel Tower in FreeCAD, at a scale of 1 mm to 1 m, centred on the origin and aligned to the X and Y axes.
…
Each leg is 14 mm across at the ground and tapers to 4 mm at height 276.Performances et comparaison
Sur le benchmark OSWorld 2.0, dédié au contrôle d’un système d’exploitation via interface graphique, Holo4‑27B atteint un score de 61,7 % contre 81,8 % pour le modèle fermé Opus 5.5. La version 35B‑A3B obtient 30,9 % sur la même tâche, mais avec un nombre de paramètres inférieur aux modèles concurrents de même rang. Le coût d’exécution, calculé à partir du nombre de tokens d’entrée et de sortie, est plusieurs ordres de grandeur plus bas que celui de Qwen 3.8 27B ou Qwen 3.6 35B‑A3B évalués aux tarifs Alibaba Cloud. Sur AutomationBench v1.0.6, qui mesure l’efficacité d’appels d’API, Holo4 se situe parmi les modèles de pointe tout en conservant un coût par tâche nettement inférieur. Hugging Face publie les trajectoires complètes de chaque exécution, permettant de reproduire les résultats et d’analyser les décisions du modèle pas à pas.
Limites et perspectives
Malgré des scores compétitifs, Holo4 reste en deçà des meilleures solutions fermées sur les flux de travail longs, notamment sur OSWorld 2.0 où l’écart de performance est de plus de 20 points. Le modèle A3B, bien que plus puissant, montre une chute de précision sur les tâches complexes, suggérant que le routage des experts n’est pas encore optimal. De plus, les évaluations internes utilisent des ensembles publics ; les performances sur des jeux privés, qui reflètent davantage les exigences industrielles, ne sont pas encore publiées. Enfin, la dépendance à l’API H Models implique un coût récurrent, même si celui‑ci est inférieur aux alternatives cloud.