Présentation du modèle
SpaceXAI introduit Grok 4.7, la version la plus puissante de sa gamme dédiée au codage et aux tâches de connaissance. Le modèle repose sur une base plus grande que Grok 4.6 et a bénéficié d’un entraînement renforcé (RL) plus long, ciblant des problèmes qui s’étalent sur plusieurs heures. Cette approche améliore la vérification autonome du code et la gestion de contextes étendus, tout en intégrant nativement le protocole Grok Bot pour les interactions conversationnelles.
Performances sur les benchmarks
Sur le benchmark CursorBench 4.0, qui mesure la capacité à exécuter des tâches de programmation prolongées, Grok 4.7 atteint 46,3 % contre 40,4 % pour Grok 4.6, 41,7 % pour GPT‑5.6 Sol et 51,8 % pour Fable 5.1. En DeepSWE v1.1, dédié aux projets d’ingénierie logicielle intensifs, le score de Grok 4.7 s’élève à 71,0 % (marqué d’un astérisque pour effort élevé), surpassant les 65,2 % de Grok 4.6 et se rapprochant des 72,7 % de GPT‑5.6 Sol. Dans le domaine de l’électronique (EEBench), le modèle obtient 64,0 % contre 53,0 % pour la version précédente, tandis que les scores de Fable 5.1 et GPT‑5.6 Sol sont respectivement 56,4 % et 39,4 %.
Pour les tâches professionnelles multi‑heures, Grok 4.7 obtient 1 657 points sur le benchmark AA Briefcase v1.1, dépassant les 1 546 points de Grok 4.6 et se rapprochant des 1 678 points de Fable 5.1. En Terminal‑Bench 4.0, il réalise 38,0 % contre 20,3 % pour Grok 4.6, montrant une amélioration notable dans les environnements de ligne de commande. Les évaluations juridiques (Harvey Legal Agent) et médicales (HealthBench Professional) affichent respectivement 19,6 % et 56,7 %, confirmant une progression sur des domaines à haute exigence de précision.
Sécurité et garde‑fous
Grok 4.7 intègre une nouvelle pile de sécurités, la qualifiant de « modèle le plus résistant aux refus et aux jailbreaks » testé par SpaceXAI. Sur le benchmark LatchBio biosafety, il atteint 62,4 % de conformité, et sur HackerBench v0.3, seulement 3,3 % des invites à risque sont autorisées, tout en maintenant un taux de refus minimal pour les requêtes légitimes de cybersécurité. Des partenaires spécialisés ont reçu un accès invité aux capacités de red‑team du modèle pour la recherche en défense.
Tarification et disponibilité
Le modèle est commercialisé à 2 $ par million de jetons d’entrée et 6 $ par million de jetons de sortie. Une variante « fast » double la vitesse d’émission au prix double. Grok 4.7 est déployé dans les environnements Cursor, Grok Build, via l’API Grok, ainsi que sur des plateformes cloud tierces. L’accès s’obtient immédiatement via la console :
curl -fsSL https://x.ai/cli/install.sh | bash