Grok 4.7 mise sur des agents capables de tenir des heures de travail sans lâcher le fil

— AGENTS

SpaceXAI présente Grok 4.7 comme un modèle taillé pour les missions longues, où il faut planifier, appeler des outils et corriger sa trajectoire après un échec. Les scores publiés progressent face à Grok 4.6 mais restent inégaux, avec Fable 5.1 en tête sur plusieurs bancs d'essai clés.

Grok 4.7 mise sur des agents capables de tenir des heures de travail sans lâcher le fil

Un modèle qui garde le fil d'une mission pendant des heures, voilà ce que SpaceXAI vend avec Grok 4.7. Le système explore des dépôts de code entiers, enchaîne les tests, inspecte ses erreurs et reprend le travail après un échec. Cette endurance déplace l'ambition affichée : montrer qu'un modèle tient la distance plutôt que produire une réponse brillante et isolée.

Les métiers directement visés sont les développeurs, les juristes et les analystes qui préparent des dossiers ou des présentations sur plusieurs heures. Aucun créatif de l'image ou du son n'apparaît dans les usages décrits. Ce genre de brique agentique finira pourtant par tourner en coulisse derrière des outils que les studios connaissent déjà, dans un script d'automatisation ou un plugin qui orchestre des tâches répétitives sans que personne y pense au moment de cliquer.

Les chiffres publiés racontent une progression réelle mais partielle. Sur l'épreuve de programmation prolongée CursorBench, Grok 4.7 passe de 40,4 % à 46,3 %, un gain net face à son prédécesseur. Fable 5.1 garde pourtant l'avance sur ce même test, et la conserve aussi sur les tâches de bureau longues et sur l'évaluation santé. Un modèle qui domine partout, ça n'existe toujours pas dans ce classement.

La fenêtre de contexte annoncée atteint 500 000 tokens, de quoi faire tenir un projet logiciel complet ou plusieurs centaines de pages de documents dans une seule session. Cette capacité ne garantit rien sur la précision avec laquelle chaque information sera réellement exploitée : la sélection des fichiers et l'organisation du contexte restent l'affaire de qui construit l'agent, pas du modèle seul.

Le tarif annoncé, deux dollars le million de tokens en entrée et six en sortie, reste dans la fourchette des modèles agentiques déjà en circulation. Sa lecture change selon la longueur des missions, le nombre d'outils appelés et les tentatives ratées, ce qui rend toute comparaison de prix par tâche approximative tant qu'on n'a pas testé sur son propre pipeline.

Grok 4.7 confirme surtout où se joue la compétition actuelle entre modèles : la capacité à durer, pas à briller sur un échange isolé. Pour un studio qui envisage d'automatiser des scripts de production ou de traitement de fichiers, la question n'est plus la puissance brute mais la fiabilité sur des heures d'exécution sans supervision.

Sources

Umiros Média