Mercury 2.5 mise sur la vitesse pour les agents qui multiplient les appels
— AGENTS
Inception publie un modèle texte qui génère par blocs plutôt que mot après mot, avec une fenêtre de contexte élargie à 260 000 tokens. La vitesse affichée en démonstration s'effondre nettement une fois mesurée chez un fournisseur tiers, ce qui rappelle qu'un chiffre de lancement décrit un laboratoire, pas un service partagé.

Un modèle de langage qui écrit par blocs entiers plutôt que mot après mot change surtout la donne pour les systèmes qui enchaînent des dizaines de petites requêtes avant de produire une réponse utile. Mercury 2.5, le nouveau modèle d'Inception, avance ce débit comme argument principal, avec une fenêtre de contexte qui passe à 260 000 tokens et une prise en charge des appels d'outils multiples dans une même réponse.
Aucun graphiste, aucun motion designer ne va lancer ce modèle un vendredi pour finir un rendu. Mercury 2.5 ne lit ni image, ni son, ni vidéo : il traite du texte, pour des agents de recherche, des assistants de code ou des lignes téléphoniques automatisées. Augment Code l'utilise déjà pour compacter le contexte de ses agents, et affirme avoir fait chuter le temps de cette opération de 150 à 27 secondes. OpenCall s'en sert pour ses agents vocaux, avec une latence médiane annoncée sous les 0,2 seconde. Deux cas clients, pas deux audits indépendants.
Le chiffre de lancement mérite d'être lu avec méfiance. Inception affiche un débit spectaculaire en démonstration, mais les premières mesures relevées chez un fournisseur tiers tombent à environ trois fois moins, dans des conditions de service partagé plutôt que de laboratoire. La même prudence vaut pour la hausse d'intelligence revendiquée : certains tests progressent nettement, un indicateur d'exactitude recule légèrement, et la moyenne annoncée gomme ces écarts.
Pour les métiers créatifs, l'intérêt reste indirect mais réel. Ce type de modèle rapide et facturé au volume est ce qui tournera demain en coulisse derrière les agents intégrés aux suites de production, ceux qui iront chercher un asset, reformuler une recherche ou orchestrer un outil pendant qu'un designer travaille ailleurs. Son prix de lancement, réduit de 80 % pour l'instant, ne dit rien de ce qu'il coûtera une fois la promotion terminée.
Ce genre d'infrastructure ne se juge pas sur une démonstration filmée en une seconde. Il se juge sur le temps réellement gagné après cinquante appels enchaînés, avec les mêmes outils et les mêmes exigences de fiabilité. Reste à voir combien de temps la remise de lancement tiendra avant que la facture rattrape la promesse.