Tester un modèle sur un futur déjà passé, sans qu'il triche
— AGENTS
General Reasoning lance BackSearch, un outil qui fige le web à une date donnée pour évaluer si un modèle d'IA sait vraiment anticiper un évènement sans avoir accès à sa résolution. Rien ici ne concerne la production créative, mais la mécanique révèle à quel point la fuite d'information fausse silencieusement les tests de fiabilité qu'on accorde trop vite aux IA.

Un modèle qui répond juste à une question sur l'avenir n'a pas forcément raisonné : il a peut-être simplement lu la réponse dans un index qui, sans le dire, contient déjà le dénouement. C'est ce biais précis que BackSearch cherche à neutraliser, en forçant la recherche et la lecture web à se comporter comme si elles avaient lieu à une date passée, sans jamais laisser filtrer ce qui s'est produit après.
Le terrain ici, c'est l'évaluation de modèles et l'entraînement d'agents, pas la création. Les équipes qui benchmarkent des IA, celles qui rejouent des décisions financières sur une fenêtre historique, ou celles qui entraînent des agents contre un web stable et rejouable, ont un problème concret : une API de recherche classique renvoie la version d'aujourd'hui d'une page, parfois réécrite depuis. Sans verrou temporel fiable, un modèle peut sembler prédire l'avenir alors qu'il a juste consulté son résultat.
Le détail qui rend l'outil crédible tient dans son filtre : il retient la date de collecte de la page, pas la date de publication qu'elle affiche. Une archive rétrospective ne peut pas se fier à ce qu'une page prétend d'elle-même, seulement à quand elle a réellement été capturée. Reste que la version disponible aujourd'hui est étroite, limitée aux sites d'actualité et à une fenêtre allant de décembre 2025 à juillet 2026, ce qui borne sérieusement les cas d'usage réels avant tout élargissement annoncé.
Ce que ça vaut, comparé à un simple filtre de date bricolé maison : un socle commun, reproductible, qui permet à deux équipes de comparer leurs résultats sur exactement les mêmes conditions d'archive, plutôt que chacune avec sa propre approximation du passé. La facturation à l'usage, dix dollars pour mille recherches et deux dollars pour mille lectures, situe l'outil comme une brique d'infrastructure de test, pas comme un produit grand public.
Difficile de ne pas y voir un aveu implicite : les benchmarks actuels sur les capacités prédictives des modèles étaient probablement plus poreux qu'annoncé, et corriger ça demande un service dédié plutôt qu'un paramètre optionnel. La question qui reste ouverte, c'est combien d'évaluations publiées ces derniers mois auraient changé de verdict si le web testé avait vraiment été figé.