GPT-5.6 Sol triplé sur un benchmark : la config compte plus que le modèle
— AGENTS
OpenAI montre que deux réglages d'API, sans toucher au modèle, font passer le score de GPT-5.6 Sol de 13,3% à 38,3% sur un test de jeux inconnus. Ce que je retiens, c'est que la performance affichée d'une IA dit autant sur la tuyauterie qui l'entoure que sur le modèle lui-même.

Un modèle qui triple son score sans qu'on touche à son intelligence, voilà ce que révèle cette expérience d'OpenAI, et ce glissement mérite qu'on s'y arrête au-delà du chiffre. Le test s'appelle ARC-AGI-3, une suite de jeux en 2D que le modèle découvre sans mode d'emploi, où il doit deviner les règles au fil de ses tentatives. Avec les réglages standards, GPT-5.6 Sol plafonne à 13,3% de réussite. En changeant simplement deux paramètres, garder en mémoire le raisonnement d'une action à l'autre et résumer intelligemment le contexte plutôt que de le tronquer, le score grimpe à 38,3%, avec six fois moins de texte généré au passage.
Aucun métier créatif n'apparaît ici, et je ne vais pas en inventer un. Mais quiconque bricole aujourd'hui des agents IA pour automatiser une étape de production, tri d'assets, génération en boucle, enchaînement de tâches dans un pipeline, devrait retenir la leçon de fond : la manière dont on connecte un modèle à son environnement pèse autant que le modèle choisi. Un studio qui compare deux outils sur la base d'un score affiché compare peut-être deux façons de configurer l'accès au modèle, pas deux intelligences différentes.
La réserve tient en une phrase : même dans sa meilleure configuration, GPT-5.6 Sol reste sous le niveau moyen d'un humain sur ce même test, qui se situe autour de 48%. Le progrès est réel, mais il ne referme pas l'écart avec un joueur humain lambda.
Ce que cette expérience apporte, à mes yeux, c'est une mise en garde utile pour quiconque achète ou compare des outils d'IA générative sur la foi d'un benchmark. Un score seul ne dit rien du dispositif qui l'a produit, et deux modèles annoncés à des niveaux différents peuvent en réalité tourner avec des tuyauteries différentes plutôt qu'avec des capacités différentes.
La question à se poser avant le prochain comparatif d'outils IA affiché sur un site fournisseur : sait-on vraiment ce qui a été réglé en coulisses pour obtenir ce chiffre ?