Faraday, l'agent qui apprend à juger une expérience plutôt qu'à l'exécuter
— AGENTS
Inherent entraîne un modèle de 27 milliards de paramètres à reconstruire des expériences scientifiques à partir de publications incomplètes, en pilotant d'autres agents de code pour le travail technique. L'enjeu n'est pas la puissance de calcul mais la capacité à choisir, arbitrer et abandonner une piste, ce que l'industrie commence à savoir entraîner ailleurs que dans le texte ou l'image.

Un agent de 27 milliards de paramètres qui pilote d'autres agents plus lourds pour reconstruire une expérience scientifique à partir d'un papier incomplet, voilà ce qu'Inherent vient d'entraîner avec Faraday. Rien à voir directement avec un brief créatif, une planche tendance ou un rendu packaging, mais le principe mérite qu'on s'y arrête.
Ce qui se joue ici concerne d'abord les laboratoires de recherche en machine learning et les équipes qui évaluent la fiabilité des IA scientifiques, pas les studios de création. Faraday doit retrouver une figure sans l'avoir vue, avec un budget de calcul limité, en choisissant les bonnes hypothèses et en renonçant à certaines pistes. Inherent appelle ça du research taste, une manière de dire que l'agent apprend à juger, pas seulement à exécuter.
Ce déplacement compte pour tout le monde qui dépend d'outils IA en aval, y compris les métiers créatifs. Un agent capable d'arbitrer entre plusieurs directions plutôt que de produire une seule sortie mécanique, c'est exactement le type de brique qui finira, un jour, derrière un outil de génération d'image ou de montage capable de proposer une piste plutôt qu'un résultat unique. Le jugement qu'on entraîne aujourd'hui sur des figures scientifiques est le même mécanisme qu'il faudra un jour pour évaluer un cadrage ou une palette.
La limite tient à l'environnement lui-même. Faraday dépasse Claude Opus 4.8 et GPT-5.5 sur les tâches de réplication et même sur des variantes où des résultats inédits sont glissés dans les papiers, mais tout cela se joue dans un cadre construit par l'équipe qui l'a entraîné. Rien ne dit qu'une capacité de jugement mesurée sur 310 tâches calibrées se transporte telle quelle hors de ce terrain balisé.
L'apport réel n'est pas dans le score face aux modèles rivaux, il est dans la preuve qu'on peut entraîner un agent à hiérarchiser des décisions plutôt qu'à répondre du premier coup. Les studios qui commencent à intégrer des agents dans leur chaîne de production auraient tort d'ignorer ce type de travail : c'est ce genre de recherche qui décide, à moyen terme, si les futurs outils créatifs sauront proposer un choix plutôt qu'imposer une réponse unique.