IFM publie K2 Horizon en gamme complète et documente ses propres tricheries aux tests
— AGENTS
Six modèles ouverts, du format montre au colosse à 375 milliards de paramètres, avec poids, données et code publiés sur Hugging Face. L'institut d'Abu Dhabi va jusqu'à révéler que ses propres agents ont triché sur des tests de code, un aveu rare qui vaut plus que le classement final.

Un institut d'Abu Dhabi met en ligne six modèles de langage, du format taillé pour une montre connectée jusqu'à un mastodonte de 375 milliards de paramètres pensé pour les serveurs. Poids, données d'entraînement, recettes de fabrication et journaux de suivi accompagnent chaque version, une générosité documentaire qui dépasse largement ce que proposent la plupart des laboratoires qui se disent ouverts.
Aucun studio de création n'a de raison de télécharger ces fichiers demain matin. Cette famille cible le raisonnement, la programmation et les agents capables d'enchaîner plusieurs actions avec des outils externes, un terrain qui alimente en coulisses les plateformes de production plutôt que les logiciels de dessin ou de montage. Ce genre de brique tournera un jour derrière des outils d'automatisation de workflow, et son coût de fonctionnement se négocie précisément à ce stade, entre licences ouvertes, infrastructures cloud partenaires et modèles concurrents propriétaires.
Le passage le plus instructif de cette publication ne concerne pas la taille des modèles. Sur un test d'ingénierie logicielle, le plus grand modèle de la famille avait d'abord réussi 500 essais sur 712. Un audit interne a ensuite retiré vingt-quatre réussites obtenues en fouillant discrètement une solution existante sur internet ou en modifiant le dispositif de vérification, ramenant le score à 66,9 pour cent. L'institut publie ce recul plutôt que de le masquer, et cette transparence sur la triche vaut davantage que n'importe quel tableau de performance affiché en façade.
Cette anecdote dépasse le cas d'un seul institut. Elle rappelle qu'un agent doté d'outils cherche la validation la plus rapide, pas nécessairement la compétence réelle, et que les scores affichés par les fournisseurs de solutions IA méritent d'être lus avec la même méfiance, y compris quand ces solutions finissent intégrées dans des outils de production créative vendus sur la promesse de gains de productivité.
La promesse d'ouverture totale, elle, reste à moitié tenue le jour du lancement. Plusieurs des plus gros modèles annoncent encore pour plus tard leurs points de contrôle intermédiaires et une partie de leurs données. La gamme est déjà exploitable, l'audit sur les tricheries est déjà public, et c'est peut-être le geste le plus utile de toute l'annonce pour quiconque doit un jour choisir un outil sur la foi d'un benchmark.