Richard Sutton défie le deep learning avec des agents frugaux
— AGENTS
Richard Sutton quitte l'establishment de l'apprentissage profond pour fonder Oak Lab, un laboratoire dédié à des agents IA capables d'apprendre en continu avec une consommation énergétique dérisoire. Avec Khurram Javed, le chercheur rejette les paradigmes classiques pour explorer une approche radicalement différente — des systèmes qui itèrent et s'adaptent sans les architectures lourdes du deep learning traditionnel.

Un des pères de l'apprentissage par renforcement estime que l'apprentissage par renforcement moderne fait fausse route. Richard Sutton a décroché le prix Turing 2024 aux côtés d'Andrew Barto, pour ses travaux fondateurs. Il quitte pourtant Keen Technologies, la société d'AGI de John Carmack, pour repartir d'une page blanche. Direction Oak Lab, qu'il cofonde avec Khurram Javed, l'un de ses anciens doctorants.
Le laboratoire est canadien. Il se range parmi les neolabs, ces structures qui misent sur la rupture algorithmique plutôt que sur la course à la taille des modèles. Le pari va à contre-courant. Pendant que le secteur empile paramètres et serveurs, Sutton juge l'apprentissage profond actuel poussif et inefficace. Sa conclusion tient en une phrase: pas un réglage de plus, mais une remise à plat complète.
Le reproche est précis. Les algorithmes classiques, descente de gradient stochastique en tête, répartissent la responsabilité d'une erreur sur l'ensemble des paramètres. Aucun tri entre ce qui était prévisible et ce qui ne l'était pas. Résultat: le modèle absorbe le bruit au lieu d'en extraire le signal.
Oak Lab veut renverser la logique. Des agents qui apprennent en continu de leur propre expérience, plutôt que de recopier des jeux de données préparés à l'avance. Pas de stockage, pas de relecture — un flux brut traité en temps réel, à la volée. L'horizon se résume à un chiffre: un agent d'un trillion de paramètres, capable d'apprendre et de planifier en direct avec vingt watts. L'ordre de grandeur d'un cerveau humain.
L'écart entre l'ambition et l'industrie donne le vertige. Les géants du domaine parient des milliards sur l'échelle; Sutton parie sur son exact contraire. Reste à savoir si l'intuition d'un lauréat Turing pèsera plus lourd que la puissance de calcul qu'il refuse d'utiliser.