Agents de code en labo : la vitesse gagnée, la confiance perdue
— AGENTS
Un rapport d'OpenAI documente huit projets scientifiques réécrits avec des agents de code, principalement en sciences du vivant. Le goulot d'étranglement ne se situe plus dans l'écriture du code mais dans sa validation, un travail que seul un jugement humain expert peut encore rendre.

Le constat de départ mérite d'être pris au sérieux : une grande partie des outils d'analyse utilisés dans les laboratoires ont été écrits à la va-vite par de petites équipes de chercheurs, sans culture d'ingénierie logicielle, sans tests, sans maintenance prévue. Ce sont ces logiciels bricolés que huit équipes ont tenté de moderniser avec des agents de code, cinq avec un seul outil, trois en combinant deux systèmes différents. Le terrain ici, c'est le calcul scientifique en sciences du vivant, pas la production visuelle.
Ce que montrent ces retours d'expérience, c'est un déplacement plus qu'une prouesse. Écrire le code va vite, parfois en une passe. Ce qui bloque, c'est de savoir si ce que l'agent a produit est scientifiquement juste, et ce jugement-là reste entièrement humain. Les agents affichent de l'assurance même quand leur code contient des erreurs manifestes, ce qui oblige les équipes à construire des vérifications externes solides : comparer les résultats à une référence connue, tester sur des données simulées dont la réponse est déjà connue, chercher une parité stricte avec un outil existant.
La réserve la plus sérieuse ne porte pas sur la vitesse d'écriture mais sur l'après. Réécrire un logiciel scientifique ne consiste pas seulement à traduire du code : ça déplace aussi des conventions non documentées, des exigences de compatibilité, une confiance construite sur des années d'usage que la traduction automatique ne recrée pas. Deux projets ont vu leurs modifications remonter au dépôt d'origine, un troisième a changé de mainteneur faute de repreneur actif, signe que la question de la propriété du code reste entière une fois l'agent parti.
L'apport réel tient dans une phrase du rapport lui-même : quand réécrire coûte moins cher, rien n'empêche de multiplier les réécritures voisines d'un même outil, ce qui fragmente les utilisateurs au lieu de consolider un outil fiable. La vitesse gagnée sur l'écriture ne compense donc pas le risque diffus qu'elle crée en aval, celui d'une prolifération de variantes mal maintenues. Le gain se mesure moins en heures économisées qu'en dette de gouvernance créée.
Ce que révèle ce rapport dépasse le calcul scientifique : sans propriétaire identifié ni plan de maintenance clair, la réécriture rapide d'aujourd'hui devient, selon les auteurs eux-mêmes, le code abandonné de demain.