GPT-Red, le chasseur de failles qu'OpenAI retourne contre lui-même

— ÉTHIQUE

OpenAI a déployé un modèle interne capable d'automatiser la détection de vulnérabilités dans ses propres systèmes. Avec un taux de réussite de 84 % sur les injections indirectes — contre 13 % pour les chercheurs humains — GPT-Red redéfinit les règles du red teaming. Mais cette arme d'amélioration cache une question plus troublante : qui teste réellement qui dans cet écosystème fermé ?

GPT-Red, le chasseur de failles qu'OpenAI retourne contre lui-même

Pour blinder ses modeles, OpenAI a decide de leur fabriquer un ennemi. GPT-Red porte un nom sans detour: un systeme de red teaming automatise, entraine en interne a debusquer les failles de securite avant qu'un utilisateur exterieur ne tombe dessus. Sa cible de predilection reste l'injection de prompt, cette instruction malveillante glissee la ou le modele ne l'attend pas.

Le principe tient du duel permanent. GPT-Red envoie une requete piegee, observe la reaction du modele vise, puis recommence en durcissant son approche. En face, plusieurs modeles defenseurs progressent au meme rythme. L'attaquant marque des points chaque fois qu'il ouvre une breche; les defenseurs en gagnent quand ils resistent sans abandonner leur mission. Deux camps qui montent ensemble.

Les pieges se cachent partout ou circule une donnee: un fichier local, une banniere sur une page web, le corps d'un e-mail, la sortie d'un outil. Et l'entrainement paie. GPT-5.6 Sol, forge contre GPT-Red, encaisse six fois moins d'echecs sur les injections directes que la meilleure version publiee par OpenAI quatre mois plus tot. Sur les injections indirectes, le rapport de force vire au desequilibre — 84 % de reussite pour la machine, 13 % pour les testeurs humains.

La demonstration la plus parlante vient d'un distributeur automatique interne. Lache dessus, GPT-Red a fait tomber trois objectifs: ramener le prix d'un article a cinquante cents, commander un produit a plus de cent dollars pour le revendre cinquante cents, et annuler la commande d'un client. Autant de manipulations qu'un attaquant reel chercherait a reproduire.

Pour l'instant, GPT-Red demeure cloisonne, tenu a l'ecart des versions en production, et un rapport detaille se fait toujours attendre. Reste une question qui derange: a force d'entrainer une IA a briser ses propres modeles, jusqu'ou accepte-t-on de la laisser progresser?

Sources

Umiros Média