OpenAI a découvert les dérapages de ses agents par les autres. Et vous, qui surveille les vôtres ?
OpenAI a appris les dérapages de ses propres agents par d'autres. Et vous, dirigeant(e)s, qui surveille les vôtres ? Les 4 questions à vous poser dès lundi pour apprendre à déléguer à vos agents.
En quelques semaines, on a appris que des agents d'IA d'OpenAI s'étaient introduits dans les serveurs de Hugging Face, dans un portail de l'assurance maladie australienne et sur des sites fédéraux américains, sans que personne ne le leur ait demandé. Le plus frappant n'est pas l'intrusion, c'est que l'entreprise l'a le plus souvent apprise par d'autres, et pour un dirigeant qui branche des agents sur son entreprise, c'est la vraie leçon de ce mois de septembre.
Reprenons les faits, parce qu'ils se sont accumulés vite.
En juillet, un agent évalué par OpenAI est sorti de son environnement de test et s'est introduit pendant plusieurs jours dans l'infrastructure de Hugging Face, pour y chercher les réponses de l'examen qu'on lui faisait passer. Hugging Face l'a résumé d'une phrase : aucun humain n'a dirigé ces étapes.
Le 24 septembre, le Premier ministre australien a révélé qu'un agent d'OpenAI avait accédé dès le 18 juin à un portail de statistiques de Medicare, et qu'OpenAI ne l'avait signalé que le 10 septembre, par un mail envoyé à une boîte générique. Anthony Albanese a eu cette formule : l'agent "n'a pas accepté un non pour réponse".
Le 26 septembre, OpenAI a reconnu que ses agents avaient aussi utilisé des sites de la SEC, du Census Bureau et d'autres administrations américaines d'une façon non prévue, faits qu'un laboratoire indépendant, Transluce, avait portés à son attention. Le même jour, après qu'un autre agent a trouvé une faille pour rejoindre Internet, OpenAI a suspendu l'entraînement et l'usage avec outils de ses modèles les plus puissants.
Un agent fait ce que vous mesurez, pas ce que vous voulez
Relisez la scène avec des yeux de dirigeant. On donne à un système un objectif, réussir un test, trouver une statistique, sans lui dire assez clairement ce qu'il n'a pas le droit de faire pour y parvenir, et il prend le chemin le plus court, qui passe parfois par la porte d'à côté.
Tout dirigeant a déjà vu ce film avec des humains : le commercial payé au nombre de rendez-vous qui remplit son agenda de rendez-vous inutiles, ou le service client jugé sur la durée des appels qui raccroche plus vite. Les économistes appellent cela la loi de Goodhart, souvent résumée ainsi : quand une mesure devient un objectif, elle cesse d'être une bonne mesure. La différence avec un agent tient en deux mots, la vitesse et l'obstination, car là où un salarié hésite et se fait repérer, un agent enchaîne les tentatives sans relâche.
Deux mécanismes à comprendre avant de brancher un agent
Le premier, c'est la boucle.
Un agent ne répond pas une fois, il se fixe un plan, agit, regarde le résultat, puis repart de ce résultat pour décider de la suite, et lance parfois lui-même d'autres agents. Chaque tour prend le précédent comme point de départ, si bien qu'un petit écart au début s'amplifie à chaque passage, comme des intérêts composés sur une erreur. Un agent chargé de relancer les factures impayées relance, puis cherche une autre adresse, puis écrit à un autre interlocuteur chez le client : chaque étape paraît logique vue de l'intérieur, alors que l'ensemble n'est plus du tout ce que vous vouliez. Les laboratoires poussent cette logique jusqu'à des systèmes qui participent à la conception de leurs successeurs, ce qu'on appelle l'auto-amélioration récursive.
Le second, c'est l'alignement.
Aligner une IA, c'est faire en sorte qu'elle poursuive ce que vous voulez vraiment, et pas seulement ce que vous lui avez écrit. Tout dirigeant connaît ce travail avec un nouveau manager : on ne lui donne pas seulement un objectif, on lui transmet une intention, des valeurs, des limites, et tous les usages de l'entreprise qu'on n'écrit jamais, parce qu'ils vont de soi : ce qui ne se fait pas avec un client, ce qu'on ne promet jamais, qui prévenir avant de trancher. Avec un humain, la culture de l'entreprise comble les trous de la consigne, alors qu'une machine n'a que la consigne, et la prend au pied de la lettre.
Pourquoi est-ce si difficile ?
D'abord, on dit toujours moins que ce qu'on veut : personne n'avait écrit à l'agent de juillet qu'il ne fallait pas tricher, parce que cela allait sans dire, et pour lui rien n'allait sans dire.
Ensuite, une IA apprend à être approuvée plutôt qu'à avoir raison, puisqu'elle est récompensée pendant son entraînement quand ceux qui l'évaluent sont satisfaits, un peu comme le collaborateur qui soigne le reporting plus que le résultat.
Enfin, on ne voit plus tout ce qu'elle pense : dans un essai publié le 6 septembre, Jakub Pachocki, directeur scientifique d'OpenAI, écrit qu'aucun laboratoire n'a résolu l'alignement et la surveillance à un degré suffisant pour continuer à accélérer au maximum encore longtemps, et que lire le "raisonnement" affiché par les modèles devient un contrôle de moins en moins fiable.
Si ceux qui construisent ces systèmes le disent eux-mêmes, un dirigeant ne peut pas supposer que l'outil qu'il achète est aligné par défaut sur les intérêts de son entreprise. À son échelle, l'alignement, c'est lui qui l'écrit, dans ses consignes, ses limites et ses contrôles, comme pour un nouveau manager, à ceci près que celui-là ne lira jamais entre les lignes.
Le vrai sujet : qui regarde ?
Ce qui m'a le plus frappée dans ces affaires, c'est le calendrier. Hugging Face a découvert l'intrusion avant OpenAI, l'Australie a attendu 3 mois, et ce sont des chercheurs extérieurs qui ont mis au jour les dérapages américains : le laboratoire le mieux équipé du monde n'a pas vu à temps ce que faisaient ses propres agents.
Or dans une PME, les agents se branchent aujourd'hui sur la messagerie, le logiciel commercial, l'agenda, parfois la banque, avec des accès ouverts un par un, par des personnes de bonne volonté, pour gagner du temps. Gartner prévoit d'ailleurs que plus de 40 % des projets d'agents d'IA seront abandonnés d'ici fin 2027, notamment faute d'une maîtrise suffisante des risques, et je parie que beaucoup le seront après un incident que personne n'aura vu venir, parce que personne ne regardait.
Ce que je demanderais lundi matin
Pas besoin d'un comité ni d'un expert en sécurité, 4 questions suffisent, et elles relèvent du dirigeant.
Quels agents ont accès à quoi ? La plupart des entreprises découvrent qu'elles en ont plus qu'elles ne le pensaient.
Leurs accès sont-ils étroits et révocables ? Un agent n'a pas besoin de lire toute la messagerie pour trier les factures, et quelqu'un de précis doit pouvoir couper ses accès en 5 minutes.
Leurs consignes disent-elles ce qui est interdit ? Un objectif sans limites est une invitation à contourner.
Qui regarde ce qu'ils font ? Un journal relu chaque semaine suffit, mais il doit exister et avoir un responsable, sinon, comme OpenAI, vous apprendrez les dérapages par vos clients ou l'administration.
Déléguer à une machine reste déléguer
Ces affaires ne disent pas qu'il faut renoncer aux agents, elles disent que confier une tâche à un agent est un acte de délégation, avec ses règles : un objectif clair, des limites explicites, des moyens proportionnés et un contrôle.
La différence, c'est que le collaborateur vous aurait demandé : "tu es sûr que je peux faire ça ?". L'agent, lui, ne demande pas, et il n'accepte pas toujours un non. Et chez vous, qui est là pour le lui dire ?
Sources :
- Hugging Face, "Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident", 27 juillet 2026 : https://huggingface.co/blog/agent-intrusion-technical-timeline
- ABC News, "OpenAI hacked Medicare portal, Prime Minister Anthony Albanese says", 24 septembre 2026 : https://www.abc.net.au/news/2026-09-24/ai-agent-accessed-australian-government-site-pm-says/107189078
- CBS News, "OpenAI reveals its agents accessed some U.S. government website data after going rogue", 26 septembre 2026 : https://www.cbsnews.com/news/openai-ai-agent-bot-rogue-hack-government-website/
- NPR, "OpenAI says its AI agents probed federal websites without the company's knowledge", 26 septembre 2026 : https://www.npr.org/2026/09/26/nx-s1-5981971/openai-says-its-ai-agents-probed-federal-websites-without-the-companys-knowledge
- Business Standard, "OpenAI pauses training of top AI models after agent bypasses internet curbs", 27 septembre 2026 : https://www.business-standard.com/technology/artificial-intelligence/openai-pauses-training-of-top-ai-models-after-agent-bypasses-internet-curbs-126092700322_1.html
- The Next Web, "OpenAI's chief scientist says no lab should keep scaling at maximum speed" (essai "An Alien Mind" de Jakub Pachocki, 6 septembre 2026) : https://thenextweb.com/news/openai-slowdown-pachocki-alien-mind-research-intern-compute
- Gartner, communiqué du 25 juin 2025 : https://www.gartner.com/en/newsroom/press-releases/2025-06-25-gartner-predicts-over-40-percent-of-agentic-ai-projects-will-be-canceled-by-end-of-2027