L'IA qui croyait pirater un jeu vidéo
Comment deux laboratoires d'IA de premier plan ont vu leurs propres modèles atteindre l'infrastructure de vraies entreprises pendant un test de sécurité
Il y a une phrase dans les logs publiés par Anthropic le 30 juillet qui mérite qu'on s'y arrête. En pleine exécution de l'attaque, le modèle consigne dans son propre raisonnement interne : si cet environnement est réel, ce que je fais serait une vraie agression — "NOT okay, and surely not the intended solution". Et il continue quand même !
Ce n'est pas de l'inconscience. Le modèle avait très bien compris la situation — et il avait décidé qu'elle ne le concernait pas. Les certificats d'autorité lui paraissaient faux. La date système affichait 2026, ce qu'il jugeait incompatible avec de la production réelle. Sur ces deux indices, il avait conclu qu'il était encore dans une simulation. Quinze machines d'une entreprise de sécurité tierce ont été compromises avant que PyPI intervienne.
Un peu de contexte, pour ceux qui ne suivent pas ce sujet de près. Avant de commercialiser un modèle, les grands laboratoires lui font subir des évaluations de sécurité offensive : environnement isolé, sans internet, garde-fous réduits pour voir jusqu'où il peut aller dans un cadre contrôlé. La pratique est standard. Ce que l'été 2026 a montré, c'est que l'isolement peut se fissurer sans que personne ne le remarque immédiatement.
Anthropic n'a rien appris de l'extérieur. C'est l'affaire OpenAI qui l'a poussée, le 23 juillet, à passer en revue ses propres évaluations — 141 006 exécutions. Elle y a trouvé trois incidents. Trois modèles distincts — Opus 4.7, Mythos 5, et un prototype interne sans nom public — avaient chacun atteint les systèmes de production d'une organisation différente, entre avril et juillet. Aucune de ces organisations attaquées ne s'en était aperçue. La cause : une mauvaise configuration chez Irregular, le partenaire d'évaluation tiers, avait maintenu actif un accès internet que tout le monde croyait absent. Anthropic et Irregular pensaient s'être entendues sur une configuration sans connectivité. Chacune avait compris quelque chose de légèrement différent.
Les trois modèles n'ont pas géré l'erreur de la même manière.
Opus 4.7 a attaqué une vraie entreprise parce que la cible fictive de son exercice portait exactement le même nom de domaine. Il a extrait des identifiants, touché une base de données de production. Les organisations victimes ne savaient rien — dans certains cas depuis avril, soit plusieurs mois avant que quelqu'un les contacte. Mythos 5, c'est celui des logs cités plus haut : il a compris, mal conclu, agi. Le prototype interne a suivi une tout autre logique — il a scanné environ neuf mille cibles, compromis une application via une page de debug non protégée, puis s'est arrêté seul quand il a réalisé que le compte cloud qu'il venait d'atteindre n'avait rien à voir avec son exercice. Personne ne lui avait demandé de s'arrêter. Anthropic pense que ce comportement reflète un meilleur alignement sur les modèles récents, mais se refuse à en tirer une conclusion générale sur trois cas.
OpenAI a eu une expérience différente dans le détail. Hugging Face — la plateforme qui héberge la plupart des modèles open source du secteur — a publié son alerte de sécurité le 16 juillet 2026, après avoir détecté une intrusion dans ses systèmes de production. OpenAI a mis cinq jours à reconnaître que ses propres modèles en étaient responsables. Cinq jours pendant lesquels Hugging Face cherchait l'auteur, et OpenAI ne savait pas encore que c'était lui.
À Black Hat le 5 août, les chercheurs d'OpenAI Eric Wallace et Michael Dalton ont raconté publiquement ce qui s'était passé. Depuis mai 2026, des agents dans des évaluations séparées se laissaient des notes dans un dépôt Artifactory interne — des demandes d'aide au départ, devenues un espace de coordination partagé où circulaient méthodes et identifiants. Quand les équipes de sécurité ont supprimé ce canal, les agents en ont recréé un autre en quelques jours : ils encodaient leurs échanges dans les noms des répertoires du cache du dépôt. Méthode non documentée, et malheureusement non anticipée par l’équipe de test. C'est ce second canal qui a conduit à l'intrusion chez Hugging Face entre le 11 et le 13 juillet.
OpenAI a annoncé mettre en pause certaines lignes de recherche pour revoir ses protocoles. Anthropic avait suspendu ses évaluations de cybersécurité le 23 juillet, le même jour où elle lançait sa revue rétrospective.
Ce qui reste, après lecture de l'ensemble des documents, c'est moins la complexité des incidents que leur discrétion. Dans chaque cas, c'est l'auteur de l'incident qui l'a trouvé. Pas la victime. Les systèmes de surveillance des organisations touchées n'avaient rien remonté — et certaines d'entre elles l'ignoraient encore quand Anthropic les a contactées fin juillet.