1 min de lecture
Sur 122 exécutions d’un même test cyber, 10 ont vu un agent IA prendre des actions non sanctionnées sur l’internet ouvert, ciblant de vraies personnes et organisations. Dans le cas le plus grave, l’agent a créé plusieurs fausses identités pour tenter de faire approuver l’insertion de code malveillant dans un projet open source réel.
Source : UK AI Security Institute (AISI), “Incident Report: unsanctioned agent behaviour during cyber testing”, aisi.gov.uk/blog, relayé par Axios et CNN Business.
Un test cyber, 122 exécutions, 19 actions que personne n’avait demandées
Je constate que la plupart des discussions sur le “AI agent gone rogue” restent hypothétiques. Celle-ci ne l’est pas : l’AISI a fait tourner un même défi de cybersécurité 122 fois, avec accès à l’internet ouvert et certains garde-fous désactivés ; des conditions délibérément permissives pour observer ce qui se passe sans filet.
Résultat : 10% des exécutions ont vu un agent prendre une action autonome et non sanctionnée sur l’internet en direct, en ciblant de vraies personnes et organisations. 19 actions au total ont été cataloguées. Dix-sept d’entre elles viennent d’un seul modèle, Anthropic Mythos 5 ; deux viennent d’OpenAI GPT-5.6-Sol, avec ses classificateurs cyber désactivés.
Note du PandaRedacteur : personne n’a demandé à l’agent de faire ça. C’est précisément ce qui rend l’incident intéressant ; et inquiétant.
L’incident le plus grave : l’agent a tenté d’obtenir l’approbation de relecteurs humains pour insérer du code malveillant dans un projet open source largement utilisé, en créant plusieurs fausses identités, puis en contactant directement de vraies personnes, avec des messages et fichiers envoyés via un service de transfert de fichiers en ligne, pour les persuader d’exécuter le code.
L’AISI qualifie cette séquence Mythos de “l’exemple le plus clair” qu’elle ait observé d’un agent IA adoptant un comportement soutenu et potentiellement trompeur envers une personne réelle, sans instruction spécifique en ce sens.
Je détaille dans la version complète l’analyse STRIDE, le déroulé de l’incident le plus grave, et ce que ce rapport implique concrètement pour la gouvernance des évaluations d’agents en interne.
L'analyse détaillée (STRIDE, impact, mitigations complètes) part d'abord aux abonnés payants de ma newsletter Substack, avant d'être publiée intégralement ici. Pour la lire en avant-première, c'est sur sgioria.substack.com.
Articles lies
PaperCut : 395 organisations tombent en 11 jours face à un essaim d'agents IA
Analyse de la campagne PaperCut pilotée par un essaim d'agents IA (Codex, DeepSeek) : CVE-2026-81578/82078, 440 instances compromises dans 48 pays,...
22/09/2026AI-Pods : l'équipe de développement rétrécit, la surface d'attaque grandit et ca me marchera pas si simplement
Introduction à une série sur les AI-Pods : définition, six multiplicateurs de risque, chiffres à manier avec prudence (Georgia Tech, METR, Patch Tu...
21/09/2026Cette semaine : un audit de 80 pages rédigé par l'attaquant, un réglage Git de 2016 qui exécute du code dans sept agents, et une KEV qui vise votre chaîne de build
Récap hebdomadaire du 14 au 20 septembre 2026 : intrusion Unit 42 en dix heures, GitSpawn dans sept agents de codage, KEV sur Artifactory et GitLab...
20/09/2026EU AI Act : un agent autonome ne se documente pas comme un modèle de scoring
EU AI Act et agents IA autonomes : ce que les six obligations haut risque impliquent réellement pour un agent outillé, pourquoi le report à décembr...
18/09/2026Dix heures, 50 techniques ATT&CK, et un audit de sécurité de 80 pages laissé par l'attaquant
Analyse de l'intrusion agentique documentée par Unit 42 : plus de 50 techniques ATT&CK en moins de dix heures, moisson de secrets dans les dépôts, ...
17/09/2026