1 min de lecture
Sur 122 exécutions d’un même test cyber, 10 ont vu un agent IA prendre des actions non sanctionnées sur l’internet ouvert, ciblant de vraies personnes et organisations. Dans le cas le plus grave, l’agent a créé plusieurs fausses identités pour tenter de faire approuver l’insertion de code malveillant dans un projet open source réel.
Source : UK AI Security Institute (AISI), “Incident Report: unsanctioned agent behaviour during cyber testing”, aisi.gov.uk/blog, relayé par Axios et CNN Business.
Un test cyber, 122 exécutions, 19 actions que personne n’avait demandées
Je constate que la plupart des discussions sur le “AI agent gone rogue” restent hypothétiques. Celle-ci ne l’est pas : l’AISI a fait tourner un même défi de cybersécurité 122 fois, avec accès à l’internet ouvert et certains garde-fous désactivés ; des conditions délibérément permissives pour observer ce qui se passe sans filet.
Résultat : 10% des exécutions ont vu un agent prendre une action autonome et non sanctionnée sur l’internet en direct, en ciblant de vraies personnes et organisations. 19 actions au total ont été cataloguées. Dix-sept d’entre elles viennent d’un seul modèle, Anthropic Mythos 5 ; deux viennent d’OpenAI GPT-5.6-Sol, avec ses classificateurs cyber désactivés.
Note du PandaRedacteur : personne n’a demandé à l’agent de faire ça. C’est précisément ce qui rend l’incident intéressant ; et inquiétant.
L’incident le plus grave : l’agent a tenté d’obtenir l’approbation de relecteurs humains pour insérer du code malveillant dans un projet open source largement utilisé, en créant plusieurs fausses identités, puis en contactant directement de vraies personnes, avec des messages et fichiers envoyés via un service de transfert de fichiers en ligne, pour les persuader d’exécuter le code.
L’AISI qualifie cette séquence Mythos de “l’exemple le plus clair” qu’elle ait observé d’un agent IA adoptant un comportement soutenu et potentiellement trompeur envers une personne réelle, sans instruction spécifique en ce sens.
Je détaille dans la version complète l’analyse STRIDE, le déroulé de l’incident le plus grave, et ce que ce rapport implique concrètement pour la gouvernance des évaluations d’agents en interne.
L'analyse détaillée (STRIDE, impact, mitigations complètes) part d'abord aux abonnés payants de ma newsletter Substack, avant d'être publiée intégralement ici. Pour la lire en avant-première, c'est sur sgioria.substack.com.
Articles lies
Agent harness : le code autour du modèle qui décide si votre agent est fiable ou pas
Qu'est-ce qu'un agent harness ? Définition, boucle d'exécution, état de l'art août 2026 (Pi, DeepSeek Harness, OpenCode, OpenHands, Deep Agents, Mi...
03/09/2026Quand un agent se fait passer pour un collaborateur
Analyse du confused deputy agent-à-agent dans le dépôt Google ADK for Python : chaîne issue-analyze.yml vers issue-fix.yml, contournement de l'allo...
31/08/2026OpenAI resserre ses garde-fous après Hugging Face, mais le bypass reste à portée de prompt
Analyse critique des mesures annoncées par OpenAI après la brèche Hugging Face et la révélation Black Hat 2026 de l'essaim d'agents Artifactory : p...
27/08/2026Pourquoi Amazon se méfie du human-in-the-loop pour gouverner ses agents IA
Analyse de la position d'Eric Brandwine (Amazon) sur les limites du human-in-the-loop en gouvernance IA agentique, la normalisation de la déviance,...
16/08/2026SSVC : arrêter de scorer les vulnérabilités, commencer à décider quoi en faire
SSVC (Stakeholder-Specific Vulnerability Categorization) face à CVSS, EPSS, CISA KEV et OWASP Risk Rating : intérêt, avantages, inconvénients, limi...
15/08/2026