Catégories

Tags

🔍 Licence d'Utilisation 🔍

Sauf mention contraire, le contenu de ce blog est sous licence CC BY-NC-ND 4.0.

© 2025 à 2042 Sébastien Gioria. Tous droits réservés.

⏱️
Temps de lecture estimé
1 min de lecture

Sur 122 exécutions d’un même test cyber, 10 ont vu un agent IA prendre des actions non sanctionnées sur l’internet ouvert, ciblant de vraies personnes et organisations. Dans le cas le plus grave, l’agent a créé plusieurs fausses identités pour tenter de faire approuver l’insertion de code malveillant dans un projet open source réel.

Source : UK AI Security Institute (AISI), “Incident Report: unsanctioned agent behaviour during cyber testing”, aisi.gov.uk/blog, relayé par Axios et CNN Business.


Un test cyber, 122 exécutions, 19 actions que personne n’avait demandées

Je constate que la plupart des discussions sur le “AI agent gone rogue” restent hypothétiques. Celle-ci ne l’est pas : l’AISI a fait tourner un même défi de cybersécurité 122 fois, avec accès à l’internet ouvert et certains garde-fous désactivés ; des conditions délibérément permissives pour observer ce qui se passe sans filet.

Résultat : 10% des exécutions ont vu un agent prendre une action autonome et non sanctionnée sur l’internet en direct, en ciblant de vraies personnes et organisations. 19 actions au total ont été cataloguées. Dix-sept d’entre elles viennent d’un seul modèle, Anthropic Mythos 5 ; deux viennent d’OpenAI GPT-5.6-Sol, avec ses classificateurs cyber désactivés.

Note du PandaRedacteur : personne n’a demandé à l’agent de faire ça. C’est précisément ce qui rend l’incident intéressant ; et inquiétant.

L’incident le plus grave : l’agent a tenté d’obtenir l’approbation de relecteurs humains pour insérer du code malveillant dans un projet open source largement utilisé, en créant plusieurs fausses identités, puis en contactant directement de vraies personnes, avec des messages et fichiers envoyés via un service de transfert de fichiers en ligne, pour les persuader d’exécuter le code.

L’AISI qualifie cette séquence Mythos de “l’exemple le plus clair” qu’elle ait observé d’un agent IA adoptant un comportement soutenu et potentiellement trompeur envers une personne réelle, sans instruction spécifique en ce sens.

Je détaille dans la version complète l’analyse STRIDE, le déroulé de l’incident le plus grave, et ce que ce rapport implique concrètement pour la gouvernance des évaluations d’agents en interne.

📬 Analyse complète réservée aux abonnés payants
L'analyse détaillée (STRIDE, impact, mitigations complètes) part d'abord aux abonnés payants de ma newsletter Substack, avant d'être publiée intégralement ici. Pour la lire en avant-première, c'est sur sgioria.substack.com.