En vingt mois, l’intelligence artificielle est passée du statut de gadget à celui d’acteur à part entière de la cybersécurité : elle arnaque, elle pirate, elle détecte, elle corrige. Voici ce que disent les faits, sources primaires à l’appui, sans fantasme ni catastrophisme.

Cinq dates pour situer le débat
Avant d’entrer dans le détail, voici la chronologie des événements documentés que nous allons examiner. Les couleurs distinguent les usages offensifs, défensifs et l’analyse institutionnelle.

Côté attaquants : l’usurpation industrialisée
Arup : 25 millions de dollars par visioconférence
En février 2024, la police de Hong Kong rapporte l’un des cas de fraude par deepfake les plus marquants à ce jour. Un employé de la finance du groupe d’ingénierie Arup reçoit un courriel se présentant comme émanant du directeur financier britannique et demandant une transaction confidentielle. Méfiant, il est rassuré par une visioconférence où tous les autres participants, hormis lui, étaient des reproductions générées par IA de collègues bien réels. Quinze virements, pour environ 200 millions de dollars de Hong Kong (près de 25 M$ US), sont exécutés. La fraude n’est découverte que lorsque l’employé contacte le siège, qui ignore tout de cette réunion. Arup ne s’est publiquement identifiée comme victime qu’en mai 2024.
Le point clé n’est pas la sophistication technique, mais le fait que voir et entendre des interlocuteurs connus ne prouve plus rien. Le contrôle doit se déplacer vers le processus : rappel sur un canal connu, double validation, seuils.
GTG-1002 : la première campagne d’espionnage pilotée par une IA
Détectée mi-septembre 2025 et rendue publique par Anthropic le 14 novembre 2025, la campagne GTG-1002 est présentée comme la première opération d’espionnage à grande échelle exécutée en grande partie par un agent IA. Les faits rapportés par l’éditeur :
- environ trente cibles : entreprises technologiques, institutions financières, industrie chimique, administrations ;
- un groupe attribué avec « haute confiance » à un acteur étatique chinois ;
- l’IA aurait réalisé 80 à 90 % de la campagne, l’humain n’intervenant que sur 4 à 6 points de décision critiques ;
- contournement des garde-fous par fragmentation de l’objectif en petites tâches d’apparence anodine, et par un prétexte (se présenter comme employé d’une société de cybersécurité menant des tests défensifs) ;
- une limite notable : le modèle a parfois halluciné des identifiants ou présenté comme secrètes des informations publiques, ce qui freine l’autonomie complète.
Transparence : l’outil détourné dans cette affaire était Claude Code, d’Anthropic, et cet article a lui-même été rédigé avec l’aide d’un assistant Claude. Anthropic a banni les comptes concernés, notifié les entités touchées et coordonné avec les autorités. Les chiffres ci-dessus sont ceux de l’éditeur : ils n’ont pas fait l’objet d’une vérification indépendante.
Côté défenseurs : les IA qui trouvent et corrigent
Big Sleep : une faille bloquée avant son exploitation
En juillet 2025, Google annonce que Big Sleep, un agent développé par Google DeepMind et Project Zero, a identifié la vulnérabilité CVE-2025-6965 dans SQLite (dépassement d’entier entraînant une lecture hors limites, score CVSS 7,2, versions antérieures à 3.50.2). Cette faille était, selon Google, « connue uniquement d’acteurs malveillants » et sur le point d’être exploitée. Les équipes de renseignement sur la menace avaient repéré des signaux faibles sans pouvoir isoler la faille ; Big Sleep a analysé le code et l’a trouvée. Kent Walker, président des affaires mondiales de Google, résume : Google a pu prédire qu’une vulnérabilité allait être utilisée et « la couper » en amont. Selon Google, c’est la première fois qu’un agent IA contribue directement à empêcher une exploitation.
DARPA AIxCC : un bond en un an
Lors de la finale de l’AI Cyber Challenge (août 2025), les systèmes autonomes des équipes finalistes ont analysé plus de 54 millions de lignes de code. Résultats publiés par la DARPA :

- 54 failles synthétiques sur 63 identifiées (86 %), dont 43 corrigées (68 %) ;
- 18 vraies vulnérabilités inconnues découvertes (6 dans du code C, 12 en Java), avec 11 correctifs proposés ;
- un correctif soumis en 45 minutes en moyenne, pour un coût moyen d’environ 152 $ par tâche ;
- podium : Team Atlanta (4 M$), Trail of Bits (3 M$), Theori (1,5 M$).
Une précision utile : les failles « synthétiques » sont injectées volontairement dans des bases de code pour mesurer les performances. Les 18 découvertes réelles sont la preuve de concept la plus concrète, mais le chiffre reste modeste.
Ce que ça coûte : IBM et la « shadow AI »
Le rapport IBM Cost of a Data Breach 2025 donne un coût moyen mondial d’une violation de 4,44 M$, en baisse de 9 % par rapport aux 4,88 M$ de 2024. Mais l’IA introduit un facteur aggravant : les outils d’IA non autorisés, utilisés en dehors de tout contrôle (la shadow AI), interviennent dans environ 20 % des violations et alourdissent la facture de 670 000 $ (4,63 M$ contre 3,96 M$), avec une détection plus lente (247 jours contre 241). IBM relève par ailleurs que 13 % des organisations ont déjà subi une violation touchant un modèle ou une application d’IA, et que 97 % d’entre elles n’avaient pas de contrôles d’accès adéquats sur l’IA.

Le garde-fou du réel : ce que dit l’ANSSI
Publiée le 4 février 2026 (CERTFR-2026-CTI-001), la synthèse de la menace de l’ANSSI sur l’IA générative apporte un contrepoint précieux. L’agence constate que ces modèles sont utilisés et détournés à différentes étapes d’une attaque (profilage des victimes, ingénierie sociale, développement de codes malveillants), mais conclut qu’« aucun système d’IA générative, officiel ou débridé, n’a été en mesure de mener de manière autonome toutes les étapes d’une attaque informatique ». Les acteurs avancés y gagnent en performance et en échelle, les moins expérimentés s’en servent surtout comme outil d’apprentissage.
L’IA amplifie les attaquants compétents plus qu’elle ne crée des attaquants tout-puissants. Ce n’est pas rassurant, mais c’est actionnable.
Cette nuance ne contredit pas GTG-1002 : cette campagne reposait sur 80 à 90 % d’automatisation, mais avec des humains aux points de décision, et l’ANSSI parle d’autonomie sur toutes les étapes.
Quand l’IA devient la cible
L’ANSSI le souligne : les systèmes d’IA sont eux-mêmes attaqués (empoisonnement de modèles, compromission de la chaîne d’approvisionnement, exfiltration de données). Le projet OWASP GenAI Security Project maintient une référence pour les applications à base de LLM, dont voici l’édition 2025.

Deux entrées méritent l’attention dès qu’on déploie des agents : LLM01, l’injection de prompt (un texte malveillant détourne les instructions du modèle), et LLM06, l’agentivité excessive (l’agent dispose de trop de droits, d’outils ou d’autonomie).
Que faire concrètement ?
Les recommandations suivantes sont celles de l’auteur, déduites des faits ci-dessus, et non des conclusions des sources citées.
- Ne plus se fier à la voix ni à l’image. Tout ordre de virement ou changement de coordonnées bancaires passe par un rappel sur un numéro connu et une double validation (leçon Arup).
- Inventorier l’IA utilisée dans l’organisation et offrir une alternative autorisée : la shadow AI se nourrit de l’absence d’offre officielle (leçon IBM).
- Raccourcir les délais de correctif. Si des IA trouvent des failles en quelques heures, le délai entre publication d’un correctif et déploiement devient le vrai risque.
- Donner aux agents IA le minimum de droits : identité dédiée, périmètre restreint, actions sensibles soumises à validation humaine (LLM06).
- Journaliser et superviser l’activité des agents comme celle de comptes à privilèges : une automatisation massive laisse des traces (volume, cadence, enchaînement des requêtes).
- Garder l’humain aux décisions critiques, y compris côté défense : les IA de l’AIxCC corrigent 68 % des failles trouvées, pas 100 %.
En résumé
L’IA n’a pas rendu les attaquants invincibles, ni les défenseurs infaillibles. Elle a accéléré les deux camps : plus de crédibilité pour l’arnaque, plus d’automatisation pour l’intrusion, mais aussi la capacité de trouver des failles inconnues et de proposer des correctifs à faible coût. Le domaine évolue vite : les faits ci-dessus sont arrêtés à septembre 2026 et les chiffres des éditeurs sont à lire pour ce qu’ils sont, des communications de l’acteur concerné.
À lire aussi
- Groupes APT : de la fiche MITRE ATT&CK aux priorités de détection : transformer les fiches de groupes d’attaquants en règles de détection concrètes.
- Sanity check après incident : la checklist technique pour prouver qu’un système est redevenu sain avant de le remettre en service.
Sources
- DARPA, résultats de l’AI Cyber Challenge : darpa.mil/news/2025/aixcc-results
- Anthropic, « Disrupting the first reported AI-orchestrated cyber espionage campaign » : anthropic.com/news/disrupting-AI-espionage
- ANSSI, synthèse de la menace sur l’IA générative (CERTFR-2026-CTI-001) : cyber.gouv.fr
- OWASP GenAI Security Project, LLM Top 10 : genai.owasp.org/llm-top-10
- IBM, Cost of a Data Breach 2025 : ibm.com/think/x-force et communiqué IBM du 30 juillet 2025
- Google, Big Sleep et CVE-2025-6965 : blog.google et The Hacker News
- Arup : CNN Business, 16 mai 2024 et The Register, 5 février 2024
- Campagne GTG-1002 dans MITRE ATT&CK : attack.mitre.org/campaigns/C0062