L’IA en cybersécurité : ce que disent les faits, des deux côtés

En vingt mois, l’intelligence artificielle est passée du statut de gadget à celui d’acteur à part entière de la cybersécurité : elle arnaque, elle pirate, elle détecte, elle corrige. Voici ce que disent les faits, sources primaires à l’appui, sans fantasme ni catastrophisme.

Illustration : un réseau lumineux autour du mot IA, titre « L'IA change la cybersécurité, des deux côtés »

Cinq dates pour situer le débat

Avant d’entrer dans le détail, voici la chronologie des événements documentés que nous allons examiner. Les couleurs distinguent les usages offensifs, défensifs et l’analyse institutionnelle.

Frise chronologique : Arup en février 2024, Big Sleep en juillet 2025, DARPA AIxCC en août 2025, GTG-1002 en septembre 2025, synthèse ANSSI en février 2026
Cinq événements documentés, de février 2024 à février 2026.

Côté attaquants : l’usurpation industrialisée

Arup : 25 millions de dollars par visioconférence

En février 2024, la police de Hong Kong rapporte l’un des cas de fraude par deepfake les plus marquants à ce jour. Un employé de la finance du groupe d’ingénierie Arup reçoit un courriel se présentant comme émanant du directeur financier britannique et demandant une transaction confidentielle. Méfiant, il est rassuré par une visioconférence où tous les autres participants, hormis lui, étaient des reproductions générées par IA de collègues bien réels. Quinze virements, pour environ 200 millions de dollars de Hong Kong (près de 25 M$ US), sont exécutés. La fraude n’est découverte que lorsque l’employé contacte le siège, qui ignore tout de cette réunion. Arup ne s’est publiquement identifiée comme victime qu’en mai 2024.

Le point clé n’est pas la sophistication technique, mais le fait que voir et entendre des interlocuteurs connus ne prouve plus rien. Le contrôle doit se déplacer vers le processus : rappel sur un canal connu, double validation, seuils.

GTG-1002 : la première campagne d’espionnage pilotée par une IA

Détectée mi-septembre 2025 et rendue publique par Anthropic le 14 novembre 2025, la campagne GTG-1002 est présentée comme la première opération d’espionnage à grande échelle exécutée en grande partie par un agent IA. Les faits rapportés par l’éditeur :

  • environ trente cibles : entreprises technologiques, institutions financières, industrie chimique, administrations ;
  • un groupe attribué avec « haute confiance » à un acteur étatique chinois ;
  • l’IA aurait réalisé 80 à 90 % de la campagne, l’humain n’intervenant que sur 4 à 6 points de décision critiques ;
  • contournement des garde-fous par fragmentation de l’objectif en petites tâches d’apparence anodine, et par un prétexte (se présenter comme employé d’une société de cybersécurité menant des tests défensifs) ;
  • une limite notable : le modèle a parfois halluciné des identifiants ou présenté comme secrètes des informations publiques, ce qui freine l’autonomie complète.

Transparence : l’outil détourné dans cette affaire était Claude Code, d’Anthropic, et cet article a lui-même été rédigé avec l’aide d’un assistant Claude. Anthropic a banni les comptes concernés, notifié les entités touchées et coordonné avec les autorités. Les chiffres ci-dessus sont ceux de l’éditeur : ils n’ont pas fait l’objet d’une vérification indépendante.

Côté défenseurs : les IA qui trouvent et corrigent

Big Sleep : une faille bloquée avant son exploitation

En juillet 2025, Google annonce que Big Sleep, un agent développé par Google DeepMind et Project Zero, a identifié la vulnérabilité CVE-2025-6965 dans SQLite (dépassement d’entier entraînant une lecture hors limites, score CVSS 7,2, versions antérieures à 3.50.2). Cette faille était, selon Google, « connue uniquement d’acteurs malveillants » et sur le point d’être exploitée. Les équipes de renseignement sur la menace avaient repéré des signaux faibles sans pouvoir isoler la faille ; Big Sleep a analysé le code et l’a trouvée. Kent Walker, président des affaires mondiales de Google, résume : Google a pu prédire qu’une vulnérabilité allait être utilisée et « la couper » en amont. Selon Google, c’est la première fois qu’un agent IA contribue directement à empêcher une exploitation.

DARPA AIxCC : un bond en un an

Lors de la finale de l’AI Cyber Challenge (août 2025), les systèmes autonomes des équipes finalistes ont analysé plus de 54 millions de lignes de code. Résultats publiés par la DARPA :

Diagramme en barres : aux demi-finales 37 % des failles trouvées et 25 % corrigées ; en finale 86 % trouvées et 68 % corrigées
Progression entre les demi-finales (2024) et la finale (2025). Source : DARPA.
  • 54 failles synthétiques sur 63 identifiées (86 %), dont 43 corrigées (68 %) ;
  • 18 vraies vulnérabilités inconnues découvertes (6 dans du code C, 12 en Java), avec 11 correctifs proposés ;
  • un correctif soumis en 45 minutes en moyenne, pour un coût moyen d’environ 152 $ par tâche ;
  • podium : Team Atlanta (4 M$), Trail of Bits (3 M$), Theori (1,5 M$).

Une précision utile : les failles « synthétiques » sont injectées volontairement dans des bases de code pour mesurer les performances. Les 18 découvertes réelles sont la preuve de concept la plus concrète, mais le chiffre reste modeste.

Ce que ça coûte : IBM et la « shadow AI »

Le rapport IBM Cost of a Data Breach 2025 donne un coût moyen mondial d’une violation de 4,44 M$, en baisse de 9 % par rapport aux 4,88 M$ de 2024. Mais l’IA introduit un facteur aggravant : les outils d’IA non autorisés, utilisés en dehors de tout contrôle (la shadow AI), interviennent dans environ 20 % des violations et alourdissent la facture de 670 000 $ (4,63 M$ contre 3,96 M$), avec une détection plus lente (247 jours contre 241). IBM relève par ailleurs que 13 % des organisations ont déjà subi une violation touchant un modèle ou une application d’IA, et que 97 % d’entre elles n’avaient pas de contrôles d’accès adéquats sur l’IA.

Diagramme en barres : coût moyen d'une violation de données, 4,88 M$ en 2024, 4,44 M$ en 2025, 3,96 M$ sans shadow AI, 4,63 M$ avec shadow AI
Coût moyen d’une violation de données, en millions de dollars US. Source : IBM.

Le garde-fou du réel : ce que dit l’ANSSI

Publiée le 4 février 2026 (CERTFR-2026-CTI-001), la synthèse de la menace de l’ANSSI sur l’IA générative apporte un contrepoint précieux. L’agence constate que ces modèles sont utilisés et détournés à différentes étapes d’une attaque (profilage des victimes, ingénierie sociale, développement de codes malveillants), mais conclut qu’« aucun système d’IA générative, officiel ou débridé, n’a été en mesure de mener de manière autonome toutes les étapes d’une attaque informatique ». Les acteurs avancés y gagnent en performance et en échelle, les moins expérimentés s’en servent surtout comme outil d’apprentissage.

L’IA amplifie les attaquants compétents plus qu’elle ne crée des attaquants tout-puissants. Ce n’est pas rassurant, mais c’est actionnable.

Cette nuance ne contredit pas GTG-1002 : cette campagne reposait sur 80 à 90 % d’automatisation, mais avec des humains aux points de décision, et l’ANSSI parle d’autonomie sur toutes les étapes.

Quand l’IA devient la cible

L’ANSSI le souligne : les systèmes d’IA sont eux-mêmes attaqués (empoisonnement de modèles, compromission de la chaîne d’approvisionnement, exfiltration de données). Le projet OWASP GenAI Security Project maintient une référence pour les applications à base de LLM, dont voici l’édition 2025.

Grille des dix risques OWASP pour les applications LLM, de LLM01 injection de prompt à LLM10 consommation non maîtrisée
OWASP Top 10 pour les applications LLM (2025). Le surlignage rouge de LLM01 et LLM06 est un choix éditorial de l’auteur.

Deux entrées méritent l’attention dès qu’on déploie des agents : LLM01, l’injection de prompt (un texte malveillant détourne les instructions du modèle), et LLM06, l’agentivité excessive (l’agent dispose de trop de droits, d’outils ou d’autonomie).

Que faire concrètement ?

Les recommandations suivantes sont celles de l’auteur, déduites des faits ci-dessus, et non des conclusions des sources citées.

  1. Ne plus se fier à la voix ni à l’image. Tout ordre de virement ou changement de coordonnées bancaires passe par un rappel sur un numéro connu et une double validation (leçon Arup).
  2. Inventorier l’IA utilisée dans l’organisation et offrir une alternative autorisée : la shadow AI se nourrit de l’absence d’offre officielle (leçon IBM).
  3. Raccourcir les délais de correctif. Si des IA trouvent des failles en quelques heures, le délai entre publication d’un correctif et déploiement devient le vrai risque.
  4. Donner aux agents IA le minimum de droits : identité dédiée, périmètre restreint, actions sensibles soumises à validation humaine (LLM06).
  5. Journaliser et superviser l’activité des agents comme celle de comptes à privilèges : une automatisation massive laisse des traces (volume, cadence, enchaînement des requêtes).
  6. Garder l’humain aux décisions critiques, y compris côté défense : les IA de l’AIxCC corrigent 68 % des failles trouvées, pas 100 %.

En résumé

L’IA n’a pas rendu les attaquants invincibles, ni les défenseurs infaillibles. Elle a accéléré les deux camps : plus de crédibilité pour l’arnaque, plus d’automatisation pour l’intrusion, mais aussi la capacité de trouver des failles inconnues et de proposer des correctifs à faible coût. Le domaine évolue vite : les faits ci-dessus sont arrêtés à septembre 2026 et les chiffres des éditeurs sont à lire pour ce qu’ils sont, des communications de l’acteur concerné.

Sources