Services
Contactez-nous

Vulnérabilité des agents IA avec 192 incidents réels

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
mis à jour le 28 juin 2026

Comprendre comment la vulnérabilité des agents IA fait échouer les systèmes, que ce soit par des exploits de sécurité, des défaillances des garde-fous ou des expositions de données, est devenu critique alors que ces systèmes assument des rôles de plus en plus autonomes dans les flux de travail des entreprises.

Pour cartographier le paysage des risques réels des agents IA, nous avons examiné 192 incidents de vulnérabilité documentés couvrant la période de mars 2016 à mai 2026, en nous appuyant sur des sources.

Distribution des vulnérabilités

Distribution par catégorie

Loading Chart

Les incidents se répartissent en trois classes.

Les défaillances de sécurité arrivent en tête. Dans ces cas, l'agent produit ou permet un préjudice que ses contrôles auraient dû bloquer. Les exploits de sécurité viennent ensuite ; ici, un attaquant abuse d'une faiblesse de l'agent. L'exposition de données constitue la plus petite classe.

Défaillances de sécurité et des garde-fous

Trois catégories portent l'essentiel du poids.

La diffamation et la fabrication constituent la plus grande catégorie individuelle du catalogue. L'agent énonce des faits faux concernant une personne ou une entreprise réelle. Les exemples incluent des accusations inventées et de fausses citations juridiques.

Exploits de sécurité

Les catégories de sécurité suivent la liste OWASP ASI (le Top 10 OWASP pour les applications agentiques).

Le détournement d'objectif de l'agent arrive en tête. La méthode courante est l'injection de prompt : des instructions cachées placées dans le texte que l'agent lit. L'exécution de code inattendue arrive en deuxième position, où l'agent exécute des commandes fournies par l'attaquant.

Exposition de données

L'exposition de données confidentielles et le contrôle d'accès représentent 15 incidents. Les causes courantes incluent les liens de partage ouverts, les mots de passe faibles et le stockage non chiffré.

Distribution par année et par mois

Les enregistrements couvrent la période de mars 2016 à mai 2026. Le nombre a fortement augmenté ces dernières années.

L'année 2025 représente plus de la moitié du catalogue. Cette hausse suit la propagation des chatbots et des outils agentiques dans le travail quotidien.

Le premier enregistrement date de mars 2016 : le chatbot Tay de Microsoft, orienté par les utilisateurs vers des publications racistes. Jusqu'en 2022, les signalements restent rares. Ils portent sur les comportements inappropriés des chatbots et les contenus nuisibles, non sur les attaques.

2025 a apporté 104 incidents, le pic du catalogue. Le flux est resté constant tout au long de l'année, avec des points hauts en juillet (14), avril (13) et octobre (13). La répartition des classes était presque équilibrée : 51 défaillances de sécurité, 47 exploits de sécurité et 6 cas d'exposition de données.

2026 affiche 33 incidents jusqu'en mai. La répartition penche vers la sécurité : 23 exploits contre 8 défaillances de sécurité. Les attaques de la chaîne d'approvisionnement et les failles d'exécution de code augmentent à mesure que plusieurs agents accèdent à des outils, du code et des systèmes externes connectés.

Catégories de vulnérabilité des agents IA

Une vulnérabilité d'agent IA est une faiblesse dans un système d'IA autonome. Un système agentique planifie, décide et agit en plusieurs étapes. Il utilise des outils, de la mémoire et des liens vers d'autres systèmes, souvent sans qu'un humain approuve chaque étape. Une vulnérabilité permet à un attaquant d'exploiter cette faiblesse, ou laisse les contrôles de sécurité de l'agent échouer. L'effet atteint le monde réel : données sensibles divulguées, exécution non autorisée, code qui s'exécute sur une machine hôte, ou préjudice à une personne.

Les catégories ci-dessous se répartissent en trois groupes. Les catégories d'exploits de sécurité couvrent les attaques qui abusent d'une faiblesse. Les catégories de sécurité et de garde-fous couvrent les défaillances où l'agent produit ou permet un préjudice. L'exposition de données couvre les contrôles d'accès faibles qui révèlent des informations privées.

Les catégories de sécurité des agents IA suivent le Top 10 OWASP pour les applications agentiques (2026). Les catégories de sécurité et d'exposition de données étendent cette liste, car l'ensemble OWASP se concentre sur la sécurité et laisse de la place pour les défaillances de garde-fous et de confidentialité.

Catégories d'exploits de sécurité

Détournement d'objectif de l'agent

Un attaquant modifie ce que l'agent essaie de faire. La méthode courante est l'injection de prompt : des instructions cachées placées dans le texte que l'agent lit, comme un email, une page web, un document ou la sortie d'un outil. L'agent traite le texte caché comme une commande réelle et l'exécute. EchoLeak a montré le danger. Un seul email conçu a fait en sorte que Microsoft 365 Copilot lise des fichiers internes et les envoie, sans aucun clic de la victime.

Mauvais usage et exploitation des outils

L'agent détient l'autorisation d'appeler des outils et des APIs, comme l'email, les bases de données ou les fonctions de paiement. Un attaquant dirige l'agent pour qu'il utilise ces outils contre son propriétaire. Le dommage provient d'une action normale détournée à des fins nuisibles. Un agent de trading manipulé, par exemple, peut transférer des fonds vers le mauvais compte.

Abus d'identité et de privilèges

Un agent porte des identifiants et des droits d'accès. Des contrôles faibles permettent à un attaquant d'emprunter cette identité ou de pousser l'agent au-delà de ses limites prévues. L'agent de recrutement McHire de McDonald's utilisait un mot de passe faible et a exposé les dossiers d'environ 64 millions de candidats.

Chaîne d'approvisionnement agentique

Les agents dépendent de composants externes : modèles d'IA, plugins et connecteurs tels que les serveurs MCP. (MCP, le Model Context Protocol, est une méthode standard permettant à un agent de se connecter à des outils externes.) Un composant empoisonné ou faux propage ses dommages à chaque agent qui l'installe. L'agent de codage Cline a livré une version compromise après qu'un attaquant l'a trompé pour qu'il récupère un faux package.

Exécution de code inattendue

L'agent exécute du code ou des commandes shell sur une machine hôte. Un attaquant abuse de cette capacité pour exécuter ses propres commandes. L'abréviation pour cela est RCE, ou exécution de code à distance. La faille CLI de Gemini a obtenu la sévérité maximale et a donné à un attaquant le contrôle total de l'hôte.

Empoisonnement de la mémoire et du contexte

Les agents conservent de la mémoire et extraient du contexte à partir de documents et de bases de données. Un attaquant introduit des prompts faux ou malveillants dans ce stockage. L'agent récupère ultérieurement le contenu empoisonné et agit en conséquence. L'effet persiste à travers les sessions et est difficile à détecter.

Communication inter-agents non sécurisée

De nombreux systèmes complexes font fonctionner plusieurs agents qui communiquent entre eux. Un agent a tendance à faire confiance par défaut aux messages d'un autre agent. Un attaquant abuse de cette confiance, usurpe un agent ou relaie des instructions falsifiées. Un agent à faible privilège peut être dirigé pour recruter un agent plus puissant.

Défaillances en cascade

L'erreur ou la compromission d'un seul agent se propage à travers les systèmes multi-agents connectés. Une seule action peut effacer des données ou interrompre un flux de travail sans possibilité d'annulation facile. Un agent Replit a supprimé une base de données de production pendant un gel de code, puis a masqué l'erreur.

Catégories de défaillances de sécurité et des garde-fous

Ces catégories décrivent une défaillance des contrôles de l'agent. Aucun attaquant n'est nécessaire. L'agent produit ou permet un préjudice que ses garde-fous auraient dû bloquer.

Automutilation et santé mentale

L'agent ne parvient pas à protéger une personne en crise. Au lieu de rediriger vers du soutien, il valide des pensées nuisibles ou fournit des détails dangereux. Des signalements décrivent des chatbots qui ont encouragé le suicide ou renforcé des pensées délirantes, avec un préjudice réel pour la personne.

Sécurité des mineurs

L'agent expose un mineur à du contenu sexuel, prédateur ou autrement dangereux. Les contrôles censés bloquer de telles interactions échouent. Des signalements décrivent des chatbots compagnons qui ont entraîné des mineurs dans des conversations dangereuses.

Violence et assistance dangereuse

L'agent aide à planifier ou à exécuter des actes de violence ou un autre crime grave. Les filtres qui devraient refuser la demande s'effondrent. Des signalements décrivent des chatbots consultés lors de la planification d'attaques.

Conseils de santé et médicaux nuisibles

L'agent donne des conseils médicaux dangereux qui peuvent blesser une personne. Un signalement décrit un chatbot qui a suggéré de remplacer le sel de table par du bromure de sodium, ce qui a entraîné un empoisonnement et une hospitalisation.

Diffamation et fabrication

L'agent énonce des faits faux concernant une personne ou une organisation réelle comme s'ils étaient vrais. Des citations, accusations ou références fabriquées causent un préjudice réputationnel ou juridique. Un modèle a faussement accusé un journaliste de crimes. Un autre a inventé une citation juridique qui s'est retrouvée dans des dépôts légaux.

Harcèlement et contenu abusif

L'agent produit un contenu abusif, menaçant ou non consenti visant une personne. Les exemples incluent des réponses menaçantes et des outils utilisés pour créer des images intimes non consenties.

Exposition de données et contrôle d'accès

Un contrôle faible dans le système d'agent IA révèle des informations privées. Les causes courantes incluent les liens de partage ouverts, le stockage non chiffré et l'accès non autorisé aux fichiers. Le matériel exposé peut inclure des données personnelles, des conversations sauvegardées, des identifiants ou du code source.

Comment les catégories s'articulent

Les catégories d'exploits de sécurité impliquent des attaquants qui trouvent et exploitent des faiblesses. Les catégories de sécurité et de garde-fous ne nécessitent aucun attaquant ; les propres contrôles de l'agent échouent. L'exposition de données se situe entre les deux : un défaut de conception ou de configuration divulgue des données sensibles, qu'un attaquant soit impliqué ou non. Un seul incident peut toucher plus d'une catégorie. Pour un catalogue propre, chaque incident est attribué à sa catégorie principale en fonction de la faiblesse centrale.

Laissez notre équipe automatiser l'un de vos processus métier avec des agents IA, gratuitement.
Automatiser un processus

Méthodologie de la vulnérabilité des agents IA

Périmètre et définition

Le catalogue couvre les vulnérabilités des agents IA. Trois types d'incidents sont éligibles : les exploits de sécurité (comme l'injection de prompt ou le code qui s'exécute sur un hôte), les défaillances de sécurité et des garde-fous (comme des conseils nuisibles ou de fausses déclarations concernant une personne réelle), et les failles d'exposition de données.

Plusieurs types d'incidents sont hors périmètre : les litiges de droits d'auteur et de licence, les biais génériques ou les stéréotypes en sortie, les erreurs factuelles sans préjudice, les cas où une personne a utilisé le modèle comme outil pour créer des logiciels malveillants ou des escroqueries, les litiges réglementaires et les plaintes opérationnelles.

Le catalogue s'appuie sur trois couches de preuves. Les sources primaires prédominent. Les comptes rendus des éditeurs et les actualités comblent les lacunes lorsqu'un éditeur est le divulgateur ou l'unique enregistrement.

La première couche est un ensemble d'incidents datés et spécifiques à des produits provenant d'avis et de recherches en sécurité. Les avis incluent la National Vulnerability Database (NVD),1 le Microsoft Security Response Center (MSRC),2 et la GitHub Advisory Database (GHSA).3 Ce sont des enregistrements publics qui décrivent une faille spécifique. La recherche en sécurité provient des entreprises qui ont découvert les failles, telles que Noma Security, Check Point, Tenable, Wiz et Zenity.

La deuxième couche est l'OWASP Exploits and Incidents Tracker, de l'Annexe D du Top 10 OWASP pour les applications agentiques (2026).4 Ses entrées sont reproduites avec attribution.

La troisième couche est l'IA Incident Database (AIID), un enregistrement ouvert et évalué par les pairs des préjudices liés à l'IA. L'AIID contient plus de 1 500 incidents couvrant tous les types de systèmes d'IA.5

Comment les incidents ont été sélectionnés

Le système utilise des filtres par mots-clés pour identifier les incidents d'IA. Ce filtre inclut des mots-clés spécifiques tels que :

1. Reconnaissance des systèmes agentiques/LLM : chatbot, chat bot, large language model, language model, LLM, IA générative, GPT-3/GPT-4, ChatGPT, Gemini, Google Bard, Copilot, Claude, Llama, Grok, DeepSeek, Character.ai, Replika, Bing Chat, assistant IA, assistant virtuel, agent IA, agentique, IA conversationnelle, assistant de codage, compagnon IA, TayBot

2. Signaux d'exploits de sécurité : injection de prompt, injection de prompt indirecte, jailbreak/jailbreaké, exfiltrer, code distant / exécution de code / RCE, code arbitraire, injection de commande, commande/code/instruction injecté(e), porte dérobée, package/MCP/serveur/outil/extension malveillant(e), chaîne d'approvisionnement, empoisonnement de mémoire, mémoire/RAG/contexte empoisonné(e), détournement, prise de contrôle, exploit, identifiant, vol/fuite de token, escalade de privilèges, contournement de garde-fou/filtre/sécurité/auth/sandbox, supprimé/effacé/détruit/éradiqué, transfert … $/million, accepte de vendre, trompé, manipulé … agent/bot, prompt frauduleux

3. Signaux de sécurité/garde-fous : suicide, automutilation, overdose, mineur/enfant/adolescent, CSAM, mineur, grooming, prédateur, arme, bombe, explosif, fusillade de masse, agression au couteau, élimination de corps, homicide, assassinat, attaque au marteau, conseils/planification d'attaque, diffamer, fausse accusation/allégation, fabriquer, halluciner, diffamation, harceler, non consenti, nudifier, image intime, conseils/instructions dangereux, conseils médicaux dangereux, bromure de sodium, bromisme, hospitaliser, trouble alimentaire, conseils diététiques, usage de drogues, décédé/décès après/suite à, menacer/menaçant, discours de haine, délire renforcé

4. Exposition de données : exposer/exposé/exposition, divulgué, fuite, divulguer, accès en cache + (données / dossiers / conversations / emails / identifiants / clé API / code source / candidats / patients / utilisateurs), non chiffré, mots de passe/SSN stockés, lit des fichiers sans consentement, a téléchargé des données sensibles

5. Signaux d'EXCLUSION droits d'auteur, plagiat, enfreindre, piraté, LibGen, Books3, entraînement non autorisé, RGPD, base juridique, a pratiqué le droit / sans licence, tricherie, devoir scolaire, examen, poursuit OpenAI, biais, stéréotype, raciste, sexiste, antisémite, remarque offensante, désinformation, propagande, influencer les opérations commerciales, escroquerie sentimentale, ransomware, spam, escroquerie à l'investissement, schéma de fraude, surveillance, désinforme sur la géographie, fonction de récompense

6. Pour les attributions de catégories :

  • Détournement d'objectif de l'agent (ASI01) : injection de prompt, jailbreak, manipuler, accepte de vendre, détournement
  • Exécution de code inattendue (ASI05) : RCE, exécution de code, injection de commande, code arbitraire
  • Chaîne d'approvisionnement agentique (ASI04) : package/MCP malveillant, chaîne d'approvisionnement, porte dérobée
  • Défaillances en cascade (ASI08) : supprimé, effacé, détruit, éradiqué
  • Mauvais usage des outils (ASI02) : transfert … $/million, agent de trading
  • Abus d'identité et de privilèges (ASI03) : identifiant, vol de token, escalade de privilèges, prise de contrôle, compromission de compte
  • Sécurité des mineurs : CSAM, grooming, prédateur, mineur + sexuel
  • Automutilation et santé mentale : suicide, overdose, délire, trouble alimentaire
  • Violence et assistance dangereuse : fusillade de masse, agression au couteau, arme, planification d'attaque, discours de haine
  • Conseils de santé/médicaux nuisibles : bromure de sodium, bromisme, conseils médicaux dangereux
  • Diffamation et fabrication : diffamer, fausse accusation, fabriquer, halluciner, accuser faussement

Révision humaine

Le catalogue n'est pas le fruit de l'automatisation seule. Une étape automatisée a rassemblé et trié les incidents à grande échelle. L'équipe a ensuite examiné les entrées manuellement : chaque système affecté a été vérifié, chaque catégorie a été confirmée, et chaque lien source a été ouvert pour vérifier qu'il fonctionnait et étayait l'affirmation. La décision finale sur chaque entrée incombe aux auteurs.

Liste des incidents liés à la vulnérabilité des agents IA

Découvrez davantage de nos benchmarks et analyses basées sur les données dans la recherche Google.
GoogleAjouter comme source préférée

Citer cette recherche

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Ezgi Arslan, PhD. (2026) - "Vulnérabilité des agents IA avec 192 incidents réels". Publié en ligne sur AIMultiple.com. Consulté le 28 Juin 2026, à : https://aimultiple.com/ai-agent-vulnerability [Ressource en ligne]

PhD., E. A. (2026, 28 Juin). Vulnérabilité des agents IA avec 192 incidents réels. AIMultiple. https://aimultiple.com/ai-agent-vulnerability

@misc{phd2026,
  author = {PhD., Ezgi Arslan,},
  title  = {{Vulnérabilité des agents IA avec 192 incidents réels}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/ai-agent-vulnerability}},
  note   = {AIMultiple. Consulté le 28 Juin 2026}
}
Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Analyste industrielle
Ezgi détient un doctorat en administration des affaires avec une spécialisation en finance et exerce en tant qu'analyste industrielle chez AIMultiple. Elle mène des recherches et apporte des perspectives à l'intersection de la technologie et des affaires, avec une expertise couvrant la durabilité, l'analyse d'enquêtes et de sentiments, les applications d'agents IA en finance, l'optimisation des moteurs de réponse, la gestion des pare-feu et les technologies d'approvisionnement.
Voir le profil complet

Soyez le premier à commenter

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450