Services
Contactez-nous

Pièges pour agents IA: 20 incidents réels

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
mis à jour le 18 mai 2026

L'adoption des agents IA a dépassé la sécurité des agents IA : 82 % des entreprises déploient désormais des agents, mais seulement 44 % ont des politiques pour les sécuriser,1 et une organisation sur cinq a déjà subi une violation liée aux agents.2

Nous avons analysé 20 incidents de sécurité réels et constaté que les pièges de contrôle comportemental et systémiques (et non l'injection de prompt) sont désormais à l'origine de la majorité des violations critiques. Nous avons cartographié chaque incident selon une taxonomie à six catégories (injection de contenu, manipulation sémantique, état cognitif, contrôle comportemental, systémique et humain dans la boucle) sur la base des données CVE et des recherches de Microsoft et Google DeepMind.

Loading Chart

Incidents réels de pièges pour agents IA

1. Le casse crypto en code Morse de Bankrbot : L'attaque introduit des instructions par encodage Morse, exploitant l'écart entre ce que les garde-fous de Grok inspectent (le texte brut) et ce qu'il décode et exécute (l'instruction traduite). Le choix de l'encodage constitue spécifiquement un contournement de la couche de contenu : la directive malveillante est invisible pour les filtres jusqu'à ce que l'agent lui-même la rende lisible.3

2. Claude ClaudeBleed : Il s'agit d'une vulnérabilité de sécurité critique dans l'extension de navigateur Anthropic Claude pour Chrome, permettant à des acteurs malveillants de détourner l'assistant IA, de voler des données sensibles et d'effectuer des actions sans le consentement de l'utilisateur.4

3. Gemini CLI RCE : Une vulnérabilité critique d'exécution de code à distance (RCE), identifiée comme GHSA-wpqr-6v78-jr5g, avait un score CVSS maximal de 10.0. Elle a été découverte dans la CLI Gemini et son GitHub Action associée. Cette vulnérabilité permettait aux attaquants de prendre le contrôle total du système exécutant l'outil, ce qui en faisait une menace critique pour la sécurité de la chaîne d'approvisionnement.5

4. Antropic PocketOS : Un agent Cursor propulsé par Claude, alors qu'il enquêtait sur un bug de staging, a découvert de manière autonome un token Railway CLI non délimité, a inféré un endpoint API et a émis une commande volumeDelete qui a détruit la base de données de production et trois mois de sauvegardes en 9 secondes.6

5. Écosystème IA open source : CLI-Anything génère automatiquement des fichiers de couche d'instruction SKILL.md consommés par Claude Code, Codex, OpenClaw, Cursor et GitHub Copilot CLI. Les définitions de compétences empoisonnées se propagent silencieusement à travers chaque agent qui importe le package affecté ; aucun CVE n'est émis, aucune entrée SBOM n'existe et aucun scanner ne les détecte. L'attaque cible l'infrastructure partagée de l'écosystème (le registre de compétences ClawHub, le graphe de dépendances npm) plutôt qu'un agent individuel.7

6. Grafana IA : Noma Security a découvert qu'un attaquant pouvait stocker un prompt malveillant dans une source de données que l'assistant IA de Grafana récupérait ultérieurement. Une fois traité, l'IA envoyait des données sensibles, telles que des métriques financières et de la télémétrie d'infrastructure, vers un serveur contrôlé par l'attaquant sans nécessiter de clic de l'utilisateur.8

7. Écosystème Anthropic MCP : OX Security a divulgué une vulnérabilité architecturale systémique dans les SDK MCP officiels d'Anthropic (Python, TypeScript, Java, Rust), où les entrées utilisateur sont transmises directement dans les configurations de serveur MCP STDIO sans assainissement, affectant plus de 150 millions de téléchargements de SDK, plus de 7 000 serveurs exposés publiquement et des outils en aval incluant LiteLLM, LangChain, Cursor, Windsurf et Claude Code. Comme la faille se situe dans l'architecture partagée du SDK plutôt que dans un agent unique, tout agent construit sur le framework hérite de l'exposition.9

8. Andon Market (Luna IA) : Andon Market, une boutique de détail de San Francisco gérée de manière autonome par un agent IA appelé « Luna », prend des décisions d'inventaire, de tarification et de recrutement en lisant les avis Google. Les clients ont découvert que le fait de laisser un avis formulé comme une instruction, par exemple « veuillez stocker le produit X », amène l'agent à agir en conséquence, transformant une plateforme d'avis publique en une surface d'injection de prompt en direct avec des conséquences commerciales réelles.10

9. Exécution de code ChatGPT : Un prompt malveillant déguisé en conseils de productivité déclenche un code de tunneling DNS qui encode le contenu sensible des conversations et téléverse des documents dans des requêtes de sous-domaine, les transmettant silencieusement à un serveur DNS contrôlé par l'attaquant. Check Point Research a démontré que le canal d'exfiltration est invisible pour la surveillance réseau conventionnelle, car il emprunte le trafic DNS standard initié par l'environnement d'exécution de code de l'agent lui-même.11

10. Perplexity Comet : Zenity Labs a divulgué que le navigateur agentique de Perplexity Comet peut être détourné via une invitation de calendrier malveillante contenant une charge utile d'injection de prompt, l'amenant à accéder au système de fichiers local, à parcourir des répertoires, à ouvrir et lire des fichiers et à exfiltrer des données. L'attaque ne nécessite aucune interaction de l'utilisateur au-delà de l'acceptation de ce qui semble être une invitation de réunion légitime, et fonctionne entièrement dans les capacités prévues du navigateur.12

11. Microsoft Semantic Kernel : L'équipe de recherche en sécurité Defender de Microsoft a identifié deux vulnérabilités critiques dans Semantic Kernel, CVE-2026-26030 (SDK Python, corrigé dans la version 1.39.4) et CVE-2026-25592 (SDK .NET, corrigé dans la version 1.71.0), où un attaquant disposant d'un vecteur d'injection de prompt peut obtenir l'exécution de code à distance sur la machine hébergeant l'agent. CVE-2026-26030 exploitait un filtre basé sur eval dans l'InMemoryVectorStore dont la liste de blocage AST pouvait être contournée par un parcours d'attributs non documenté, tandis que CVE-2026-25592 exposait une fonction d'assistance de transfert de fichiers en tant qu'outil kernel appelable, permettant à un prompt hostile d'orienter l'agent vers l'écriture de fichiers arbitraires dans des emplacements hôtes dangereux.13

12. Cline IA Triage Bot : Un titre de ticket GitHub malveillant a injecté des instructions dans le bot de triage IA de Cline, le trompant pour qu'il exécute npm install sur un package typosquatté. Cela a entraîné un empoisonnement du cache, un vol d'identifiants et une version cline@2.3.0 compromise qui a installé silencieusement le malware OpenClaw sur environ 4 000 machines de développeurs.14

13. Extensions Claude Desktop : Les chercheurs en sécurité de LayerX ont découvert une vulnérabilité CVSS de 10/10 dans les extensions Claude Desktop affectant plus de 10 000 utilisateurs, où un attaquant peut intégrer des instructions malveillantes dans un événement de calendrier que Claude traite lorsqu'un utilisateur demande des informations sur son emploi du temps. L'agent exécute alors automatiquement du code arbitraire sur la machine de l'utilisateur sans aucune autre interaction, sans aucune indication visible que quelque chose s'est produit.15

14. Écosystème npm/MCP : Socket a découvert SANDWORM_MODE, un ver npm auto-répliquant distribué via 19 packages typosquattés qui installe un serveur MCP malveillant avec des charges utiles d'injection de prompt intégrées dans les descriptions d'outils, lui permettant d'exfiltrer des identifiants des assistants de codage IA. Comme le ver se propage via le registre de packages partagé, une seule infection ensemence l'attaque sur chaque développeur qui installe une dépendance affectée.16

15. Snowflake Cortex Code : PromptArmor a découvert que le système de validation des commandes de Cortex Code ne parvenait pas à évaluer les commandes contenues dans les expressions de substitution de processus, permettant à une injection de prompt malveillante cachée dans un README de dépôt GitHub d'exécuter des commandes shell arbitraires sans déclencher l'étape d'approbation humaine. L'instruction injectée a également manipulé le modèle pour qu'il active un drapeau d'exécution non sandboxé, entraînant l'exécution de la commande malveillante entièrement en dehors du sandbox sans demander le consentement de l'utilisateur.

16. Agents MetaGPT / LangChain : MemoryGraft est une nouvelle attaque par injection indirecte qui compromet le comportement de l'agent non pas par des jailbreaks immédiats, mais en implantant des « expériences réussies » malveillantes dans la mémoire à long terme de l'agent, exploitant sa tendance à reproduire les schémas des tâches réussies récupérées. Contrairement aux injections de prompt traditionnelles, qui sont transitoires, ou à l'empoisonnement RAG standard, qui cible les connaissances factuelles, MemoryGraft corrompt toutes les sessions futures sans aucune injection au niveau de la session, nécessitant qu'un attaquant fournisse des artefacts d'ingestion d'apparence bénigne que l'agent lit pendant l'exécution normale.17

17. ServiceNow Now Assist : Dans Now Assist de ServiceNow, les paramètres par défaut permettent aux agents IA de se découvrir et de se recruter mutuellement de manière autonome ; un prompt malveillant intégré dans des données traitées par un agent à faibles privilèges peut lui ordonner de faire appel à un agent plus puissant pour voler des données, modifier des enregistrements ou escalader les privilèges. Le résultat a été une escalade de privilèges et une exposition de données entièrement pilotées par la confiance inter-agents.18

18. Apple Intelligence : Des caractères Unicode malveillants RIGHT-TO-LEFT OVERRIDE masquent des instructions nuisibles en les écrivant à l'envers, de sorte qu'elles s'affichent correctement à l'écran mais restent inversées là où les filtres de sécurité d'Apple les inspectent, contournant ainsi les trois couches de garde-fous sur l'appareil. La technique a réussi dans 76 % des cas de test sur environ 200 millions d'appareils affectés.19

19. Google Gemini (Calendrier) : Des instructions cachées intégrées dans les descriptions d'événements de calendrier restent dormantes dans le contexte de Gemini jusqu'à ce qu'un utilisateur demande des informations sur son emploi du temps, moment auquel la charge utile s'active, résumant le contenu de réunions privées et les écrivant dans un nouvel événement de calendrier visible par l'attaquant. L'attaque exploite l'intégration de Gemini avec les données de calendrier, transformant des données personnelles structurées en une surface de déclenchement sans que la victime n'ait à cliquer sur quoi que ce soit.20

20. Microsoft 365 Copilot : EchoLeak (CVE-2025-32711), découvert par Aim Security, est le premier cas connu d'injection de prompt transformée en arme pour provoquer une exfiltration concrète de données dans un système d'IA en production. Il s'agit d'un email unique qui contraint Copilot à accéder à des fichiers internes et à transmettre leur contenu à un serveur contrôlé par l'attaquant sans aucune interaction de l'utilisateur. L'attaque enchaîne quatre contournements : échapper au classificateur XPIA de Microsoft, contourner la suppression de liens avec du Markdown de style référence, exploiter les images récupérées automatiquement et abuser d'un proxy Microsoft Teams autorisé par la politique de sécurité du contenu.

Qu'est-ce que les pièges pour agents IA ?

Les pièges pour agents IA sont des contenus adverses intégrés dans des environnements numériques et conçus pour manipuler, tromper ou exploiter les agents IA autonomes qui interagissent avec ces environnements.21

L'idée centrale est que les agents autonomes traitent le contenu web à des couches que les humains ne perçoivent pas. Les attaquants peuvent intégrer des instructions malveillantes dans les commentaires HTML, le texte positionné en CSS ou à opacité nulle, les attributs de métadonnées et les données stéganographiques encodées dans les fichiers image.22 Aucune de ces couches n'est ordinairement visible pour un examinateur humain ; un agent analysant la même page traite le contenu qui s'y trouve comme une entrée tout aussi valide que le contenu affiché visiblement à l'écran. Les chercheurs de Google DeepMind notent qu'il s'agit d'une asymétrie fondamentale : les attaquants peuvent calibrer leurs attaques pour exploiter les capacités de suivi d'instructions, d'enchaînement d'outils et de priorisation des objectifs d'un agent, précisément parce que ce sont ces capacités qui rendent les agents utiles sur le plan opérationnel.23

Laissez notre équipe automatiser l'un de vos processus métier avec des agents IA, gratuitement.
Automatiser un processus

Six catégories d'attaques des pièges pour agents IA

Les chercheurs ont identifié 6 catégories de pièges pour agents IA que les adversaires peuvent exploiter pour compromettre les systèmes autonomes :21

Pièges d'injection de contenu

Exploitent l'écart entre la perception humaine, l'analyse machine et le rendu dynamique pour introduire clandestinement des entrées malveillantes auprès de l'agent.

La surface d'attaque couvre plusieurs vecteurs d'injection distincts. Les instructions cachées intégrées dans les commentaires HTML, comme `<!– SYSTEM: Ignore prior instructions –>`, apparaissent dans le code source de la page mais jamais dans la vue rendue. Le positionnement CSS hors écran, utilisant `position: absolute; left: -9999px` ou équivalent, place le texte à des coordonnées en dehors de toute fenêtre d'affichage tout en le laissant entièrement analysable par les agents qui traitent le contenu du modèle objet de document. Les attributs d'accessibilité, spécifiquement `aria-label` et le balisage ARIA associé, contiennent du texte que les agents interprètent comme un contexte sémantique ; y injecter des directives adverses les place dans l'arbre d'accessibilité sans aucune sortie visible. Un quatrième vecteur utilise l'encodage stéganographique : des charges utiles malveillantes encodées dans les données de pixels d'image à des valeurs imperceptibles pour la vision humaine mais lisibles par les agents qui traitent les métadonnées d'image ou appliquent une analyse au niveau des pixels.

Pièges de manipulation sémantique

Corrompent la chaîne de raisonnement de l'agent et ses processus de vérification interne, l'amenant à tirer des conclusions erronées à partir d'entrées apparemment valides.

Trois mécanismes animent cette catégorie. Le premier est la formulation biaisée et l'amorçage contextuel : charger le texte environnant avec un langage qui ancre l'interprétation par l'agent du contenu traité ultérieurement. Le deuxième est la saturation en langage d'autorité, inondant les documents de phrases telles que « norme industrielle », « niveau entreprise » ou « recommandé par les principaux praticiens » pour exploiter l'association apprise du modèle entre un tel langage et des sources crédibles et dignes de confiance.22 Le troisième mécanisme est l'effet « perdu au milieu », une faiblesse structurelle des LLM basés sur les transformeurs où les performances du modèle sur les tâches de récupération et de synthèse dégradent lorsque les informations pertinentes sont positionnées au milieu d'une longue fenêtre de contexte plutôt qu'au début ou à la fin.

Pièges d'état cognitif

Ciblent la mémoire à long terme de l'agent, ses bases de connaissances et ses politiques comportementales apprises pour empoisonner la prise de décision future.

Les trois variantes principales sont l'empoisonnement direct du RAG, l'empoisonnement latent de la mémoire et les exemples few-shot adverses dans l'apprentissage contextuel.

L'empoisonnement direct du RAG injecte de fausses informations dans les corpus de documents indexés que les agents consultent pendant la génération augmentée par récupération. L'empoisonnement de la mémoire est plus avancé. Un attaquant stocke des données d'apparence inoffensive dans la mémoire persistante d'un agent lors d'interactions routinières. Les données stockées ne produisent aucun effet détectable jusqu'à ce qu'un contexte futur spécifique les active, moment auquel elles modifient le comportement de l'agent d'une manière qui semble n'avoir aucun déclencheur causal récent. L'injection few-shot adverse consiste à injecter des paires de démonstration soigneusement conçues dans une fenêtre de contexte afin que l'agent adopte le schéma implicite dans ces exemples. Les recherches sur les déclencheurs de porte dérobée dans les démonstrations ont révélé des taux de réussite d'attaque moyens de 95 pour cent sur des modèles de différentes tailles avec cette approche.

Pièges de contrôle comportemental

Les pièges de contrôle comportemental constituent la catégorie la plus conséquente sur le plan opérationnel de la taxonomie. Ils ciblent ce que les agents font plutôt que ce qu'ils perçoivent ou concluent, donnant aux attaquants une influence directe sur l'exécution des outils, les opérations sur les fichiers, les requêtes réseau et les communications inter-agents.

Pièges systémiques

Les pièges systémiques ne ciblent pas des agents individuels. Ils ciblent les propriétés de l'écosystème qui émergent lorsque de nombreux agents de conception similaire opèrent sur des sources de données partagées, exécutent des schémas de raisonnement similaires et prennent des mesures qui se répercutent dans l'environnement que d'autres agents lisent.22

La catégorie plus large englobe trois mécanismes distincts. Le premier est la conception de pièges de congestion : fabriquer des signaux de rareté ou de demande qui amènent plusieurs agents à exécuter des comportements d'acquisition de ressources synchronisés, créant des défaillances coordonnées sans communication directe entre agents. Le deuxième est la cascade d'interdépendance : exploiter les boucles de rétroaction dans les systèmes multi-agents où la sortie de chaque agent devient l'entrée des autres, de sorte qu'un seul signal corrompu se propage et s'amplifie à travers le réseau. Le troisième est la fragmentation compositionnelle des charges utiles : distribuer les composants d'une attaque sur plusieurs sources individuellement bénignes qui se reconstituent en une charge utile malveillante fonctionnelle lorsqu'elles sont agrégées par un agent lors d'une tâche de récupération ou de synthèse.

Pièges de la boucle humaine

Les pièges de la boucle humaine sont la catégorie la plus subtile de la taxonomie et ciblent la couche de supervision qui est conventionnellement traitée comme une protection. Plutôt que de contourner l'examen humain, ces pièges l'exploitent : l'agent compromis produit des résultats spécifiquement conçus pour obtenir l'approbation humaine pour des actions que l'humain rejetterait si elles étaient décrites avec précision.24

Le mécanisme central est la synthèse trompeuse. Un agent disposant d'un accès en écriture à sa propre couche de sortie peut décrire ses actions d'une manière qui présente des opérations destructrices ou non autorisées comme de la maintenance de routine.

Lectures complémentaires

Ne manquez pas nos benchmarks et analyses basées sur les données. Le bouton ouvre Google ; sélectionner AIMultiple confirme que vous souhaitez voir AIMultiple plus souvent dans les résultats de recherche Google.
GoogleAjouter comme source préférée

Citer cette recherche

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Ezgi Arslan, PhD. (2026) - "Pièges pour agents IA: 20 incidents réels". Publié en ligne sur AIMultiple.com. Consulté le 18 Mai 2026, à : https://aimultiple.com/ai-agent-traps [Ressource en ligne]

PhD., E. A. (2026, 18 Mai). Pièges pour agents IA: 20 incidents réels. AIMultiple. https://aimultiple.com/ai-agent-traps

@misc{phd2026,
  author = {PhD., Ezgi Arslan,},
  title  = {{Pièges pour agents IA: 20 incidents réels}},
  year   = {2026},
  month  = may,
  howpublished    = {\url{https://aimultiple.com/ai-agent-traps}},
  note   = {AIMultiple. Consulté le 18 Mai 2026}
}
Télécharger toutes les données

Résultats et horodatages de 20 points de données. Téléchargez les données utilisées dans cet article sous forme de fichier ZIP contenant un fichier CSV.

Dernière mise à jour : 17 Août 2026
Télécharger

Liens de référence

1.
SailPoint research highlights rapid AI agent adoption, driving urgent need for evolved security | SailPoint
SailPoint
2.
The State of AI Agent Security: 73% of CISOs fear AI agent risks but only 30% are ready
Cision PR Newswire
3.
The Grok Morse Code Heist: When Prompt Injection Meets Excessive Agency | NeuralTrust
NeuralTrust
4.
Vulnerability in Claude Extension for Chrome Exposes AI Agent to Takeover - SecurityWeek
SecurityWeek
5.
Google Fixes CVSS 10 Gemini CLI CI RCE and Cursor Flaws Enable Code Execution
6.
‘It took nine seconds’: Claude AI agent deletes company’s entire database - Yahoo News Canada
The Independent
7.
CLI-Anything Exposes Security Risks in Open-Source AI Ecosystems | Welcome.AI
venturebeat.com
8.
GrafanaGhost: The Phantom Stealing Your Data - Noma Security
Noma Security
9.
Critical Anthropic’s MCP Vulnerability Enables Remote Code Execution Attacks | Cryptika Cybersecurity
Cryptika Cybersecurity
10.
Prompt Injection - The critical vulnerability lurking beneath the AI hype
11.
OpenAI Patches ChatGPT Data Exfiltration Flaw and Codex GitHub Token Vulnerability
12.
PerplexedBrowser: Perplexity’s Agent Browser Can Leak Your PC's Local Files | Zenity Labs
Zenity Labs
13.
How Prompt Injection Attacks Compromise AI Agents in 2026
Atlan
14.
Cline CLI 2.3.0 Supply Chain Attack Installed OpenClaw on Developer Systems
15.
10K Claude Desktop Users Exposed by Zero-Click Vulnerability | eSecurity Planet
eSecurityPlanet
16.
SANDWORM_MODE: npm Supply Chain Attack Targeting AI Development Tools | Hive Pro
Hive Pro
17.
https://arxiv.org/pdf/2512.16962
18.
Second-order prompt injection can turn AI into a malicious insider | TechRadar
TechRadar
19.
On-device Apple Intelligence vulnerable to prompt injection
AppleInsider
20.
Hackers Hijacked Google’s Gemini AI With a Poisoned Calendar Invite to Take Over a Smart Home | WIRED
WIRED
21.
AI Agent Traps by Matija Franklin, Nenad Tomašev, Julian Jacobs, Joel Z. Leibo, Simon Osindero :: SSRN
22.
https://the-decoder.com/google-deepmind-study-exposes-six-traps-that-can-easily-hijack-autonomous-ai-agents-in-the-wild/
23.
https://www.securityweek.com/google-deepmind-researchers-map-web-attacks-against-ai-agents/
24.
Google DeepMind Maps Six 'AI Agent Traps' That Turn Websites Into Weapons Against Autonomous Agents | OpenClawAI
OpenClaw AI
Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Analyste sectorielle
Ezgi est titulaire d'un doctorat en administration des affaires avec une spécialisation en finance et travaille comme analyste sectorielle chez AIMultiple. Elle pilote la recherche et les analyses à l'intersection de la technologie et des affaires, avec une expertise couvrant la durabilité, l'analyse d'enquêtes et de sentiment, les applications d'agents IA dans la finance, l'optimisation pour les moteurs de réponse, la gestion des pare-feu et les technologies d'approvisionnement.
Voir le profil complet

Soyez le premier à commenter

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450