Servizi
Contattaci

Trappole per Agenti IA: 20 Incidenti Reali

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
aggiornato il 18 mag. 2026

L'adozione degli agenti IA ha superato la sicurezza degli agenti IA: l'82% delle aziende ora distribuisce agenti, ma solo il 44% dispone di policy per proteggerli,1 e un'organizzazione su cinque ha già subito una violazione legata agli agenti.2

Abbiamo analizzato 20 incidenti di sicurezza reali e abbiamo scoperto che le trappole comportamentali e sistemiche (non l'iniezione di prompt) sono oggi la causa della maggior parte delle violazioni critiche. Abbiamo mappato ogni incidente a una tassonomia di sei categorie (iniezione di contenuti, manipolazione semantica, stato cognitivo, controllo comportamentale, sistemico e human-in-the-loop) basata sui dati CVE e sulla ricerca di Microsoft e Google DeepMind.

Loading Chart

Incidenti reali di trappole per agenti IA

1. Bankrbot — Furto di Criptovalute tramite Codice Morse: L'attacco introduce istruzioni attraverso la codifica Morse, sfruttando il divario tra ciò che i filtri di sicurezza di Grok ispezionano (testo in chiaro) e ciò che decodifica ed esegue (l'istruzione tradotta). La scelta della codifica è specificamente un bypass a livello di contenuto: la direttiva malevola è invisibile ai filtri finché l'agente stesso non la rende leggibile.3

2. Claude ClaudeBleed: È una vulnerabilità di sicurezza critica nell'estensione per browser Chrome di Anthropic Claude, che consente ad attori malevoli di dirottare l'assistente IA, rubare dati sensibili ed eseguire azioni senza il consenso dell'utente.4

3. Gemini CLI RCE: Una vulnerabilità critica di Esecuzione Remota di Codice (RCE), identificata come GHSA-wpqr-6v78-jr5g, aveva un punteggio CVSS massimo di 10.0. È stata scoperta nella CLI di Gemini e nella sua GitHub Action associata. Questa vulnerabilità consentiva agli attaccanti di ottenere il pieno controllo del sistema che eseguiva lo strumento, rendendola una minaccia critica per la sicurezza della supply chain.5

4. Antropic PocketOS: Un agente Cursor basato su Claude, mentre indagava su un bug di staging, ha scoperto autonomamente un token Railway CLI non limitato, ha dedotto un endpoint API e ha emesso un comando volumeDelete che ha distrutto il database di produzione e tre mesi di backup in 9 secondi.6

5. Ecosistema IA Open-Source: CLI-Anything auto-genera file di livello istruzione SKILL.md consumati da Claude Code, Codex, OpenClaw, Cursor e GitHub Copilot CLI. Le definizioni di skill compromesse si propagano silenziosamente su ogni agente che importa il pacchetto interessato; non viene emesso alcun CVE, non esiste alcuna voce SBOM e nessuno scanner le rileva. L'attacco prende di mira l'infrastruttura condivisa dell'ecosistema (il registro delle skill ClawHub, il grafo delle dipendenze npm) piuttosto che un singolo agente.7

6. Grafana IA: Noma Security ha scoperto che un attaccante poteva memorizzare un prompt malevolo all'interno di un'origine dati che l'assistente IA di Grafana recuperava successivamente. Una volta elaborata, l'IA inviava dati sensibili, come metriche finanziarie e telemetria dell'infrastruttura, a un server controllato dall'attaccante senza richiedere alcun clic dell'utente.8

7. Ecosistema Anthropic MCP: OX Security ha rivelato una vulnerabilità architetturale sistemica negli Anthropic MCP SDK ufficiali (Python, TypeScript, Java, Rust) in cui l'input utente fluisce direttamente nelle configurazioni del server STDIO MCP senza sanitizzazione, interessando oltre 150 milioni di download degli SDK, più di 7.000 server pubblicamente esposti e strumenti a valle tra cui LiteLLM, LangChain, Cursor, Windsurf e Claude Code. Poiché il difetto risiede nell'architettura condivisa degli SDK anziché in un singolo agente, qualsiasi agente costruito sul framework eredita l'esposizione.9

8. Andon Market (Luna IA): Andon Market, un negozio al dettaglio di San Francisco gestito autonomamente da un agente IA chiamato "Luna", prende decisioni su inventario, prezzi e assunzioni leggendo le recensioni di Google. I clienti hanno scoperto che lasciare una recensione formulata come istruzione, ad esempio "si prega di rifornire il prodotto X", induce l'agente ad agire di conseguenza, trasformando una piattaforma di recensioni pubblica in una superficie di iniezione di prompt in tempo reale con conseguenze aziendali reali.10

9. Esecuzione Codice ChatGPT: Un prompt malevolo camuffato da suggerimenti di produttività attiva codice di tunneling DNS che codifica contenuti sensibili delle conversazioni e carica documenti in query di sottodominio, trasmettendoli silenziosamente a un server DNS controllato dall'attaccante. Check Point Research ha dimostrato che il canale di esfiltrazione è invisibile al monitoraggio di rete convenzionale perché viaggia sul traffico DNS standard avviato dall'ambiente di esecuzione del codice dell'agente stesso.11

10. Perplexity Comet: Zenity Labs ha rivelato che il browser agentico di Perplexity Comet può essere dirottato tramite un invito di calendario malevolo contenente un payload di iniezione di prompt, inducendolo ad accedere al file system locale, esplorare directory, aprire e leggere file ed esfiltrare dati. L'attacco non richiede alcuna interazione dell'utente oltre all'accettazione di quello che sembra un invito a una riunione legittima, e opera interamente entro le capacità previste del browser.12

11. Microsoft Semantic Kernel: Il Defender Security Research Team di Microsoft ha identificato due vulnerabilità critiche in Semantic Kernel, CVE-2026-26030 (SDK Python, corretta nella versione 1.39.4) e CVE-2026-25592 (SDK .NET, corretta nella versione 1.71.0), in cui un attaccante con un qualsiasi vettore di iniezione di prompt può ottenere l'esecuzione remota di codice sulla macchina che ospita l'agente. CVE-2026-26030 sfruttava un filtro basato su eval in InMemoryVectorStore la cui blocklist AST era aggirabile tramite l'attraversamento di attributi non documentati, mentre CVE-2026-25592 esponeva una funzione helper di trasferimento file come strumento del kernel richiamabile, consentendo a un prompt ostile di indirizzare l'agente a scrivere file arbitrari in posizioni pericolose dell'host.13

12. Cline IA Triage Bot: Un titolo di issue GitHub malevolo ha iniettato istruzioni nel bot di triage IA di Cline, inducendolo a eseguire npm install su un pacchetto typosquattato. Ciò ha portato ad avvelenamento della cache, furto di credenziali e un rilascio cline@2.3.0 con backdoor che ha installato silenziosamente il malware OpenClaw su circa 4.000 macchine di sviluppo.14

13. Claude Desktop Extensions: I ricercatori di sicurezza di LayerX hanno scoperto una vulnerabilità CVSS 10/10 nelle estensioni desktop di Claude che colpisce oltre 10.000 utenti, in cui un attaccante può incorporare istruzioni malevole all'interno di un evento del calendario che Claude elabora quando un utente chiede informazioni sui propri impegni. L'agente esegue quindi automaticamente codice arbitrario sulla macchina dell'utente senza alcuna ulteriore interazione, senza alcuna indicazione visibile che qualcosa sia accaduto.15

14. npm/MCP Ecosystem: Socket ha scoperto SANDWORM_MODE, un worm npm auto-replicante distribuito attraverso 19 pacchetti typosquattati che installa un server MCP rogue con payload di iniezione di prompt incorporati nelle descrizioni degli strumenti, consentendogli di esfiltrare credenziali dagli assistenti di codifica IA. Poiché il worm si propaga attraverso il registro dei pacchetti condiviso, una singola infezione diffonde l'attacco a ogni sviluppatore che installa una dipendenza interessata.16

15. Snowflake Cortex Code: PromptArmor ha scoperto che il sistema di validazione dei comandi di Cortex Code non riusciva a valutare i comandi all'interno di espressioni di sostituzione di processo, consentendo a un'iniezione di prompt malevola nascosta in un README di un repository GitHub di eseguire comandi shell arbitrari senza attivare il passaggio di approvazione human-in-the-loop. L'istruzione iniettata manipolava anche il modello inducendolo a impostare un flag di esecuzione non sandboxed, facendo sì che il comando malevolo venisse eseguito completamente al di fuori del sandbox senza richiedere il consenso dell'utente.

16. Agenti MetaGPT / LangChain: MemoryGraft è un nuovo attacco a iniezione indiretta che compromette il comportamento dell'agente non attraverso jailbreak immediati ma impiantando "esperienze di successo" malevole nella memoria a lungo termine dell'agente, sfruttando la sua tendenza a replicare pattern da attività di successo recuperate. A differenza delle tradizionali iniezioni di prompt, che sono transitorie, o dell'avvelenamento standard RAG, che prende di mira la conoscenza fattuale, MemoryGraft corrompe tutte le sessioni future senza alcuna iniezione a livello di sessione, richiedendo a un attaccante di fornire artefatti a livello di ingestione apparentemente innocui che l'agente legge durante la normale esecuzione.17

17. ServiceNow Now Assist: In Now Assist di ServiceNow, le impostazioni predefinite consentono agli agenti IA di scoprire e reclutare autonomamente altri agenti; un prompt malevolo incorporato nei dati elaborati da un agente con privilegi ridotti può istruirlo a chiamare un agente più potente per rubare dati, modificare record o escalare privilegi. Il risultato è stato un'escalation di privilegi e un'esposizione dei dati guidata interamente dalla fiducia inter-agente.18

18. Apple Intelligence: Caratteri Unicode RIGHT-TO-LEFT OVERRIDE malevoli nascondono istruzioni dannose scrivendole al contrario, in modo che appaiano corrette sullo schermo ma rimangano invertite dove i filtri di sicurezza di Apple le ispezionano, aggirando tutti e tre i livelli di protezione su dispositivo. La tecnica ha avuto successo nel 76% dei casi di test su circa 200 milioni di dispositivi interessati.19

19. Google Gemini (Calendario): Istruzioni nascoste incorporate nelle descrizioni degli eventi del calendario rimangono dormienti nel contesto di Gemini finché un utente non chiede informazioni sui propri impegni, momento in cui il payload si attiva, riassumendo i contenuti privati delle riunioni e scrivendoli in un nuovo evento del calendario visibile all'attaccante. L'attacco sfrutta l'integrazione di Gemini con i dati del calendario, trasformando dati personali strutturati in una superficie di attivazione senza richiedere alla vittima di cliccare alcunché.20

20. Microsoft 365 Copilot: EchoLeak (CVE-2025-32711), scoperto da Aim Security, è il primo caso noto di iniezione di prompt utilizzata come arma per causare esfiltrazione concreta di dati in un sistema IA in produzione. È una singola email creata ad arte che costringe Copilot ad accedere a file interni e trasmetterne i contenuti a un server controllato dall'attaccante senza alcuna interazione dell'utente. L'attacco concatena quattro bypass: eludere il classificatore XPIA di Microsoft, aggirare la redazione dei link con Markdown in stile reference, sfruttare le immagini auto-recuperate e abusare di un proxy Microsoft Teams consentito dalla policy di sicurezza dei contenuti.

Cosa sono le trappole per agenti IA?

Le trappole per agenti IA sono contenuti avversari incorporati in ambienti digitali e progettati per manipolare, ingannare o sfruttare gli agenti IA autonomi che interagiscono con tali ambienti.21

L'intuizione centrale è che gli agenti autonomi elaborano i contenuti web a livelli che gli umani non percepiscono. Gli attaccanti possono incorporare istruzioni malevole nei commenti HTML, nel testo posizionato con CSS o a opacità zero, negli attributi dei metadati e nei dati steganografici codificati nei file immagine.22 Nessuno di questi livelli è normalmente visibile a un revisore umano; un agente che analizza la stessa pagina tratta il contenuto trovato in essi come input ugualmente valido rispetto al contenuto reso visibile sullo schermo. I ricercatori di Google DeepMind osservano questa come un'asimmetria fondamentale: gli attaccanti possono calibrare gli attacchi per sfruttare le capacità di seguire istruzioni, concatenare strumenti e dare priorità agli obiettivi di un agente proprio perché queste sono le capacità che rendono gli agenti operativamente utili.23

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Sei categorie di attacco delle trappole per agenti IA

I ricercatori hanno identificato 6 categorie di trappole per agenti IA che gli avversari possono sfruttare per compromettere i sistemi autonomi:21

Trappole di iniezione di contenuti

Sfruttano il divario tra percezione umana, analisi automatica e rendering dinamico per introdurre input malevoli oltre i controlli dell'agente.

La superficie di attacco copre diversi vettori di iniezione distinti. Istruzioni nascoste incorporate nei commenti HTML, come `<!– SYSTEM: Ignora le istruzioni precedenti –>`, appaiono nel sorgente della pagina ma mai nella vista renderizzata. Il posizionamento fuori schermo tramite CSS, usando `position: absolute; left: -9999px` o equivalente, posiziona il testo a coordinate esterne a qualsiasi viewport lasciandolo completamente analizzabile dagli agenti che elaborano il contenuto del modello a oggetti del documento. Gli attributi di accessibilità, in particolare `aria-label` e il relativo markup ARIA, contengono testo che gli agenti interpretano come contesto semantico; iniettare direttive avversarie in essi le colloca all'interno dell'albero di accessibilità senza alcun output visibile. Un quarto vettore utilizza la codifica steganografica: payload malevoli codificati nei dati dei pixel delle immagini a valori impercettibili alla visione umana ma leggibili dagli agenti che elaborano i metadati delle immagini o applicano analisi a livello di pixel.

Trappole di manipolazione semantica

Corrompono la catena di ragionamento dell'agente e i processi di verifica interna, portandolo a trarre conclusioni errate da input apparentemente validi.

Tre meccanismi guidano questa categoria. Il primo è la formulazione distorta e il priming contestuale: caricare il testo circostante con un linguaggio che ancora l'interpretazione dell'agente del contenuto successivamente elaborato. Il secondo è la saturazione con linguaggio autorevole, inondando i documenti con frasi come "standard di settore", "di livello enterprise" o "raccomandato dai principali professionisti" per sfruttare l'associazione appresa dal modello tra tale linguaggio e fonti credibili e affidabili.22 Il terzo meccanismo è l'effetto lost-in-the-middle, una debolezza strutturale degli LLM basati su transformer in cui le prestazioni del modello su compiti di recupero e sintesi si degradano quando le informazioni rilevanti sono posizionate al centro di una finestra di contesto lunga piuttosto che all'inizio o alla fine.

Trappole dello stato cognitivo

Prendono di mira la memoria a lungo termine, le basi di conoscenza e le policy comportamentali apprese dell'agente per avvelenare il processo decisionale futuro.

Le tre varianti principali sono l'avvelenamento diretto RAG, l'avvelenamento latente della memoria e gli esempi few-shot avversari nell'apprendimento contestuale.

L'avvelenamento diretto RAG inietta informazioni false nei corpora di documenti indicizzati che gli agenti consultano durante la generazione aumentata da recupero. L'avvelenamento della memoria è più avanzato. Un attaccante memorizza dati apparentemente innocui nella memoria persistente di un agente durante le interazioni di routine. I dati memorizzati non producono alcun effetto rilevabile finché uno specifico contesto futuro non li attiva, momento in cui modificano il comportamento dell'agente in modi che sembrano non avere alcun fattore scatenante causale recente. L'avversario few-shot consiste nell'iniettare coppie di dimostrazione accuratamente create in una finestra di contesto in modo che l'agente adotti il pattern implicito in quegli esempi. La ricerca sui trigger backdoor nelle dimostrazioni ha rilevato tassi medi di successo degli attacchi del 95 percento su modelli di varie dimensioni con questo approccio.

Trappole di controllo comportamentale

Le trappole di controllo comportamentale sono la categoria più operativamente consequenziale nella tassonomia. Prendono di mira ciò che gli agenti fanno piuttosto che ciò che percepiscono o concludono, dando agli attaccanti un'influenza diretta sull'esecuzione degli strumenti, sulle operazioni sui file, sulle richieste di rete e sulle comunicazioni inter-agente.

Trappole sistemiche

Le trappole sistemiche non prendono di mira i singoli agenti. Prendono di mira le proprietà dell'ecosistema che emergono quando molti agenti di progettazione simile operano su fonti di dati condivise, eseguono pattern di ragionamento simili e intraprendono azioni che si ripercuotono sull'ambiente che altri agenti leggono.22

La categoria più ampia comprende tre meccanismi distinti. Il primo è la progettazione di trappole di congestione: fabbricare segnali di scarsità o domanda che inducono più agenti a eseguire comportamenti sincronizzati di acquisizione delle risorse, creando guasti coordinati senza comunicazione diretta tra agenti. Il secondo è la cascata di interdipendenza: sfruttare i cicli di feedback nei sistemi multi-agente in cui l'output di ogni agente diventa input per altri, in modo che un singolo segnale corrotto si propaghi e si amplifichi attraverso la rete. Il terzo è la frammentazione compositiva del payload: distribuire i componenti dell'attacco su più fonti individualmente innocue che si ricostituiscono in un payload malevolo funzionale quando aggregate da un agente durante un compito di recupero o sintesi.

Trappole human-in-the-loop

Le trappole human-in-the-loop sono la categoria più sottile nella tassonomia e prendono di mira il livello di supervisione che è convenzionalmente trattato come una salvaguardia. Invece di aggirare la revisione umana, queste trappole la sfruttano: l'agente compromesso produce output specificamente progettati per ottenere l'approvazione umana per azioni che l'umano rifiuterebbe se descritte accuratamente.24

Il meccanismo principale è la sintesi ingannevole. Un agente con accesso in scrittura al proprio livello di output può descrivere le proprie azioni in un modo che inquadra operazioni distruttive o non autorizzate come manutenzione di routine.

Ulteriori letture

Non perderti i nostri benchmark e approfondimenti basati sui dati. Il pulsante apre Google; selezionare AIMultiple conferma che desideri vedere AIMultiple più spesso nei risultati di ricerca di Google.
GoogleAggiungi come fonte preferita

Cita questa ricerca

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Ezgi Arslan, PhD. (2026) - "Trappole per Agenti IA: 20 Incidenti Reali". Pubblicato online su AIMultiple.com. Consultato il 18 Maggio 2026, da: https://aimultiple.com/ai-agent-traps [Risorsa online]

PhD., E. A. (2026, 18 Maggio). Trappole per Agenti IA: 20 Incidenti Reali. AIMultiple. https://aimultiple.com/ai-agent-traps

@misc{phd2026,
  author = {PhD., Ezgi Arslan,},
  title  = {{Trappole per Agenti IA: 20 Incidenti Reali}},
  year   = {2026},
  month  = may,
  howpublished    = {\url{https://aimultiple.com/ai-agent-traps}},
  note   = {AIMultiple. Consultato il 18 Maggio 2026}
}
Scarica tutti i dati

Risultati e timestamp di 20 punti dati. Scarica i dati utilizzati in questo articolo come file ZIP contenente un file CSV.

Ultimo aggiornamento: 17 Agosto 2026
Scarica

Collegamenti di riferimento

1.
SailPoint research highlights rapid AI agent adoption, driving urgent need for evolved security | SailPoint
SailPoint
2.
The State of AI Agent Security: 73% of CISOs fear AI agent risks but only 30% are ready
Cision PR Newswire
3.
The Grok Morse Code Heist: When Prompt Injection Meets Excessive Agency | NeuralTrust
NeuralTrust
4.
Vulnerability in Claude Extension for Chrome Exposes AI Agent to Takeover - SecurityWeek
SecurityWeek
5.
Google Fixes CVSS 10 Gemini CLI CI RCE and Cursor Flaws Enable Code Execution
6.
‘It took nine seconds’: Claude AI agent deletes company’s entire database - Yahoo News Canada
The Independent
7.
CLI-Anything Exposes Security Risks in Open-Source AI Ecosystems | Welcome.AI
venturebeat.com
8.
GrafanaGhost: The Phantom Stealing Your Data | Noma Security
Noma Security
9.
Critical Anthropic’s MCP Vulnerability Enables Remote Code Execution Attacks | Cryptika Cybersecurity
Cryptika Cybersecurity
10.
Prompt Injection - The critical vulnerability lurking beneath the AI hype
11.
OpenAI Patches ChatGPT Data Exfiltration Flaw and Codex GitHub Token Vulnerability
12.
PerplexedBrowser: Perplexity’s Agent Browser Can Leak Your PC's Local Files | Zenity Labs
Zenity Labs
13.
How Prompt Injection Attacks Compromise AI Agents in 2026
Atlan
14.
Cline CLI 2.3.0 Supply Chain Attack Installed OpenClaw on Developer Systems
15.
10K Claude Desktop Users Exposed by Zero-Click Vulnerability | eSecurity Planet
eSecurityPlanet
16.
SANDWORM_MODE: npm Supply Chain Attack Targeting AI Development Tools | Hive Pro
Hive Pro
17.
https://arxiv.org/pdf/2512.16962
18.
Second-order prompt injection can turn AI into a malicious insider | TechRadar
TechRadar
19.
On-device Apple Intelligence vulnerable to prompt injection
AppleInsider
20.
Hackers Hijacked Google’s Gemini AI With a Poisoned Calendar Invite to Take Over a Smart Home | WIRED
WIRED
21.
AI Agent Traps by Matija Franklin, Nenad Tomašev, Julian Jacobs, Joel Z. Leibo, Simon Osindero :: SSRN
22.
https://the-decoder.com/google-deepmind-study-exposes-six-traps-that-can-easily-hijack-autonomous-ai-agents-in-the-wild/
23.
https://www.securityweek.com/google-deepmind-researchers-map-web-attacks-against-ai-agents/
24.
Google DeepMind Maps Six 'AI Agent Traps' That Turn Websites Into Weapons Against Autonomous Agents | OpenClawAI
OpenClaw AI
Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Analista di settore
Ezgi ha conseguito un dottorato di ricerca in Economia aziendale con specializzazione in finanza e lavora come Analista di settore presso AIMultiple. Guida la ricerca e gli approfondimenti all'intersezione tra tecnologia e business, con competenze che spaziano dalla sostenibilità all'analisi di sondaggi e del sentiment, alle applicazioni di agenti IA nella finanza, all'ottimizzazione per i motori di risposta, alla gestione dei firewall e alle tecnologie di procurement.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450