Servicios
Contáctanos

Trampas para Agentes de IA: 20 Incidentes de la Vida Real

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
actualizado el 18 de may. de 2026

La adopción de agentes de IA ha superado a la seguridad de los agentes de IA: el 82 % de las empresas ya despliegan agentes, pero solo el 44 % tiene políticas para protegerlos,1 y una de cada cinco organizaciones ya ha sufrido una brecha relacionada con agentes.2

Analizamos 20 incidentes de seguridad del mundo real y descubrimos que el control conductual y las trampas sistémicas (no la inyección de prompts) son ahora la causa de la mayoría de las brechas críticas. Asignamos cada incidente a una taxonomía de seis categorías (inyección de contenido, manipulación semántica, estado cognitivo, control conductual, sistémico y humano en el circuito) basada en datos de CVE e investigaciones de Microsoft y Google DeepMind.

Loading Chart

Incidentes reales de trampas para agentes de IA

1. Atraco de criptomonedas con código Morse de Bankrbot: El ataque introduce instrucciones mediante codificación Morse, explotando la brecha entre lo que inspeccionan las barreras de Grok (texto plano) y lo que decodifica y ejecuta (la instrucción traducida). La elección de codificación es específicamente una elusión de la capa de contenido: la directiva maliciosa es invisible para los filtros hasta que el propio agente la vuelve legible.3

2. Claude ClaudeBleed: Es una vulnerabilidad de seguridad crítica dentro de la extensión de Anthropic Claude para el navegador Chrome, que permite a actores maliciosos secuestrar el asistente de IA, robar datos sensibles y realizar acciones sin el consentimiento del usuario.4

3. Gemini CLI RCE: Una vulnerabilidad crítica de Ejecución Remota de Código (RCE), identificada como GHSA-wpqr-6v78-jr5g, tenía una puntuación CVSS máxima de 10.0. Fue descubierta en la CLI de Gemini y su GitHub Action asociada. Esta vulnerabilidad permitía a los atacantes obtener control total sobre el sistema que ejecutaba la herramienta, convirtiéndola en una amenaza crítica para la seguridad de la cadena de suministro.5

4. Antropic PocketOS: Un agente de Cursor impulsado por Claude, mientras investigaba un error en staging, descubrió de forma autónoma un token de Railway CLI sin alcance definido, infirió un endpoint de API y emitió un comando volumeDelete que destruyó la base de datos de producción y tres meses de copias de seguridad en 9 segundos.6

5. Ecosistema de IA de Código Abierto: CLI-Anything auto-genera archivos de capa de instrucciones SKILL.md que son consumidos por Claude Code, Codex, OpenClaw, Cursor y GitHub Copilot CLI. Las definiciones de habilidades envenenadas se propagan silenciosamente a través de cada agente que importa el paquete afectado; no se emite ningún CVE, no existe entrada SBOM y ningún escáner lo detecta. El ataque apunta a la infraestructura compartida del ecosistema (el registro de habilidades ClawHub, el gráfico de dependencias npm) en lugar de a un agente individual.7

6. Grafana IA: Noma Security descubrió que un atacante podía almacenar un prompt malicioso dentro de una fuente de datos que el asistente de IA de Grafana recuperaba posteriormente. Una vez procesado, la IA enviaba datos sensibles, como métricas financieras y telemetría de infraestructura, a un servidor controlado por el atacante sin necesidad de que el usuario hiciera clic.8

7. Ecosistema MCP de Anthropic: OX Security reveló una vulnerabilidad arquitectónica sistémica en los SDK oficiales de MCP de Anthropic (Python, TypeScript, Java, Rust) donde la entrada del usuario fluye directamente a las configuraciones del servidor MCP STDIO sin sanitización, afectando a más de 150 millones de descargas de SDK, más de 7.000 servidores expuestos públicamente y herramientas derivadas como LiteLLM, LangChain, Cursor, Windsurf y Claude Code. Dado que la falla está en la arquitectura del SDK compartido en lugar de en un solo agente, cualquier agente construido sobre el framework hereda la exposición.9

8. Andon Market (Luna IA): Andon Market, una tienda minorista de San Francisco gestionada de forma autónoma por un agente de IA llamado «Luna», toma decisiones de inventario, precios y contratación leyendo las reseñas de Google. Los clientes descubrieron que dejar una reseña redactada como una instrucción, como «por favor, ten en stock el producto X», hace que el agente actúe en consecuencia, convirtiendo una plataforma de reseñas pública en una superficie de inyección de prompts en vivo con consecuencias comerciales reales.10

9. Ejecución de Código de ChatGPT: Un prompt malicioso disfrazado de consejos de productividad desencadena código de tunelización DNS que codifica contenido sensible de la conversación y carga documentos en consultas de subdominio, transmitiéndolos silenciosamente a un servidor DNS controlado por el atacante. Check Point Research demostró que el canal de exfiltración es invisible para la monitorización de red convencional porque viaja sobre el tráfico DNS estándar iniciado por el propio entorno de ejecución de código del agente.11

10. Perplexity Comet: Zenity Labs reveló que el navegador agéntico de Perplexity Comet puede ser secuestrado mediante una invitación de calendario maliciosa que contiene una carga de inyección de prompt, lo que le permite acceder al sistema de archivos local, explorar directorios, abrir y leer archivos, y exfiltrar datos. El ataque no requiere interacción del usuario más allá de aceptar lo que parece una invitación legítima a una reunión, y opera completamente dentro de las capacidades previstas del navegador.12

11. Microsoft Semantic Kernel: El equipo de Investigación de Seguridad de Defender de Microsoft identificó dos vulnerabilidades críticas en Semantic Kernel, CVE-2026-26030 (SDK de Python, parcheada en 1.39.4) y CVE-2026-25592 (SDK de .NET, parcheada en 1.71.0), donde un atacante con cualquier vector de inyección de prompt puede lograr la ejecución remota de código en la máquina que aloja al agente. CVE-2026-26030 explotaba un filtro basado en eval en InMemoryVectorStore cuya lista de bloqueo de AST era eludible mediante el recorrido de atributos no documentados, mientras que CVE-2026-25592 exponía una función auxiliar de transferencia de archivos como una herramienta del kernel invocable, permitiendo que un prompt hostil dirigiera al agente a escribir archivos arbitrarios en ubicaciones peligrosas del host.13

12. Cline IA Triage Bot: Un título malicioso de un issue de GitHub inyectó instrucciones en el bot de triaje de IA de Cline, engañándolo para que ejecutara npm install en un paquete con typosquatting. Esto provocó envenenamiento de caché, robo de credenciales y una versión backdoor cline@2.3.0 que instaló silenciosamente el malware OpenClaw en aproximadamente 4.000 máquinas de desarrolladores.14

13. Extensiones de Escritorio de Claude: Investigadores de seguridad de LayerX descubrieron una vulnerabilidad CVSS 10/10 en las Extensiones de Escritorio de Claude que afecta a más de 10.000 usuarios, donde un atacante puede incrustar instrucciones maliciosas dentro de un evento de calendario que Claude procesa cuando un usuario pregunta sobre su agenda. El agente ejecuta entonces automáticamente código arbitrario en la máquina del usuario sin ninguna interacción adicional, sin indicación visible de que algo haya ocurrido.15

14. Ecosistema npm/MCP: Socket descubrió SANDWORM_MODE, un gusano npm auto-replicante distribuido a través de 19 paquetes con typosquatting que instala un servidor MCP no autorizado con cargas de inyección de prompt incrustadas en las descripciones de las herramientas, permitiéndole exfiltrar credenciales de los asistentes de codificación con IA. Dado que el gusano se propaga a través del registro de paquetes compartido, una única infección siembra el ataque en cada desarrollador que instala una dependencia afectada.16

15. Snowflake Cortex Code: PromptArmor descubrió que el sistema de validación de comandos de Cortex Code no evaluaba los comandos dentro de expresiones de sustitución de procesos, lo que permitía que una inyección de prompt maliciosa oculta en un README de un repositorio de GitHub ejecutara comandos de shell arbitrarios sin activar el paso de aprobación de humano en el circuito. La instrucción inyectada también manipuló al modelo para que estableciera una bandera de ejecución sin sandbox, lo que provocó que el comando malicioso se ejecutara completamente fuera del sandbox sin solicitar el consentimiento del usuario.

16. Agentes MetaGPT / LangChain: MemoryGraft es un novedoso ataque de inyección indirecta que compromete el comportamiento del agente no mediante jailbreaks inmediatos, sino implantando «experiencias exitosas» maliciosas en la memoria a largo plazo del agente, explotando su tendencia a replicar patrones de tareas exitosas recuperadas. A diferencia de las inyecciones de prompt tradicionales, que son transitorias, o el envenenamiento estándar de RAG, que apunta al conocimiento factual, MemoryGraft corrompe todas las sesiones futuras sin ninguna inyección a nivel de sesión, requiriendo que un atacante proporcione artefactos de ingesta de apariencia inocua que el agente lee durante la ejecución normal.17

17. ServiceNow Now Assist: En Now Assist de ServiceNow, la configuración predeterminada permite que los agentes de IA descubran y recluten autónomamente a otros agentes; un prompt malicioso incrustado en datos procesados por un agente de bajo privilegio puede instruirle para que llame a un agente más poderoso para robar datos, modificar registros o escalar privilegios. El resultado fue una escalada de privilegios y exposición de datos impulsada completamente por la confianza entre agentes.18

18. Apple Intelligence: Caracteres maliciosos Unicode RIGHT-TO-LEFT OVERRIDE ocultan instrucciones dañinas escribiéndolas al revés, de modo que se renderizan correctamente en pantalla pero permanecen invertidas donde los filtros de seguridad de Apple las inspeccionan, eludiendo las tres capas de barreras de protección en el dispositivo. La técnica tuvo éxito en el 76 % de los casos de prueba en aproximadamente 200 millones de dispositivos afectados.19

19. Google Gemini (Calendario): Instrucciones ocultas incrustadas en las descripciones de eventos de calendario permanecen latentes en el contexto de Gemini hasta que un usuario pregunta sobre su agenda, momento en el cual la carga se activa, resumiendo contenidos privados de reuniones y escribiéndolos en un nuevo evento de calendario visible para el atacante. El ataque explota la integración de Gemini con los datos del calendario, convirtiendo datos personales estructurados en una superficie de activación sin requerir que la víctima haga clic en nada.20

20. Microsoft 365 Copilot: EchoLeak (CVE-2025-32711), descubierto por Aim Security, es el primer caso conocido de inyección de prompt utilizada para causar una exfiltración de datos concreta en un sistema de IA en producción. Es un único correo electrónico diseñado que obliga a Copilot a acceder a archivos internos y transmitir su contenido a un servidor controlado por el atacante sin ninguna interacción del usuario. El ataque encadena cuatro elusiones: evadir el clasificador XPIA de Microsoft, eludir la redacción de enlaces con Markdown de estilo de referencia, explotar imágenes auto-recuperadas y abusar de un proxy de Microsoft Teams permitido por la política de seguridad de contenido.

¿Qué son las trampas para agentes de IA?

Las trampas para agentes de IA son contenidos adversarios incrustados en entornos digitales y diseñados para manipular, engañar o explotar a los agentes de IA autónomos que interactúan con esos entornos.21

La idea central es que los agentes autónomos procesan el contenido web en capas que los humanos no perciben. Los atacantes pueden incrustar instrucciones maliciosas en comentarios HTML, texto posicionado con CSS o con opacidad cero, atributos de metadatos y datos esteganográficos codificados en archivos de imagen.22 Ninguna de estas capas es normalmente visible para un revisor humano; un agente que analiza la misma página trata el contenido encontrado en ellas como una entrada igualmente válida al contenido renderizado visiblemente en pantalla. Los investigadores de Google DeepMind señalan esto como una asimetría fundamental: los atacantes pueden calibrar los ataques para explotar las capacidades de seguimiento de instrucciones, encadenamiento de herramientas y priorización de objetivos de un agente precisamente porque esas son las capacidades que hacen que los agentes sean operativamente útiles.23

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Seis categorías de ataque de trampas para agentes de IA

Los investigadores han identificado 6 categorías de trampas para agentes de IA que los adversarios pueden explotar para comprometer sistemas autónomos:21

Trampas de inyección de contenido

Explotan la brecha entre la percepción humana, el análisis automático y el renderizado dinámico para introducir entradas maliciosas que eluden al agente.

La superficie de ataque abarca varios vectores de inyección distintos. Las instrucciones ocultas incrustadas en comentarios HTML, como `<!– SYSTEM: Ignorar instrucciones anteriores –>`, aparecen en el código fuente de la página pero nunca en la vista renderizada. El posicionamiento fuera de pantalla con CSS, usando `position: absolute; left: -9999px` o equivalente, coloca texto en coordenadas fuera de cualquier viewport dejándolo completamente analizable por agentes que procesan el contenido del modelo de objeto del documento. Los atributos de accesibilidad, específicamente `aria-label` y el marcado ARIA relacionado, transportan texto que los agentes interpretan como contexto semántico; inyectar directivas adversarias allí las coloca dentro del árbol de accesibilidad sin ninguna salida visible. Un cuarto vector utiliza codificación esteganográfica: cargas maliciosas codificadas en datos de píxeles de imagen a valores imperceptibles para la visión humana pero legibles por agentes que procesan metadatos de imagen o aplican análisis a nivel de píxel.

Trampas de manipulación semántica

Corrompen la cadena de razonamiento del agente y los procesos internos de verificación, llevándolo a extraer conclusiones erróneas a partir de entradas aparentemente válidas.

Tres mecanismos impulsan esta categoría. El primero es el sesgo en la redacción y la preparación contextual: cargar el texto circundante con lenguaje que ancla la interpretación del agente del contenido procesado posteriormente. El segundo es la saturación de lenguaje autoritativo, inundando documentos con frases como «estándar de la industria», «de grado empresarial» o «recomendado por profesionales líderes» para explotar la asociación aprendida del modelo entre dicho lenguaje y fuentes creíbles y confiables.22 El tercer mecanismo es el efecto de pérdida en el medio, una debilidad estructural en los LLM basados en transformadores donde el rendimiento del modelo en tareas de recuperación y síntesis se degrada cuando la información relevante se posiciona en el medio de una ventana de contexto larga en lugar de al principio o al final.

Trampas de estado cognitivo

Apuntan a la memoria a largo plazo del agente, las bases de conocimiento y las políticas conductuales aprendidas para envenenar la toma de decisiones futura.

Las tres variantes principales son el envenenamiento directo de RAG, el envenenamiento latente de memoria y los ejemplos few-shot adversarios en el aprendizaje contextual.

El envenenamiento directo de RAG inyecta información falsa en corpus de documentos indexados que los agentes consultan durante la generación aumentada por recuperación. El envenenamiento de memoria es más avanzado. Un atacante almacena datos de apariencia inocua en la memoria persistente de un agente durante interacciones rutinarias. Los datos almacenados no producen ningún efecto detectable hasta que un contexto futuro específico los activa, momento en el cual modifican el comportamiento del agente de manera que parece no tener un desencadenante causal reciente. El few-shot adversario consiste en inyectar pares de demostración cuidadosamente diseñados en una ventana de contexto para que el agente adopte el patrón implícito en esos ejemplos. La investigación sobre desencadenantes de puerta trasera en demostraciones encontró tasas de éxito de ataque promedio del 95 por ciento en modelos de escala variable bajo este enfoque.

Trampas de control conductual

Las trampas de control conductual son la categoría con mayores consecuencias operativas en la taxonomía. Apuntan a lo que los agentes hacen en lugar de lo que perciben o concluyen, dando a los atacantes influencia directa sobre la ejecución de herramientas, operaciones de archivos, solicitudes de red y comunicaciones entre agentes.

Trampas sistémicas

Las trampas sistémicas no apuntan a agentes individuales. Apuntan a las propiedades del ecosistema que emergen cuando muchos agentes de diseño similar operan sobre fuentes de datos compartidas, ejecutan patrones de razonamiento similares y toman acciones que retroalimentan el entorno que otros agentes leen.22

La categoría más amplia abarca tres mecanismos distintos. El primero es el diseño de trampas de congestión: fabricar señales de escasez o demanda que hacen que múltiples agentes ejecuten comportamientos sincronizados de adquisición de recursos, creando fallos coordinados sin comunicación directa entre agentes. El segundo es la cascada de interdependencia: explotar bucles de retroalimentación en sistemas multiagente donde la salida de cada agente se convierte en entrada para otros, de modo que una única señal corrompida se propaga y amplifica a través de la red. El tercero es la fragmentación composicional de la carga: distribuir componentes de ataque a través de múltiples fuentes individualmente inofensivas que se reconstituyen en una carga maliciosa funcional cuando son agregadas por un agente durante una tarea de recuperación o síntesis.

Trampas de humano en el circuito

Las trampas de humano en el circuito son la categoría más sutil de la taxonomía y apuntan a la capa de supervisión que se trata convencionalmente como una salvaguarda. En lugar de eludir la revisión humana, estas trampas la explotan: el agente comprometido produce salidas específicamente diseñadas para obtener la aprobación humana para acciones que el humano rechazaría si se describieran con precisión.24

El mecanismo central es la summarización engañosa. Un agente con acceso de escritura a su propia capa de salida puede describir sus acciones de una manera que presente operaciones destructivas o no autorizadas como mantenimiento rutinario.

Lecturas adicionales

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Cita esta investigación

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Ezgi Arslan, PhD. (2026) - "Trampas para Agentes de IA: 20 Incidentes de la Vida Real". Publicado en línea en AIMultiple.com. Recuperado el 18 de Mayo de 2026, de: https://aimultiple.com/ai-agent-traps [Recurso en línea]

PhD., E. A. (2026, 18 de Mayo). Trampas para Agentes de IA: 20 Incidentes de la Vida Real. AIMultiple. https://aimultiple.com/ai-agent-traps

@misc{phd2026,
  author = {PhD., Ezgi Arslan,},
  title  = {{Trampas para Agentes de IA: 20 Incidentes de la Vida Real}},
  year   = {2026},
  month  = may,
  howpublished    = {\url{https://aimultiple.com/ai-agent-traps}},
  note   = {AIMultiple. Recuperado el 18 de Mayo de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 20 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene un archivo CSV.

Última actualización: 17 de Agosto de 2026
Descargar

Enlaces de referencia

1.
SailPoint research highlights rapid AI agent adoption, driving urgent need for evolved security | SailPoint
SailPoint
2.
The State of AI Agent Security: 73% of CISOs fear AI agent risks but only 30% are ready
Cision PR Newswire
3.
The Grok Morse Code Heist: When Prompt Injection Meets Excessive Agency | NeuralTrust
NeuralTrust
4.
Vulnerability in Claude Extension for Chrome Exposes AI Agent to Takeover - SecurityWeek
SecurityWeek
5.
Google Fixes CVSS 10 Gemini CLI CI RCE and Cursor Flaws Enable Code Execution
6.
‘It took nine seconds’: Claude AI agent deletes company’s entire database - Yahoo News Canada
The Independent
7.
CLI-Anything Exposes Security Risks in Open-Source AI Ecosystems | Welcome.AI
venturebeat.com
8.
GrafanaGhost: The Phantom Stealing Your Data | Noma Security
Noma Security
9.
Critical Anthropic’s MCP Vulnerability Enables Remote Code Execution Attacks | Cryptika Cybersecurity
Cryptika Cybersecurity
10.
Prompt Injection - The critical vulnerability lurking beneath the AI hype
11.
OpenAI Patches ChatGPT Data Exfiltration Flaw and Codex GitHub Token Vulnerability
12.
PerplexedBrowser: Perplexity’s Agent Browser Can Leak Your PC's Local Files | Zenity Labs
Zenity Labs
13.
How Prompt Injection Attacks Compromise AI Agents in 2026
Atlan
14.
Cline CLI 2.3.0 Supply Chain Attack Installed OpenClaw on Developer Systems
15.
10K Claude Desktop Users Exposed by Zero-Click Vulnerability | eSecurity Planet
eSecurityPlanet
16.
SANDWORM_MODE: npm Supply Chain Attack Targeting AI Development Tools | Hive Pro
Hive Pro
17.
https://arxiv.org/pdf/2512.16962
18.
Second-order prompt injection can turn AI into a malicious insider | TechRadar
TechRadar
19.
On-device Apple Intelligence vulnerable to prompt injection
AppleInsider
20.
Hackers Hijacked Google’s Gemini AI With a Poisoned Calendar Invite to Take Over a Smart Home | WIRED
WIRED
21.
AI Agent Traps by Matija Franklin, Nenad Tomašev, Julian Jacobs, Joel Z. Leibo, Simon Osindero :: SSRN
22.
https://the-decoder.com/google-deepmind-study-exposes-six-traps-that-can-easily-hijack-autonomous-ai-agents-in-the-wild/
23.
https://www.securityweek.com/google-deepmind-researchers-map-web-attacks-against-ai-agents/
24.
Google DeepMind Maps Six 'AI Agent Traps' That Turn Websites Into Weapons Against Autonomous Agents | OpenClawAI
OpenClaw AI
Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Analista de la industria
Ezgi tiene un doctorado en Administración de Empresas con especialización en finanzas y se desempeña como analista de la industria en AIMultiple. Impulsa la investigación y los conocimientos en la intersección de la tecnología y los negocios, con experiencia en sostenibilidad, análisis de encuestas y de sentimiento, aplicaciones de agentes de IA en finanzas, optimización de motores de respuestas, gestión de firewalls y tecnologías de adquisiciones.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450