La adopción de agentes de IA ha superado a la seguridad de los agentes de IA: el 82 % de las empresas ya despliegan agentes, pero solo el 44 % tiene políticas para protegerlos,1 y una de cada cinco organizaciones ya ha sufrido una brecha relacionada con agentes.2
Analizamos 20 incidentes de seguridad del mundo real y descubrimos que el control conductual y las trampas sistémicas (no la inyección de prompts) son ahora la causa de la mayoría de las brechas críticas. Asignamos cada incidente a una taxonomía de seis categorías (inyección de contenido, manipulación semántica, estado cognitivo, control conductual, sistémico y humano en el circuito) basada en datos de CVE e investigaciones de Microsoft y Google DeepMind.
Incidentes reales de trampas para agentes de IA
1. Atraco de criptomonedas con código Morse de Bankrbot: El ataque introduce instrucciones mediante codificación Morse, explotando la brecha entre lo que inspeccionan las barreras de Grok (texto plano) y lo que decodifica y ejecuta (la instrucción traducida). La elección de codificación es específicamente una elusión de la capa de contenido: la directiva maliciosa es invisible para los filtros hasta que el propio agente la vuelve legible.3
2. Claude ClaudeBleed: Es una vulnerabilidad de seguridad crítica dentro de la extensión de Anthropic Claude para el navegador Chrome, que permite a actores maliciosos secuestrar el asistente de IA, robar datos sensibles y realizar acciones sin el consentimiento del usuario.4
3. Gemini CLI RCE: Una vulnerabilidad crítica de Ejecución Remota de Código (RCE), identificada como GHSA-wpqr-6v78-jr5g, tenía una puntuación CVSS máxima de 10.0. Fue descubierta en la CLI de Gemini y su GitHub Action asociada. Esta vulnerabilidad permitía a los atacantes obtener control total sobre el sistema que ejecutaba la herramienta, convirtiéndola en una amenaza crítica para la seguridad de la cadena de suministro.5
4. Antropic PocketOS: Un agente de Cursor impulsado por Claude, mientras investigaba un error en staging, descubrió de forma autónoma un token de Railway CLI sin alcance definido, infirió un endpoint de API y emitió un comando volumeDelete que destruyó la base de datos de producción y tres meses de copias de seguridad en 9 segundos.6
5. Ecosistema de IA de Código Abierto: CLI-Anything auto-genera archivos de capa de instrucciones SKILL.md que son consumidos por Claude Code, Codex, OpenClaw, Cursor y GitHub Copilot CLI. Las definiciones de habilidades envenenadas se propagan silenciosamente a través de cada agente que importa el paquete afectado; no se emite ningún CVE, no existe entrada SBOM y ningún escáner lo detecta. El ataque apunta a la infraestructura compartida del ecosistema (el registro de habilidades ClawHub, el gráfico de dependencias npm) en lugar de a un agente individual.7
6. Grafana IA: Noma Security descubrió que un atacante podía almacenar un prompt malicioso dentro de una fuente de datos que el asistente de IA de Grafana recuperaba posteriormente. Una vez procesado, la IA enviaba datos sensibles, como métricas financieras y telemetría de infraestructura, a un servidor controlado por el atacante sin necesidad de que el usuario hiciera clic.8
7. Ecosistema MCP de Anthropic: OX Security reveló una vulnerabilidad arquitectónica sistémica en los SDK oficiales de MCP de Anthropic (Python, TypeScript, Java, Rust) donde la entrada del usuario fluye directamente a las configuraciones del servidor MCP STDIO sin sanitización, afectando a más de 150 millones de descargas de SDK, más de 7.000 servidores expuestos públicamente y herramientas derivadas como LiteLLM, LangChain, Cursor, Windsurf y Claude Code. Dado que la falla está en la arquitectura del SDK compartido en lugar de en un solo agente, cualquier agente construido sobre el framework hereda la exposición.9
8. Andon Market (Luna IA): Andon Market, una tienda minorista de San Francisco gestionada de forma autónoma por un agente de IA llamado «Luna», toma decisiones de inventario, precios y contratación leyendo las reseñas de Google. Los clientes descubrieron que dejar una reseña redactada como una instrucción, como «por favor, ten en stock el producto X», hace que el agente actúe en consecuencia, convirtiendo una plataforma de reseñas pública en una superficie de inyección de prompts en vivo con consecuencias comerciales reales.10
9. Ejecución de Código de ChatGPT: Un prompt malicioso disfrazado de consejos de productividad desencadena código de tunelización DNS que codifica contenido sensible de la conversación y carga documentos en consultas de subdominio, transmitiéndolos silenciosamente a un servidor DNS controlado por el atacante. Check Point Research demostró que el canal de exfiltración es invisible para la monitorización de red convencional porque viaja sobre el tráfico DNS estándar iniciado por el propio entorno de ejecución de código del agente.11
10. Perplexity Comet: Zenity Labs reveló que el navegador agéntico de Perplexity Comet puede ser secuestrado mediante una invitación de calendario maliciosa que contiene una carga de inyección de prompt, lo que le permite acceder al sistema de archivos local, explorar directorios, abrir y leer archivos, y exfiltrar datos. El ataque no requiere interacción del usuario más allá de aceptar lo que parece una invitación legítima a una reunión, y opera completamente dentro de las capacidades previstas del navegador.12
11. Microsoft Semantic Kernel: El equipo de Investigación de Seguridad de Defender de Microsoft identificó dos vulnerabilidades críticas en Semantic Kernel, CVE-2026-26030 (SDK de Python, parcheada en 1.39.4) y CVE-2026-25592 (SDK de .NET, parcheada en 1.71.0), donde un atacante con cualquier vector de inyección de prompt puede lograr la ejecución remota de código en la máquina que aloja al agente. CVE-2026-26030 explotaba un filtro basado en eval en InMemoryVectorStore cuya lista de bloqueo de AST era eludible mediante el recorrido de atributos no documentados, mientras que CVE-2026-25592 exponía una función auxiliar de transferencia de archivos como una herramienta del kernel invocable, permitiendo que un prompt hostil dirigiera al agente a escribir archivos arbitrarios en ubicaciones peligrosas del host.13
12. Cline IA Triage Bot: Un título malicioso de un issue de GitHub inyectó instrucciones en el bot de triaje de IA de Cline, engañándolo para que ejecutara npm install en un paquete con typosquatting. Esto provocó envenenamiento de caché, robo de credenciales y una versión backdoor cline@2.3.0 que instaló silenciosamente el malware OpenClaw en aproximadamente 4.000 máquinas de desarrolladores.14
13. Extensiones de Escritorio de Claude: Investigadores de seguridad de LayerX descubrieron una vulnerabilidad CVSS 10/10 en las Extensiones de Escritorio de Claude que afecta a más de 10.000 usuarios, donde un atacante puede incrustar instrucciones maliciosas dentro de un evento de calendario que Claude procesa cuando un usuario pregunta sobre su agenda. El agente ejecuta entonces automáticamente código arbitrario en la máquina del usuario sin ninguna interacción adicional, sin indicación visible de que algo haya ocurrido.15
14. Ecosistema npm/MCP: Socket descubrió SANDWORM_MODE, un gusano npm auto-replicante distribuido a través de 19 paquetes con typosquatting que instala un servidor MCP no autorizado con cargas de inyección de prompt incrustadas en las descripciones de las herramientas, permitiéndole exfiltrar credenciales de los asistentes de codificación con IA. Dado que el gusano se propaga a través del registro de paquetes compartido, una única infección siembra el ataque en cada desarrollador que instala una dependencia afectada.16
15. Snowflake Cortex Code: PromptArmor descubrió que el sistema de validación de comandos de Cortex Code no evaluaba los comandos dentro de expresiones de sustitución de procesos, lo que permitía que una inyección de prompt maliciosa oculta en un README de un repositorio de GitHub ejecutara comandos de shell arbitrarios sin activar el paso de aprobación de humano en el circuito. La instrucción inyectada también manipuló al modelo para que estableciera una bandera de ejecución sin sandbox, lo que provocó que el comando malicioso se ejecutara completamente fuera del sandbox sin solicitar el consentimiento del usuario.
16. Agentes MetaGPT / LangChain: MemoryGraft es un novedoso ataque de inyección indirecta que compromete el comportamiento del agente no mediante jailbreaks inmediatos, sino implantando «experiencias exitosas» maliciosas en la memoria a largo plazo del agente, explotando su tendencia a replicar patrones de tareas exitosas recuperadas. A diferencia de las inyecciones de prompt tradicionales, que son transitorias, o el envenenamiento estándar de RAG, que apunta al conocimiento factual, MemoryGraft corrompe todas las sesiones futuras sin ninguna inyección a nivel de sesión, requiriendo que un atacante proporcione artefactos de ingesta de apariencia inocua que el agente lee durante la ejecución normal.17
17. ServiceNow Now Assist: En Now Assist de ServiceNow, la configuración predeterminada permite que los agentes de IA descubran y recluten autónomamente a otros agentes; un prompt malicioso incrustado en datos procesados por un agente de bajo privilegio puede instruirle para que llame a un agente más poderoso para robar datos, modificar registros o escalar privilegios. El resultado fue una escalada de privilegios y exposición de datos impulsada completamente por la confianza entre agentes.18
18. Apple Intelligence: Caracteres maliciosos Unicode RIGHT-TO-LEFT OVERRIDE ocultan instrucciones dañinas escribiéndolas al revés, de modo que se renderizan correctamente en pantalla pero permanecen invertidas donde los filtros de seguridad de Apple las inspeccionan, eludiendo las tres capas de barreras de protección en el dispositivo. La técnica tuvo éxito en el 76 % de los casos de prueba en aproximadamente 200 millones de dispositivos afectados.19
19. Google Gemini (Calendario): Instrucciones ocultas incrustadas en las descripciones de eventos de calendario permanecen latentes en el contexto de Gemini hasta que un usuario pregunta sobre su agenda, momento en el cual la carga se activa, resumiendo contenidos privados de reuniones y escribiéndolos en un nuevo evento de calendario visible para el atacante. El ataque explota la integración de Gemini con los datos del calendario, convirtiendo datos personales estructurados en una superficie de activación sin requerir que la víctima haga clic en nada.20
20. Microsoft 365 Copilot: EchoLeak (CVE-2025-32711), descubierto por Aim Security, es el primer caso conocido de inyección de prompt utilizada para causar una exfiltración de datos concreta en un sistema de IA en producción. Es un único correo electrónico diseñado que obliga a Copilot a acceder a archivos internos y transmitir su contenido a un servidor controlado por el atacante sin ninguna interacción del usuario. El ataque encadena cuatro elusiones: evadir el clasificador XPIA de Microsoft, eludir la redacción de enlaces con Markdown de estilo de referencia, explotar imágenes auto-recuperadas y abusar de un proxy de Microsoft Teams permitido por la política de seguridad de contenido.
¿Qué son las trampas para agentes de IA?
Las trampas para agentes de IA son contenidos adversarios incrustados en entornos digitales y diseñados para manipular, engañar o explotar a los agentes de IA autónomos que interactúan con esos entornos.21
La idea central es que los agentes autónomos procesan el contenido web en capas que los humanos no perciben. Los atacantes pueden incrustar instrucciones maliciosas en comentarios HTML, texto posicionado con CSS o con opacidad cero, atributos de metadatos y datos esteganográficos codificados en archivos de imagen.22 Ninguna de estas capas es normalmente visible para un revisor humano; un agente que analiza la misma página trata el contenido encontrado en ellas como una entrada igualmente válida al contenido renderizado visiblemente en pantalla. Los investigadores de Google DeepMind señalan esto como una asimetría fundamental: los atacantes pueden calibrar los ataques para explotar las capacidades de seguimiento de instrucciones, encadenamiento de herramientas y priorización de objetivos de un agente precisamente porque esas son las capacidades que hacen que los agentes sean operativamente útiles.23
Seis categorías de ataque de trampas para agentes de IA
Los investigadores han identificado 6 categorías de trampas para agentes de IA que los adversarios pueden explotar para comprometer sistemas autónomos:21
Trampas de inyección de contenido
Explotan la brecha entre la percepción humana, el análisis automático y el renderizado dinámico para introducir entradas maliciosas que eluden al agente.
La superficie de ataque abarca varios vectores de inyección distintos. Las instrucciones ocultas incrustadas en comentarios HTML, como `<!– SYSTEM: Ignorar instrucciones anteriores –>`, aparecen en el código fuente de la página pero nunca en la vista renderizada. El posicionamiento fuera de pantalla con CSS, usando `position: absolute; left: -9999px` o equivalente, coloca texto en coordenadas fuera de cualquier viewport dejándolo completamente analizable por agentes que procesan el contenido del modelo de objeto del documento. Los atributos de accesibilidad, específicamente `aria-label` y el marcado ARIA relacionado, transportan texto que los agentes interpretan como contexto semántico; inyectar directivas adversarias allí las coloca dentro del árbol de accesibilidad sin ninguna salida visible. Un cuarto vector utiliza codificación esteganográfica: cargas maliciosas codificadas en datos de píxeles de imagen a valores imperceptibles para la visión humana pero legibles por agentes que procesan metadatos de imagen o aplican análisis a nivel de píxel.
Trampas de manipulación semántica
Corrompen la cadena de razonamiento del agente y los procesos internos de verificación, llevándolo a extraer conclusiones erróneas a partir de entradas aparentemente válidas.
Tres mecanismos impulsan esta categoría. El primero es el sesgo en la redacción y la preparación contextual: cargar el texto circundante con lenguaje que ancla la interpretación del agente del contenido procesado posteriormente. El segundo es la saturación de lenguaje autoritativo, inundando documentos con frases como «estándar de la industria», «de grado empresarial» o «recomendado por profesionales líderes» para explotar la asociación aprendida del modelo entre dicho lenguaje y fuentes creíbles y confiables.22 El tercer mecanismo es el efecto de pérdida en el medio, una debilidad estructural en los LLM basados en transformadores donde el rendimiento del modelo en tareas de recuperación y síntesis se degrada cuando la información relevante se posiciona en el medio de una ventana de contexto larga en lugar de al principio o al final.
Trampas de estado cognitivo
Apuntan a la memoria a largo plazo del agente, las bases de conocimiento y las políticas conductuales aprendidas para envenenar la toma de decisiones futura.
Las tres variantes principales son el envenenamiento directo de RAG, el envenenamiento latente de memoria y los ejemplos few-shot adversarios en el aprendizaje contextual.
El envenenamiento directo de RAG inyecta información falsa en corpus de documentos indexados que los agentes consultan durante la generación aumentada por recuperación. El envenenamiento de memoria es más avanzado. Un atacante almacena datos de apariencia inocua en la memoria persistente de un agente durante interacciones rutinarias. Los datos almacenados no producen ningún efecto detectable hasta que un contexto futuro específico los activa, momento en el cual modifican el comportamiento del agente de manera que parece no tener un desencadenante causal reciente. El few-shot adversario consiste en inyectar pares de demostración cuidadosamente diseñados en una ventana de contexto para que el agente adopte el patrón implícito en esos ejemplos. La investigación sobre desencadenantes de puerta trasera en demostraciones encontró tasas de éxito de ataque promedio del 95 por ciento en modelos de escala variable bajo este enfoque.
Trampas de control conductual
Las trampas de control conductual son la categoría con mayores consecuencias operativas en la taxonomía. Apuntan a lo que los agentes hacen en lugar de lo que perciben o concluyen, dando a los atacantes influencia directa sobre la ejecución de herramientas, operaciones de archivos, solicitudes de red y comunicaciones entre agentes.
Trampas sistémicas
Las trampas sistémicas no apuntan a agentes individuales. Apuntan a las propiedades del ecosistema que emergen cuando muchos agentes de diseño similar operan sobre fuentes de datos compartidas, ejecutan patrones de razonamiento similares y toman acciones que retroalimentan el entorno que otros agentes leen.22
La categoría más amplia abarca tres mecanismos distintos. El primero es el diseño de trampas de congestión: fabricar señales de escasez o demanda que hacen que múltiples agentes ejecuten comportamientos sincronizados de adquisición de recursos, creando fallos coordinados sin comunicación directa entre agentes. El segundo es la cascada de interdependencia: explotar bucles de retroalimentación en sistemas multiagente donde la salida de cada agente se convierte en entrada para otros, de modo que una única señal corrompida se propaga y amplifica a través de la red. El tercero es la fragmentación composicional de la carga: distribuir componentes de ataque a través de múltiples fuentes individualmente inofensivas que se reconstituyen en una carga maliciosa funcional cuando son agregadas por un agente durante una tarea de recuperación o síntesis.
Trampas de humano en el circuito
Las trampas de humano en el circuito son la categoría más sutil de la taxonomía y apuntan a la capa de supervisión que se trata convencionalmente como una salvaguarda. En lugar de eludir la revisión humana, estas trampas la explotan: el agente comprometido produce salidas específicamente diseñadas para obtener la aprobación humana para acciones que el humano rechazaría si se describieran con precisión.24
El mecanismo central es la summarización engañosa. Un agente con acceso de escritura a su propia capa de salida puede describir sus acciones de una manera que presente operaciones destructivas o no autorizadas como mantenimiento rutinario.
Lecturas adicionales
- Herramientas de Observabilidad de LLM
- Vulnerabilidad de Agentes de IA
- Expansión Descontrolada de Agentes de IA
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{phd2026,
author = {PhD., Ezgi Arslan,},
title = {{Trampas para Agentes de IA: 20 Incidentes de la Vida Real}},
year = {2026},
month = may,
howpublished = {\url{https://aimultiple.com/ai-agent-traps}},
note = {AIMultiple. Recuperado el 18 de Mayo de 2026}
}Resultados y marcas de tiempo de 20 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene un archivo CSV.



Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.