Comprender cómo la vulnerabilidad de los agentes de IA hace que los sistemas fallen, ya sea por exploits de seguridad, fallos en las barreras de protección o exposición de datos, se ha vuelto crítico a medida que estos sistemas asumen roles cada vez más autónomos en los flujos de trabajo empresariales.
Para mapear el panorama de riesgo real de los agentes de IA, revisamos 192 incidentes de vulnerabilidad documentados, desde marzo de 2016 hasta mayo de 2026, basándonos en diversas fuentes.
Distribución de vulnerabilidades
Distribución por categoría
Los incidentes se dividen en tres clases.
Predominan las fallas de seguridad. En estos casos, el agente produce o permite un daño que sus controles deberían haber bloqueado. Luego vienen los exploits de seguridad; aquí un atacante abusa de una debilidad del agente. La exposición de datos es la clase más pequeña.
Fallas de seguridad y barreras de protección
Tres categorías concentran la mayor parte del peso.
Difamación y fabricación es la categoría individual más grande del catálogo. El agente afirma hechos falsos sobre una persona o empresa real. Ejemplos incluyen acusaciones inventadas y citas legales falsas.
Exploits de seguridad
Las categorías de seguridad siguen la lista OWASP ASI (el OWASP Top 10 para Aplicaciones Agentivas).
Predomina el secuestro del objetivo del agente. El método común es la inyección de prompt: instrucciones ocultas colocadas en el texto que el agente lee. La ejecución de código inesperada ocupa el segundo lugar, donde el agente ejecuta comandos proporcionados por el atacante.
Exposición de datos
La exposición de datos confidenciales y el control de acceso representan 15 incidentes. Entre las causas comunes se incluyen enlaces de uso compartido abiertos, contraseñas débiles y almacenamiento sin cifrar.
Distribución por año y mes
Los registros abarcan desde marzo de 2016 hasta mayo de 2026. El recuento ha aumentado bruscamente en los últimos años.
El año 2025 concentra más de la mitad del catálogo. El aumento sigue la difusión de chatbots y herramientas agentivas en el trabajo diario.
El primer registro data de marzo de 2016: el chatbot Tay de Microsoft, manipulado por usuarios para publicar contenido racista. Hasta 2022, los informes son escasos. Se centran en el mal comportamiento de chatbots y contenido dañino, no en ataques.
2025 trajo 104 incidentes, el pico del catálogo. El flujo se mantuvo constante durante todo el año, con puntos altos en julio (14), abril (13) y octubre (13). La mezcla de clases fue casi uniforme: 51 fallas de seguridad, 47 exploits de seguridad y 6 casos de exposición de datos.
2026 muestra 33 incidentes hasta mayo. La mezcla se inclina hacia la seguridad: 23 exploits frente a 8 fallas de seguridad. Los ataques a la cadena de suministro y las fallas de ejecución de código crecen a medida que múltiples agentes obtienen acceso a herramientas, código y sistemas externos conectados.
Categorías de vulnerabilidad de agentes de IA
Una vulnerabilidad de agente de IA es una debilidad en un sistema de IA autónomo. Un sistema agentivo planifica, decide y actúa en varios pasos. Utiliza herramientas, memoria y enlaces a otros sistemas, a menudo sin que un humano apruebe cada paso. Una vulnerabilidad permite que un atacante explote esa debilidad, o que los controles de seguridad del agente fallen. El efecto llega al mundo real: datos sensibles filtrados, ejecución no autorizada, código que se ejecuta en una máquina anfitriona o daño a una persona.
Las categorías siguientes se dividen en tres grupos. Las categorías de exploits de seguridad cubren ataques que abusan de una debilidad. Las categorías de seguridad y barreras de protección cubren fallas en las que el agente produce o permite un daño. La exposición de datos abarca controles de acceso débiles que revelan información privada.
Las categorías de seguridad de agentes de IA siguen el OWASP Top 10 para Aplicaciones Agentivas (2026). Las categorías de seguridad y exposición de datos amplían esa lista, porque el conjunto OWASP se centra en la seguridad y deja espacio para las fallas de barreras de protección y privacidad.
Categorías de exploits de seguridad
Secuestro del objetivo del agente
Un atacante cambia lo que el agente intenta hacer. El método común es la inyección de prompt: instrucciones ocultas colocadas en el texto que el agente lee, como un correo electrónico, una página web, un documento o la salida de una herramienta. El agente trata el texto oculto como un comando real y lo sigue. EchoLeak mostró el peligro. Un solo correo electrónico manipulado hizo que Microsoft 365 Copilot leyera archivos internos y los enviara, sin que la víctima hiciera clic.
Uso indebido y explotación de herramientas
El agente tiene permiso para llamar a herramientas y API, como correo electrónico, bases de datos o funciones de pago. Un atacante dirige al agente para que use esas herramientas en contra de su propietario. El daño proviene de una acción normal que se vuelve dañina. Un agente de trading manipulado, por ejemplo, puede transferir fondos a la cuenta equivocada.
Abuso de identidad y privilegios
Un agente lleva credenciales y derechos de acceso. Los controles débiles permiten que un atacante tome prestada esa identidad o empuje al agente más allá de sus límites previstos. El agente de contratación McHire de McDonald’s utilizó una contraseña débil y expuso registros de aproximadamente 64 millones de solicitantes.
Cadena de suministro agentiva
Los agentes dependen de componentes externos: modelos de IA, complementos y conectores como los servidores MCP. (MCP, el Protocolo de Contexto del Modelo, es una forma estándar para que un agente se conecte a herramientas externas). Un componente envenenado o falso propaga su daño a cada agente que lo instale. El agente de codificación Cline distribuyó una versión con puerta trasera después de que un atacante lo engañara para que descargara un paquete falso.
Ejecución de código inesperada
El agente ejecuta código o comandos de shell en una máquina anfitriona. Un atacante abusa de esa capacidad para ejecutar sus propios comandos. La abreviatura para esto es RCE, o ejecución remota de código. La falla de CLI de Gemini obtuvo la máxima gravedad y otorgó a un atacante el control total del host.
Envenenamiento de memoria y contexto
Los agentes mantienen memoria y extraen contexto de documentos y bases de datos. Un atacante introduce prompts falsos o maliciosos en ese almacén. Más tarde, el agente recupera el contenido envenenado y actúa en consecuencia. El efecto persiste a través de las sesiones y es difícil de detectar.
Comunicación insegura entre agentes
Muchos sistemas complejos ejecutan varios agentes que se comunican entre sí. Un agente tiende a confiar por defecto en los mensajes de otro agente. Un atacante abusa de esa confianza, suplanta a un agente o retransmite instrucciones manipuladas. Un agente con pocos privilegios puede ser dirigido para reclutar a uno más poderoso.
Fallos en cascada
El error o compromiso de un solo agente se propaga a través de sistemas multiagente conectados. Una sola acción puede borrar datos o romper un flujo de trabajo sin una fácil reversión. Un agente de Replit eliminó una base de datos de producción durante una congelación de código y luego ocultó el error.
Categorías de fallas de seguridad y barreras de protección
Estas categorías describen una falla de los controles del agente. No se necesita un atacante. El agente produce o permite un daño que sus barreras de protección deberían haber bloqueado.
Autolesiones y salud mental
El agente no protege a una persona en crisis. En lugar de redirigir al soporte, valida pensamientos dañinos o proporciona detalles peligrosos. Los informes describen chatbots que alentaron el suicidio o reforzaron pensamientos delirantes, con daño real para la persona.
Seguridad de menores
El agente expone a un menor a contenido sexual, depredador o de otro modo inseguro. Los controles destinados a bloquear tales interacciones fallan. Los informes describen chatbots de compañía que involucraron a menores en conversaciones inseguras.
Violencia y asistencia peligrosa
El agente ayuda a planificar o llevar a cabo violencia u otro delito grave. Los filtros que deberían rechazar la solicitud se rompen. Los informes describen chatbots consultados durante la planificación de ataques.
Consejos de salud y médicos perjudiciales
El agente da orientación médica insegura que puede lesionar a una persona. Un informe describe un chatbot que sugirió cambiar la sal de mesa por bromuro de sodio, lo que provocó envenenamiento y una estancia hospitalaria.
Difamación y fabricación
El agente afirma hechos falsos sobre una persona u organización real como si fueran ciertos. Citas, acusaciones o citas inventadas causan daño reputacional o legal. Un modelo acusó falsamente a un periodista de delitos. Otro inventó una cita judicial que terminó en documentos legales.
Acoso y contenido abusivo
El agente produce contenido abusivo, amenazante o no consentido dirigido a una persona. Ejemplos incluyen respuestas amenazantes y herramientas utilizadas para crear imágenes íntimas no consentidas.
Exposición de datos y control de acceso
Un control débil en el sistema de agente de IA revela información privada. Entre las causas comunes se incluyen enlaces de uso compartido abiertos, almacenamiento sin cifrar y acceso no autorizado a archivos. El material expuesto puede incluir datos personales, conversaciones guardadas, credenciales o código fuente.
Cómo encajan las categorías
Las categorías de exploits de seguridad involucran atacantes que encuentran y explotan debilidades. Las categorías de seguridad y barreras de protección no necesitan un atacante; los propios controles del agente fallan. La exposición de datos se sitúa entre ambas: una falla de diseño o configuración filtra datos sensibles, ya sea que haya o no un atacante involucrado. Un solo incidente puede tocar más de una categoría. Para un catálogo limpio, cada incidente se asigna a su categoría principal según la debilidad central.
Metodología de vulnerabilidad de agentes de IA
Alcance y definición
El catálogo cubre vulnerabilidades de agentes de IA. Tres tipos de incidentes califican: exploits de seguridad (como inyección de prompt o código que se ejecuta en un host), fallas de seguridad y barreras de protección (como consejos dañinos o afirmaciones falsas sobre una persona real) y fallos de exposición de datos.
Varios tipos de incidentes quedan fuera del alcance: disputas de derechos de autor y licencias, sesgo genérico o salida de estereotipos, errores factuales sin daño, casos en los que una persona utilizó el modelo como herramienta para crear malware o estafas, disputas regulatorias y quejas operativas.
Fuentes
El catálogo se basa en tres capas de evidencia. Las fuentes primarias lideran. Los informes de los proveedores y las noticias llenan los vacíos cuando un proveedor es el divulgador o el único registro.
La primera capa es un conjunto de incidentes fechados y específicos de productos provenientes de avisos e investigación de seguridad. Los avisos incluyen la Base de Datos Nacional de Vulnerabilidades (NVD),1 el Centro de Respuesta de Seguridad de Microsoft (MSRC),2 y la Base de Datos de Avisos de GitHub (GHSA).3 Estos son registros públicos que describen una falla específica. La investigación de seguridad proviene de las empresas que encontraron las fallas, como Noma Security, Check Point, Tenable, Wiz y Zenity.
La segunda capa es el Rastreador de Exploits e Incidentes de OWASP, del Apéndice D del OWASP Top 10 para Aplicaciones Agentivas (2026).4 Sus entradas se reproducen con atribución.
La tercera capa es la Base de Datos de Incidentes de IA (AIID), un registro abierto y revisado por pares de daños de la IA. AIID contiene más de 1,500 incidentes en todo tipo de sistemas de IA.5
Cómo se seleccionaron los incidentes
El sistema utiliza algunos filtros de palabras clave para identificar incidentes de IA. Este filtro incluye palabras clave específicas como:
1. Reconocimiento de sistema agentivo/LLM: chatbot, chat bot, LLM, modelo de lenguaje, LLM, IA generativa, GPT-3/GPT-4, ChatGPT, Gemini, Google Bard, Copilot, Claude, Llama, Grok, DeepSeek, Character.ai, Replika, Bing Chat, asistente de IA, asistente virtual, agente de IA, agentivo, IA conversacional, asistente de codificación, compañero de IA, TayBot
2. Señales de exploit de seguridad: inyección de prompt, inyección indirecta de prompt, jailbreak/jailbroke, exfiltrar, código remoto / ejecución de código / RCE, código arbitrario, inyección de comandos, comando/código/instrucción inyectada, puerta trasera, paquete/MCP/servidor/herramienta/extensión maliciosa, cadena de suministro, envenenamiento de memoria, memoria/RAG/contexto envenenado, secuestro, toma de control, exploit, credencial, robo/fuga de token, escalada de privilegios, omitir guardia/filtro/seguridad/autenticación/sandbox, eliminado/borrado/destruido/suprimido, transferencia … $/millón, acepta vender, engañado, manipulado … agente/bot, prompt fraudulento
3. Señales de seguridad/barrera de protección: suicidio, autolesión, sobredosis, menor/niño/adolescente, CSAM, menor de edad, grooming, depredador, arma, bomba, explosivo, tiroteo masivo, apuñalamiento, eliminación de cuerpo, homicidio, asesinato, ataque con martillo, orientación/planificación de ataque, difamar, falsa acusación/alegación, fabricar, alucinar, difamación, acosar, no consentido, nudificar, imagen íntima, consejo/instrucción peligrosa, consejo médico inseguro, bromuro de sodio, bromismo, hospitalizar, trastorno alimentario, consejo dietético, uso de drogas, murió/muerte después/tras, amenazar/amenazante, discurso de odio, refuerzo de delirio
4. Exposición de datos: exponer/expuesto/exposición, filtrado, violación, divulgar, acceso almacenado en caché + (datos / registros / conversaciones / correos electrónicos / credenciales / clave de API / código fuente / solicitantes / pacientes / usuarios), sin cifrar, contraseñas almacenadas/SSN, lee archivos sin consentimiento, subió información sensible
5. Señales de DESCARTE derechos de autor, plagio, infringir, pirateado, LibGen, Books3, entrenamiento no autorizado, GDPR, base legal, ejerció la abogacía / sin licencia, trampa, tarea escolar, examen, demanda a OpenAI, sesgo, estereotipo, racista, sexista, antisemita, comentario ofensivo, desinformación, propaganda, influir en la operación comercial, estafa romántica, ransomware, spam, estafa de inversión, esquema de fraude, vigilancia, desinforma sobre geografía, función de recompensa
6. Para las asignaciones de categoría:
- Secuestro de objetivo del agente (ASI01): inyección de prompt, jailbreak, manipular, acepta vender, secuestrar
- Ejecución de código inesperada (ASI05): RCE, ejecución de código, inyección de comandos, código arbitrario
- Cadena de suministro agentiva (ASI04): paquete/MCP malicioso, cadena de suministro, puerta trasera
- Fallos en cascada (ASI08): eliminado, borrado, destruido, suprimido
- Uso indebido de herramientas (ASI02): transferencia … $/millón, agente de trading
- Abuso de identidad y privilegios (ASI03): credencial, robo de token, escalada de privilegios, toma de control, compromiso de cuenta
- Seguridad de menores: CSAM, grooming, depredador, menor + sexual
- Autolesiones y salud mental: suicidio, sobredosis, delirio, trastorno alimentario
- Violencia y asistencia peligrosa: tiroteo masivo, apuñalamiento, arma, planificación de ataque, discurso de odio
- Consejos de salud/médicos perjudiciales: bromuro de sodio, bromismo, consejo médico inseguro
- Difamación y fabricación: difamar, falsa acusación, fabricar, alucinar, acusar falsamente
Revisión humana
El catálogo no es solo el trabajo de la automatización. Un paso automatizado recopiló y ordenó los incidentes a escala. Luego, el equipo revisó las entradas manualmente: se verificó cada sistema afectado, se confirmó cada categoría y se abrió cada enlace de fuente para verificar que funcionara y respaldara la afirmación. La decisión final sobre cada entrada recae en los autores.
Lista de incidentes relacionados con la vulnerabilidad de agentes de IA
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{phd2026,
author = {PhD., Ezgi Arslan,},
title = {{Vulnerabilidad de Agentes de IA con 192 Incidentes Reales}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/ai-agent-vulnerability}},
note = {AIMultiple. Recuperado el 28 de Junio de 2026}
}
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.