Premium
Servicios
Premium

Modelos de lenguaje de gran tamaño en ciberseguridad

Cem Dilmegani
Cem Dilmegani
actualizado el 15 de sept. de 2026

Evaluamos 7 grandes modelos de lenguaje en 9 dominios de ciberseguridad usando SecBench, un benchmark a gran escala y multiformato para tareas de seguridad.

Probamos cada modelo con 44.823 preguntas de opción múltiple (MCQs) y 3.087 preguntas de respuesta corta (SAQs), que abarcan seguridad de datos, gestión de identidades y accesos, seguridad de redes, gestión de vulnerabilidades y seguridad en la nube.

Evaluación comparativa del rendimiento de LLM en dominios de ciberseguridad

Evaluación comparativa de MCQs (preguntas de opción múltiple):

SAQs (preguntas de respuesta corta):

Este benchmark evalúa 7 LLMs generales, incluidos tanto modelos propietarios (p. ej., GPT-4) como de código abierto (p. ej., DeepSeek, Mistral). El benchmark abarca 9 subcampos de la ciberseguridad, entre ellos:

  • Seguridad de datos
  • Gestión de identidades y accesos
  • Seguridad de aplicaciones
  • Seguridad de redes
  • Estándares de seguridad

Los dominios del eje X están ordenados por el rendimiento de LLM, con los dominios de menor puntuación hacia la izquierda y los de mayor puntuación hacia la derecha.1

Consulte la metodología del benchmark.

Ciberseguridad especializada LLMs

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

El papel de los LLMs en la ciberseguridad

Los grandes modelos de lenguaje (LLMs) se utilizan en las operaciones de ciberseguridad para extraer información procesable de fuentes no estructuradas, como informes de inteligencia de amenazas, registros de incidentes, bases de datos de CVE y TTP de atacantes.

Los LLMs automatizan tareas clave, como la clasificación de amenazas, el resumen de alertas y la correlación de indicadores de compromiso (IOC).

Cuando se ajustan con datos de ciberseguridad, los grandes modelos de lenguaje pueden detectar anomalías en los registros, analizar correos de phishing, priorizar vulnerabilidades y asignar amenazas a marcos como MITRE ATT&CK.

Aplicaciones de los grandes modelos de lenguaje en la ciberseguridad

Inteligencia de amenazas

  • Copiloto para el análisis contextual de amenazas: Las herramientas impulsadas por LLM como CyLens ayudan a los analistas de seguridad durante la inteligencia de amenazas mediante el análisis de informes extensos con pipelines de NLP modulares y filtros de correlación de entidades.2
  • Inteligencia de amenazas proactiva en tiempo real: los sistemas integran LLMs con frameworks de generación aumentada por recuperación (RAG) para ingerir fuentes continuas de CTI (p. ej., CVE) en bases de datos vectoriales (como Milvus), lo que permite una detección, puntuación y razonamiento contextual automatizados y actualizados.3
  • Extracción de CTI basada en foros: los LLMs analizan datos no estructurados de foros de ciberdelincuencia para extraer indicadores clave de amenazas mediante prompts simples.4

Detección de vulnerabilidades

  • Enriquecimiento de descripciones de vulnerabilidades: LLMs como CVE‑LLM enriquecen las descripciones de vulnerabilidades mediante ontologías de dominio, lo que permite la clasificación automatizada y la integración de la puntuación CVSS en los sistemas de gestión de seguridad existentes.5
  • Detección de vulnerabilidades en el sistema de archivos de Android: Investiga cómo los LLMs pueden detectar vulnerabilidades de acceso al sistema de archivos en aplicaciones Android, incluidos el abuso de permisos y el almacenamiento inseguro.6
  • Ajuste fino con RL para la detección de vulnerabilidades: Aplica aprendizaje por refuerzo (RL) para ajustar LLMs (LLaMA 3B/8B, Qwen 2.5B) y mejorar la precisión en la identificación de vulnerabilidades de software.7

Detección de Anomaly y análisis de registros

  • Detección semántica de anomalías en registros: Frameworks como LogLLM utilizan codificadores/decodificadores de LLM para analizar y clasificar entradas de registro, mejorando la detección de anomalías más allá de la coincidencia de patrones.8
  • Análisis de registros con grandes modelos de lenguaje: El parseo automatizado con LLM convierte registros no estructurados en formatos estructurados mediante enfoques basados en prompts y ajustados finamente.9

Red teaming / prevención de ataques asistida por LLM

  • Pentesting y corrección impulsados por LLM (penheal): Automatiza las pruebas de penetración mediante una pipeline de dos etapas; primero identifica debilidades de seguridad y luego genera acciones de corrección con una configuración personalizada de LLM.10
  • Agente de red team local para seguridad interna (hackphyr): Despliega un agente de 7B LLM ajustado localmente para realizar tareas de red team como simulación de movimiento lateral, recolección de credenciales y escaneo de vulnerabilidades en redes.11
No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Metodología del benchmark de LLMs en ciberseguridad

SecBench es un benchmark multidimensional a gran escala para evaluar LLMs en ciberseguridad en diferentes tareas, dominios, idiomas y formatos.

Dimensiones de evaluación

1. Razonamiento multinivel:

  • Retención de conocimiento (KR): Preguntas que evalúan conocimiento factual o definiciones. Son más sencillas.
  • Razonamiento lógico (LR): Preguntas que requieren inferencia y una comprensión más profunda. Son más difíciles y evalúan la capacidad del modelo para razonar según el contexto.

2. Multiformato:

  • MCQs (preguntas de opción múltiple): Formato tradicional en el que el modelo selecciona entre respuestas predefinidas. Total de 44.823 preguntas.
  • SAQs (preguntas de respuesta corta): Formato abierto que exige que el modelo genere su respuesta para evaluar el razonamiento, la claridad y la resistencia a las alucinaciones. Total de 3.087 preguntas.

3. Multiidioma:

SecBench incluye preguntas tanto en chino como en inglés.

4. Multidominio:

Las preguntas abarcan 9 dominios de ciberseguridad (D1–D9), entre ellos: gestión de seguridad, seguridad de datos, seguridad de redes, seguridad de aplicaciones, seguridad en la nube y más.

Evaluación

Los MCQs se califican comprobando si el modelo selecciona la(s) opción(es) correcta(s).

Las SAQs se califican mediante un GPT-4o mini “agente calificador”, que compara la respuesta del modelo con la verdad fundamental y asigna una puntuación basada en la precisión y la exhaustividad.

Evaluación del rendimiento de LLM: Por ejemplo, la seguridad de redes (D3) se evalúa agrupando preguntas relevantes de su dataset de MCQ de 44.823 preguntas.

La precisión se mide según el rendimiento de cada modelo, específicamente en las preguntas etiquetadas dentro del dominio D3. El porcentaje de un modelo para D3 refleja la proporción de preguntas de seguridad de redes que respondió correctamente.

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Cem Dilmegani (2026) - "Modelos de lenguaje de gran tamaño en ciberseguridad". Publicado en línea en AIMultiple.com. Recuperado el 15 de septiembre de 2026, de: https://aimultiple.com/llms-in-cybersecurity [Recurso en línea]

Dilmegani, C. (2026, 15 de septiembre). Modelos de lenguaje de gran tamaño en ciberseguridad. AIMultiple. https://aimultiple.com/llms-in-cybersecurity

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{Modelos de lenguaje de gran tamaño en ciberseguridad}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/llms-in-cybersecurity}},
  note   = {AIMultiple. Recuperado el 15 de septiembre de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 20 puntos de datos. Descargue los datos resumidos que se muestran en los gráficos y las tablas de este artículo como un archivo ZIP que contiene un archivo CSV.

Última actualización: 26 de septiembre de 2026
Descargar

¿Quieres los datos granulares que hay detrás? Únete a Premium

Registro de cambios

1 actualizaciones
  1. Añadidos resultados de evaluación para 7 modelos de lenguaje grandes en 9 dominios de ciberseguridad en la introducción.

Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem ha sido el analista principal en AIMultiple desde 2017.

El trabajo de Cem en AIMultiple ha sido citado por publicaciones líderes mundiales como Business Insider, Forbes, Morning Brew y Washington Post, empresas globales como Deloitte y HPE, ONG como World Economic Forum y organizaciones supranacionales como European Commission. [1], [2], [3], [4], [5]

A lo largo de su carrera, Cem trabajó como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.

Dirigió la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando al CEO. También lideró el crecimiento comercial de la empresa de deep tech Hypatos, que alcanzó unos ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.

Cem participa habitualmente en conferencias internacionales de tecnología. Se graduó en Bogazici University como ingeniero informático y tiene un MBA de Columbia Business School.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450