Evaluamos 7 grandes modelos de lenguaje en 9 dominios de ciberseguridad usando SecBench, un benchmark a gran escala y multiformato para tareas de seguridad.
Probamos cada modelo con 44.823 preguntas de opción múltiple (MCQs) y 3.087 preguntas de respuesta corta (SAQs), que abarcan seguridad de datos, gestión de identidades y accesos, seguridad de redes, gestión de vulnerabilidades y seguridad en la nube.
Evaluación comparativa del rendimiento de LLM en dominios de ciberseguridad
Evaluación comparativa de MCQs (preguntas de opción múltiple):
SAQs (preguntas de respuesta corta):
Este benchmark evalúa 7 LLMs generales, incluidos tanto modelos propietarios (p. ej., GPT-4) como de código abierto (p. ej., DeepSeek, Mistral). El benchmark abarca 9 subcampos de la ciberseguridad, entre ellos:
- Seguridad de datos
- Gestión de identidades y accesos
- Seguridad de aplicaciones
- Seguridad de redes
- Estándares de seguridad
Los dominios del eje X están ordenados por el rendimiento de LLM, con los dominios de menor puntuación hacia la izquierda y los de mayor puntuación hacia la derecha.1
Consulte la metodología del benchmark.
Ciberseguridad especializada LLMs
El papel de los LLMs en la ciberseguridad
Los grandes modelos de lenguaje (LLMs) se utilizan en las operaciones de ciberseguridad para extraer información procesable de fuentes no estructuradas, como informes de inteligencia de amenazas, registros de incidentes, bases de datos de CVE y TTP de atacantes.
Los LLMs automatizan tareas clave, como la clasificación de amenazas, el resumen de alertas y la correlación de indicadores de compromiso (IOC).
Cuando se ajustan con datos de ciberseguridad, los grandes modelos de lenguaje pueden detectar anomalías en los registros, analizar correos de phishing, priorizar vulnerabilidades y asignar amenazas a marcos como MITRE ATT&CK.
Aplicaciones de los grandes modelos de lenguaje en la ciberseguridad
Inteligencia de amenazas
- Copiloto para el análisis contextual de amenazas: Las herramientas impulsadas por LLM como CyLens ayudan a los analistas de seguridad durante la inteligencia de amenazas mediante el análisis de informes extensos con pipelines de NLP modulares y filtros de correlación de entidades.2
- Inteligencia de amenazas proactiva en tiempo real: los sistemas integran LLMs con frameworks de generación aumentada por recuperación (RAG) para ingerir fuentes continuas de CTI (p. ej., CVE) en bases de datos vectoriales (como Milvus), lo que permite una detección, puntuación y razonamiento contextual automatizados y actualizados.3
- Extracción de CTI basada en foros: los LLMs analizan datos no estructurados de foros de ciberdelincuencia para extraer indicadores clave de amenazas mediante prompts simples.4
Detección de vulnerabilidades
- Enriquecimiento de descripciones de vulnerabilidades: LLMs como CVE‑LLM enriquecen las descripciones de vulnerabilidades mediante ontologías de dominio, lo que permite la clasificación automatizada y la integración de la puntuación CVSS en los sistemas de gestión de seguridad existentes.5
- Detección de vulnerabilidades en el sistema de archivos de Android: Investiga cómo los LLMs pueden detectar vulnerabilidades de acceso al sistema de archivos en aplicaciones Android, incluidos el abuso de permisos y el almacenamiento inseguro.6
- Ajuste fino con RL para la detección de vulnerabilidades: Aplica aprendizaje por refuerzo (RL) para ajustar LLMs (LLaMA 3B/8B, Qwen 2.5B) y mejorar la precisión en la identificación de vulnerabilidades de software.7
Detección de Anomaly y análisis de registros
- Detección semántica de anomalías en registros: Frameworks como LogLLM utilizan codificadores/decodificadores de LLM para analizar y clasificar entradas de registro, mejorando la detección de anomalías más allá de la coincidencia de patrones.8
- Análisis de registros con grandes modelos de lenguaje: El parseo automatizado con LLM convierte registros no estructurados en formatos estructurados mediante enfoques basados en prompts y ajustados finamente.9
Red teaming / prevención de ataques asistida por LLM
- Pentesting y corrección impulsados por LLM (penheal): Automatiza las pruebas de penetración mediante una pipeline de dos etapas; primero identifica debilidades de seguridad y luego genera acciones de corrección con una configuración personalizada de LLM.10
- Agente de red team local para seguridad interna (hackphyr): Despliega un agente de 7B LLM ajustado localmente para realizar tareas de red team como simulación de movimiento lateral, recolección de credenciales y escaneo de vulnerabilidades en redes.11
Metodología del benchmark de LLMs en ciberseguridad
SecBench es un benchmark multidimensional a gran escala para evaluar LLMs en ciberseguridad en diferentes tareas, dominios, idiomas y formatos.
Dimensiones de evaluación
1. Razonamiento multinivel:
- Retención de conocimiento (KR): Preguntas que evalúan conocimiento factual o definiciones. Son más sencillas.
- Razonamiento lógico (LR): Preguntas que requieren inferencia y una comprensión más profunda. Son más difíciles y evalúan la capacidad del modelo para razonar según el contexto.
2. Multiformato:
- MCQs (preguntas de opción múltiple): Formato tradicional en el que el modelo selecciona entre respuestas predefinidas. Total de 44.823 preguntas.
- SAQs (preguntas de respuesta corta): Formato abierto que exige que el modelo genere su respuesta para evaluar el razonamiento, la claridad y la resistencia a las alucinaciones. Total de 3.087 preguntas.
3. Multiidioma:
SecBench incluye preguntas tanto en chino como en inglés.
4. Multidominio:
Las preguntas abarcan 9 dominios de ciberseguridad (D1–D9), entre ellos: gestión de seguridad, seguridad de datos, seguridad de redes, seguridad de aplicaciones, seguridad en la nube y más.
Evaluación
Los MCQs se califican comprobando si el modelo selecciona la(s) opción(es) correcta(s).
Las SAQs se califican mediante un GPT-4o mini “agente calificador”, que compara la respuesta del modelo con la verdad fundamental y asigna una puntuación basada en la precisión y la exhaustividad.
Evaluación del rendimiento de LLM: Por ejemplo, la seguridad de redes (D3) se evalúa agrupando preguntas relevantes de su dataset de MCQ de 44.823 preguntas.
La precisión se mide según el rendimiento de cada modelo, específicamente en las preguntas etiquetadas dentro del dominio D3. El porcentaje de un modelo para D3 refleja la proporción de preguntas de seguridad de redes que respondió correctamente.
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Modelos de lenguaje de gran tamaño en ciberseguridad}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/llms-in-cybersecurity}},
note = {AIMultiple. Recuperado el 15 de septiembre de 2026}
}Resultados y marcas de tiempo de 20 puntos de datos. Descargue los datos resumidos que se muestran en los gráficos y las tablas de este artículo como un archivo ZIP que contiene un archivo CSV.
¿Quieres los datos granulares que hay detrás? Únete a Premium
Registro de cambios
1 actualizacionesAñadidos resultados de evaluación para 7 modelos de lenguaje grandes en 9 dominios de ciberseguridad en la introducción.
Enlaces de referencia
El trabajo de Cem en AIMultiple ha sido citado por publicaciones líderes mundiales como Business Insider, Forbes, Morning Brew y Washington Post, empresas globales como Deloitte y HPE, ONG como World Economic Forum y organizaciones supranacionales como European Commission. [1], [2], [3], [4], [5]
A lo largo de su carrera, Cem trabajó como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.
Dirigió la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando al CEO. También lideró el crecimiento comercial de la empresa de deep tech Hypatos, que alcanzó unos ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.
Cem participa habitualmente en conferencias internacionales de tecnología. Se graduó en Bogazici University como ingeniero informático y tiene un MBA de Columbia Business School.
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.