Hemos curado una lista con más de 800 benchmarks de IA para LLMs, GPUs, GPUs en la nube, agentes de IA, IA tabular y ciberseguridad que aún no están saturados.
Crecimiento de los benchmarks de IA
Ten en cuenta que la mayor parte del pico de mayo–junio corresponde al período en el que llevamos a cabo nuestra investigación. Los benchmarks que se actualizan continuamente llevan la fecha de la última verificación que hicimos, por lo que tienden a agruparse en los meses en que recopilamos los datos, más que a indicar un aumento real de nuevos benchmarks.
Benchmarks de IA por categorías
Hemos clasificado los benchmarks de IA según sus categorías principales. Los benchmarks de LLM lideran en número.
Benchmarks de IA por subcategorías
Lista de benchmarks de IA
Para simplificar, hemos incluido los 250 benchmarks más recientes de nuestra lista completa de 809 benchmarks. Consulta nuestra metodología para saber cómo recopilamos esta lista.
Notas sobre cómo leer la lista:
Las cuatro columnas con indicadores booleanos (T = verdadero, F = falso) indican qué dimensión de evaluación cubre cada benchmark. Cada indicador responde a una pregunta de sí o no sobre el alcance del benchmark:
- Rendimiento (T/F): ¿Evalúa el benchmark la capacidad o la calidad, como la precisión de los resultados, la finalización de tareas o la inteligencia? Está marcado con T en casi todos los benchmarks, ya que la mayoría evalúa el desempeño de un modelo o sistema. Se marca con F en los benchmarks que se centran únicamente en el costo o la velocidad y no evalúan la calidad de los resultados.
- Precio (T/F): ¿Incluye el benchmark factores relacionados con el costo, como dólares por token, precio por rendimiento o costo por tarea?
- Latencia (T/F): ¿Mide el benchmark la velocidad, como tokens por segundo, tiempo hasta el primer token, rendimiento o tiempo de respuesta? Se marca con F en los benchmarks que evalúan la corrección, independientemente de cuánto tarde la respuesta.
- Fiabilidad (T/F): ¿Evalúa el benchmark la consistencia o la fiabilidad, como la varianza entre ejecuciones, la estabilidad de las tasas de éxito o la robustez? Es el indicador menos común. Se marca con T en los benchmarks diseñados con este fin, incluidos HAL Reliability, tau-bench/tau2-bench, METR Time Horizons y varios benchmarks de agentes en los que la consistencia de la tasa de aprobación es central. Se marca con F en la mayoría de las tablas de clasificación que informan una única puntuación general.
- Resistente a la contaminación (T/F): Indica si el benchmark está diseñado para reducir el riesgo de contaminación de datos, cuando las preguntas del examen aparecen en los datos de entrenamiento de un modelo y este logra puntuaciones altas mediante la memorización en lugar de una capacidad genuina. T significa que el benchmark tiene una defensa significativa, como un conjunto de reserva oculto, preguntas recién generadas o rotativas, actualizaciones mensuales, elementos autogenerados o problemas de competición publicados después del corte de entrenamiento de un modelo. F significa que el benchmark es un dataset público fijo que lleva años en línea y podría haberse absorbido en los corpus de entrenamiento. En esos casos, las puntuaciones altas deben interpretarse con mayor cautela.
En la práctica, una fila marcada como T/F/F/F representa un benchmark puramente de calidad. En cambio, un benchmark marcado como T/T/T/T/F evalúa calidad, costo y velocidad a la vez. Estos indicadores ofrecen una taxonomía compacta que muestra cuáles de los cuatro ejes de evaluación cubre cada benchmark.
¿Por qué algunas celdas están vacías?
Resistente a la contaminación y fuente de contaminación: Estos dos campos suelen estar vacíos en los mismos tipos de filas, especialmente en benchmarks de GPU, GPU en la nube, velocidad y precios. La resistencia a la contaminación es relevante para benchmarks de conocimiento y razonamiento, en los que un modelo podría haber memorizado preguntas de examen de los datos de entrenamiento. Para benchmarks de rendimiento de hardware, latencia o precios, no hay preguntas de examen que contaminar, por lo que el campo se deja vacío en lugar de marcarse con T o F.
Metodología de los benchmarks de IA
Recopilamos los datos de los benchmarks mediante un proceso de investigación y validación en línea. El objetivo era crear una lista estructurada de benchmarks tecnológicos que siguieran siendo útiles para comparar los sistemas e infraestructuras de IA actuales, cubriendo LLMs, GPUs, GPUs en la nube, agentes de IA, IA tabular y ciberseguridad.
Empezamos definiendo el alcance del dataset. Nos centramos en benchmarks que miden la capacidad del modelo, el rendimiento de la infraestructura, el costo, la latencia, la fiabilidad o la resistencia a la contaminación. La lista inicial de fuentes incluía proveedores importantes de análisis y benchmarks, como Artificial Analysis, SemiAnalysis, Vals IA, LMArena, AIMultiple y Epoch IA, además de sitios web oficiales de benchmarks, repositorios de GitHub, artículos académicos, páginas de tablas de clasificación y agregadores de benchmarks de terceros relevantes.
Para cada benchmark, registramos tanto campos descriptivos como evaluativos. Los campos descriptivos recogen qué es el benchmark, qué mide, qué productos o modelos se evalúan y con qué frecuencia se actualiza. Los campos evaluativos clasifican si el benchmark mide el rendimiento, el precio, la latencia o la fiabilidad. También recopilamos información sobre la estructura del benchmark y la integridad de los datos.
Priorizamos las fuentes primarias siempre que fue posible. Entre ellas se incluyeron páginas oficiales de metodología de benchmarks, páginas de tablas de clasificación, repositorios de GitHub, artículos de benchmarks y documentación de proveedores. Cuando una fuente primaria no proporcionaba un campo concreto, utilizábamos fuentes secundarias o agregadores de confianza para cubrir las lagunas, especialmente en el caso de las mejores puntuaciones, la cobertura actual de modelos y las fechas de medición recientes. Se incluyeron columnas de fuente en todo el dataset para que la evidencia de cada valor pudiera rastrearse hasta su origen.
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{ermut2026,
author = {Ermut, Sıla},
title = {{800+ Principales benchmarks de IA}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/ai-benchmarks}},
note = {AIMultiple. Recuperado el 13 de Agosto de 2026}
}
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.