Servicios
Contáctanos

800+ Principales benchmarks de IA

Sıla Ermut
Sıla Ermut
actualizado el 13 de ago. de 2026

Hemos curado una lista con más de 800 benchmarks de IA para LLMs, GPUs, GPUs en la nube, agentes de IA, IA tabular y ciberseguridad que aún no están saturados.

Crecimiento de los benchmarks de IA

Loading Chart

Ten en cuenta que la mayor parte del pico de mayo–junio corresponde al período en el que llevamos a cabo nuestra investigación. Los benchmarks que se actualizan continuamente llevan la fecha de la última verificación que hicimos, por lo que tienden a agruparse en los meses en que recopilamos los datos, más que a indicar un aumento real de nuevos benchmarks.

Benchmarks de IA por categorías

Hemos clasificado los benchmarks de IA según sus categorías principales. Los benchmarks de LLM lideran en número.

Benchmarks de IA por subcategorías

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Lista de benchmarks de IA

Para simplificar, hemos incluido los 250 benchmarks más recientes de nuestra lista completa de 809 benchmarks. Consulta nuestra metodología para saber cómo recopilamos esta lista.

Notas sobre cómo leer la lista:

Las cuatro columnas con indicadores booleanos (T = verdadero, F = falso) indican qué dimensión de evaluación cubre cada benchmark. Cada indicador responde a una pregunta de sí o no sobre el alcance del benchmark:

  • Rendimiento (T/F): ¿Evalúa el benchmark la capacidad o la calidad, como la precisión de los resultados, la finalización de tareas o la inteligencia? Está marcado con T en casi todos los benchmarks, ya que la mayoría evalúa el desempeño de un modelo o sistema. Se marca con F en los benchmarks que se centran únicamente en el costo o la velocidad y no evalúan la calidad de los resultados.
  • Precio (T/F): ¿Incluye el benchmark factores relacionados con el costo, como dólares por token, precio por rendimiento o costo por tarea?
  • Latencia (T/F): ¿Mide el benchmark la velocidad, como tokens por segundo, tiempo hasta el primer token, rendimiento o tiempo de respuesta? Se marca con F en los benchmarks que evalúan la corrección, independientemente de cuánto tarde la respuesta.
  • Fiabilidad (T/F): ¿Evalúa el benchmark la consistencia o la fiabilidad, como la varianza entre ejecuciones, la estabilidad de las tasas de éxito o la robustez? Es el indicador menos común. Se marca con T en los benchmarks diseñados con este fin, incluidos HAL Reliability, tau-bench/tau2-bench, METR Time Horizons y varios benchmarks de agentes en los que la consistencia de la tasa de aprobación es central. Se marca con F en la mayoría de las tablas de clasificación que informan una única puntuación general.
  • Resistente a la contaminación (T/F): Indica si el benchmark está diseñado para reducir el riesgo de contaminación de datos, cuando las preguntas del examen aparecen en los datos de entrenamiento de un modelo y este logra puntuaciones altas mediante la memorización en lugar de una capacidad genuina. T significa que el benchmark tiene una defensa significativa, como un conjunto de reserva oculto, preguntas recién generadas o rotativas, actualizaciones mensuales, elementos autogenerados o problemas de competición publicados después del corte de entrenamiento de un modelo. F significa que el benchmark es un dataset público fijo que lleva años en línea y podría haberse absorbido en los corpus de entrenamiento. En esos casos, las puntuaciones altas deben interpretarse con mayor cautela.

En la práctica, una fila marcada como T/F/F/F representa un benchmark puramente de calidad. En cambio, un benchmark marcado como T/T/T/T/F evalúa calidad, costo y velocidad a la vez. Estos indicadores ofrecen una taxonomía compacta que muestra cuáles de los cuatro ejes de evaluación cubre cada benchmark.

¿Por qué algunas celdas están vacías?

Resistente a la contaminación y fuente de contaminación: Estos dos campos suelen estar vacíos en los mismos tipos de filas, especialmente en benchmarks de GPU, GPU en la nube, velocidad y precios. La resistencia a la contaminación es relevante para benchmarks de conocimiento y razonamiento, en los que un modelo podría haber memorizado preguntas de examen de los datos de entrenamiento. Para benchmarks de rendimiento de hardware, latencia o precios, no hay preguntas de examen que contaminar, por lo que el campo se deja vacío en lugar de marcarse con T o F.

Metodología de los benchmarks de IA

Recopilamos los datos de los benchmarks mediante un proceso de investigación y validación en línea. El objetivo era crear una lista estructurada de benchmarks tecnológicos que siguieran siendo útiles para comparar los sistemas e infraestructuras de IA actuales, cubriendo LLMs, GPUs, GPUs en la nube, agentes de IA, IA tabular y ciberseguridad.

Empezamos definiendo el alcance del dataset. Nos centramos en benchmarks que miden la capacidad del modelo, el rendimiento de la infraestructura, el costo, la latencia, la fiabilidad o la resistencia a la contaminación. La lista inicial de fuentes incluía proveedores importantes de análisis y benchmarks, como Artificial Analysis, SemiAnalysis, Vals IA, LMArena, AIMultiple y Epoch IA, además de sitios web oficiales de benchmarks, repositorios de GitHub, artículos académicos, páginas de tablas de clasificación y agregadores de benchmarks de terceros relevantes.

Para cada benchmark, registramos tanto campos descriptivos como evaluativos. Los campos descriptivos recogen qué es el benchmark, qué mide, qué productos o modelos se evalúan y con qué frecuencia se actualiza. Los campos evaluativos clasifican si el benchmark mide el rendimiento, el precio, la latencia o la fiabilidad. También recopilamos información sobre la estructura del benchmark y la integridad de los datos.

Priorizamos las fuentes primarias siempre que fue posible. Entre ellas se incluyeron páginas oficiales de metodología de benchmarks, páginas de tablas de clasificación, repositorios de GitHub, artículos de benchmarks y documentación de proveedores. Cuando una fuente primaria no proporcionaba un campo concreto, utilizábamos fuentes secundarias o agregadores de confianza para cubrir las lagunas, especialmente en el caso de las mejores puntuaciones, la cobertura actual de modelos y las fechas de medición recientes. Se incluyeron columnas de fuente en todo el dataset para que la evidencia de cada valor pudiera rastrearse hasta su origen.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Cita esta investigación

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Sıla Ermut (2026) - "800+ Principales benchmarks de IA". Publicado en línea en AIMultiple.com. Recuperado el 13 de Agosto de 2026, de: https://aimultiple.com/ai-benchmarks [Recurso en línea]

Ermut, S. (2026, 13 de Agosto). 800+ Principales benchmarks de IA. AIMultiple. https://aimultiple.com/ai-benchmarks

@misc{ermut2026,
  author = {Ermut, Sıla},
  title  = {{800+ Principales benchmarks de IA}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-benchmarks}},
  note   = {AIMultiple. Recuperado el 13 de Agosto de 2026}
}
Sıla Ermut
Sıla Ermut
Analista de la industria
Sıla Ermut es analista de la industria en AIMultiple que cubre modelos de IA, infraestructura de IA, gobernanza de IA y aplicaciones empresariales de IA. Su investigación se centra principalmente en el uso de la IA en marketing, salud, cadenas de suministro y sostenibilidad. Anteriormente trabajó como reclutadora en empresas de gestión de proyectos y consultoría. Sıla tiene un máster en Psicología Social y una licenciatura en Relaciones Internacionales.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450