Servicios
Contáctanos

800+ Principales benchmarks de IA

Sıla Ermut
Sıla Ermut
actualizado el 17 de ago. de 2026

Hemos seleccionado una lista con más de 800 benchmarks de IA para LLMs, GPUs, GPUs en la nube, agentes de IA, IA tabular y ciberseguridad que aún no están saturados.

Crecimiento de los benchmarks de IA

Loading Chart

Tenga en cuenta que la mayor parte del pico de mayo a junio corresponde al período durante el cual llevamos a cabo nuestra investigación. Los benchmarks que se actualizan continuamente están fechados en la última vez que los verificamos, por lo que tienden a agruparse en los meses en que recopilamos datos, en lugar de indicar un aumento real de nuevos benchmarks.

Benchmarks de IA por categorías

Hemos enumerado los benchmarks de IA según sus categorías principales. Los LLM benchmarks lideran en términos del mayor número.

Benchmarks de IA por subcategorías

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Lista de benchmarks de IA

Para simplificar, hemos incluido los 250 benchmarks más recientes de nuestra lista completa de 809 benchmarks. Lea nuestra metodología para saber cómo recopilamos esta lista.

Notas sobre cómo leer la lista:

Las cuatro columnas con indicadores booleanos (T = verdadero, F = falso) indican qué dimensión de evaluación cubre cada benchmark. Cada indicador responde a una pregunta de sí/no sobre el alcance del benchmark:

  • Rendimiento (T/F): ¿Evalúa el benchmark la capacidad o la calidad, como la precisión de la salida, la finalización de tareas o la inteligencia? Se marca T para casi todos los benchmarks, ya que la mayoría evalúa el rendimiento de un model o sistema. Se marca F para benchmarks que se centran exclusivamente en el coste o la velocidad y no evalúan la calidad de la salida.
  • Precio (T/F): ¿Incluye el benchmark factores relacionados con el coste, como dólares por token, precio por throughput o coste por tarea?
  • Latencia (T/F): ¿Mide el benchmark la velocidad, como tokens por segundo, tiempo hasta el primer token, throughput o tiempo de respuesta? Es F para benchmarks que evalúan la corrección, independientemente de cuánto tarde la respuesta.
  • Fiabilidad (T/F): ¿Evalúa el benchmark la consistencia o la fiabilidad, como la varianza entre ejecuciones, la estabilidad de las tasas de éxito o la robustez? Es el indicador menos común. Es T para benchmarks diseñados con este fin, incluidos HAL Reliability, tau-bench/tau2-bench, METR Time Horizons y varios benchmarks de agentes en los que la consistencia de la tasa de aprobación es central. Es F para la mayoría de las tablas de clasificación que informan una puntuación global única.
  • Resistente a contaminación (T/F): Indica si el benchmark está diseñado para reducir el riesgo de contaminación de datos, donde las preguntas de prueba aparecen en los datos de entrenamiento de un model y el model logra puntuaciones altas mediante la memorización en lugar de una capacidad genuina. T significa que el benchmark tiene una defensa significativa, como un conjunto de reserva oculto, preguntas nuevas o rotativas, actualizaciones mensuales, elementos autogenerados o problemas de competición publicados después de la fecha de corte de entrenamiento del model. F significa que el benchmark es un dataset público fijo que ha estado en línea durante años y puede haber sido absorbido en los corpus de entrenamiento. En esos casos, las puntuaciones altas deben interpretarse con mayor precaución.

En la práctica, una fila marcada T/F/F/F representa un benchmark puramente de calidad. Por el contrario, un benchmark marcado T/T/T/T/F evalúa conjuntamente calidad, coste y velocidad. Estos indicadores ofrecen una taxonomía compacta que muestra cuáles de los cuatro ejes de evaluación cubre cada benchmark.

¿Por qué algunas celdas están en blanco?

Resistente a contaminación y fuente de contaminación: Estos dos campos suelen estar en blanco para los mismos tipos de filas, especialmente GPU, GPUs en la nube, velocidad y benchmarks de precios. La resistencia a la contaminación es relevante para los benchmarks de conocimiento y razonamiento, en los que un model podría haber memorizado las preguntas de prueba de los datos de entrenamiento. Para benchmarks de throughput de hardware, latencia o precios, no hay preguntas de prueba que contaminar, por lo que el campo se deja vacío en lugar de marcarse T o F.

Metodología de benchmarks de IA

Recopilamos los datos de los benchmarks mediante un proceso de investigación y validación en línea. El objetivo era construir una lista estructurada de benchmarks de tecnología que siguen siendo útiles para comparar los sistemas e infraestructuras de IA actuales, cubriendo LLMs, GPUs, GPUs en la nube, agentes de IA, IA tabular y ciberseguridad.

Comenzamos definiendo el alcance del dataset. Nos centramos en benchmarks que miden la capacidad del model, el rendimiento de la infraestructura, el coste, la latencia, la fiabilidad o la resistencia a la contaminación. La lista inicial de fuentes incluía a los principales proveedores de análisis y benchmarks, como Artificial Analysis, SemiAnalysis, Vals IA, LMArena, AIMultiple y Epoch IA, así como sitios web oficiales de benchmarks, repositorios de GitHub, artículos académicos, páginas de tablas de clasificación y agregadores de benchmarks de terceros relevantes.

Para cada benchmark, registramos tanto campos descriptivos como evaluativos. Los campos descriptivos capturan qué es el benchmark, qué mide, qué productos o models se evalúan y con qué frecuencia se actualiza. Los campos evaluativos clasifican si el benchmark mide el rendimiento, el precio, la latencia o la fiabilidad. También recopilamos información sobre la estructura del benchmark y la integridad de los datos.

Priorizamos las fuentes primarias siempre que fue posible. Estas incluyeron páginas oficiales de metodología de benchmarks, páginas de tablas de clasificación, repositorios de GitHub, artículos sobre benchmarks y documentación de proveedores. Cuando una fuente primaria no proporcionaba un campo específico, utilizábamos fuentes secundarias o agregadores de buena reputación para llenar los vacíos, especialmente para las mejores puntuaciones, la cobertura actual de models y las fechas de medición recientes. Se incluyeron columnas de fuentes en todo el dataset para que la evidencia de cada valor pudiera rastrearse hasta su fuente.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Cita esta investigación

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Sıla Ermut (2026) - "800+ Principales benchmarks de IA". Publicado en línea en AIMultiple.com. Recuperado el 17 de Agosto de 2026, de: https://aimultiple.com/ai-benchmarks [Recurso en línea]

Ermut, S. (2026, 17 de Agosto). 800+ Principales benchmarks de IA. AIMultiple. https://aimultiple.com/ai-benchmarks

@misc{ermut2026,
  author = {Ermut, Sıla},
  title  = {{800+ Principales benchmarks de IA}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-benchmarks}},
  note   = {AIMultiple. Recuperado el 17 de Agosto de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 250 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene un archivo CSV.

Última actualización: 17 de Agosto de 2026
Descargar
Sıla Ermut
Sıla Ermut
Analista de la industria
Sıla Ermut es analista de la industria en AIMultiple y cubre modelos de IA, infraestructura de IA, gobernanza de IA y aplicaciones empresariales de IA. Su investigación se centra principalmente en el uso de la IA en marketing, atención sanitaria, cadenas de suministro y sostenibilidad.
Anteriormente trabajó como reclutadora en empresas de gestión de proyectos y consultoría. Sıla tiene un máster en Psicología Social y una licenciatura en Relaciones Internacionales.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450