Nous avons constitué une liste de plus de 800 benchmarks d'IA pour les LLMs, les GPUs, les GPUs cloud, les agents IA, l'IA tabulaire et la cybersécurité qui ne sont pas encore saturés.
Croissance des benchmarks d'IA
Notez que la majeure partie du pic de mai à juin correspond à la période durant laquelle nous avons mené nos recherches. Les benchmarks mis à jour en continu sont datés de la dernière vérification effectuée, de sorte qu'ils tendent à se regrouper autour des mois où nous avons collecté les données plutôt qu'à indiquer une véritable augmentation du nombre de nouveaux benchmarks.
Benchmarks d'IA par catégories
Nous avons classé les benchmarks d'IA en fonction de leurs principales catégories. Les benchmarks LLM arrivent en tête en termes de nombre total.
Benchmarks d'IA par sous-catégories
Liste des benchmarks d'IA
Par souci de simplicité, nous avons inclus les 250 benchmarks les plus récents de notre liste complète de 809 benchmarks. Lisez notre méthodologie pour savoir comment nous avons constitué cette liste.
Remarques sur la façon de lire la liste :
Les quatre colonnes contenant des indicateurs booléens (T = vrai, F = faux) indiquent quelle dimension d'évaluation chaque benchmark couvre. Chaque indicateur répond à une question oui/non sur le périmètre du benchmark :
- Performance (T/F) : Le benchmark évalue-t-il la capacité ou la qualité, comme l'exactitude des résultats, l'achèvement des tâches ou l'intelligence ? Cet indicateur est T pour presque tous les benchmarks, car la plupart mesurent la performance d'un modèle ou d'un système. Il est F pour les benchmarks qui se concentrent uniquement sur le coût ou la vitesse et n'évaluent pas la qualité des résultats.
- Prix (T/F) : Le benchmark inclut-il des facteurs liés au coût, comme le coût en dollars par token, le prix par débit ou le coût par tâche ?
- Latence (T/F) : Le benchmark mesure-t-il la vitesse, comme le nombre de tokens par seconde, le temps jusqu'au premier token, le débit ou le temps de réponse ? Il est F pour les benchmarks qui évaluent l'exactitude, indépendamment du temps de réponse.
- Fiabilité (T/F) : Le benchmark évalue-t-il la cohérence ou la fiabilité, comme la variance entre les exécutions, la stabilité des taux de réussite ou la robustesse ? C'est l'indicateur le moins courant. Il est T pour les benchmarks conçus à cet effet, notamment HAL Reliability, tau-bench/tau2-bench, METR Time Horizons et plusieurs benchmarks d'agents pour lesquels la cohérence du taux de réussite est centrale. Il est F pour la plupart des classements qui publient un score global unique.
- Résistant à la contamination (T/F) : Indique si le benchmark est conçu pour réduire le risque de contamination des données, lorsque les questions de test apparaissent dans les données d'entraînement d'un modèle et que celui-ci obtient des scores élevés par mémorisation plutôt que par une véritable capacité. T signifie que le benchmark dispose d'une défense significative, comme un jeu de validation masqué, des questions nouvellement générées ou renouvelées, des actualisations mensuelles, des éléments auto-générés ou des problèmes de compétition publiés après la date limite d'entraînement d'un modèle. F signifie que le benchmark est un ensemble de données public fixe qui est en ligne depuis des années et qui a pu être absorbé dans les corpus d'entraînement. Dans ce cas, les scores élevés doivent être interprétés avec une plus grande prudence.
En pratique, une ligne marquée T/F/F/F représente un benchmark purement axé sur la qualité. À l'inverse, un benchmark marqué T/T/T/T/F évalue à la fois la qualité, le coût et la vitesse. Ces indicateurs fournissent une taxonomie compacte montrant lesquels des quatre axes d'évaluation chaque benchmark couvre.
Pourquoi certaines cellules sont-elles vides ?
Résistance à la contamination et source de contamination : Ces deux champs sont généralement vides pour les mêmes types de lignes, en particulier les benchmarks de GPU, de cloud GPU, de vitesse et de prix. La résistance à la contamination concerne les benchmarks de connaissances et de raisonnement, pour lesquels un modèle peut avoir mémorisé des questions de test issues des données d'entraînement. Pour les benchmarks de débit matériel, de latence ou de prix, il n'y a pas de questions de test à contaminer, de sorte que le champ reste vide plutôt que d'être marqué T ou F.
Méthodologie des benchmarks d'IA
Nous avons collecté les données des benchmarks au moyen d'un processus de recherche et de validation en ligne. L'objectif était de construire une liste structurée de benchmarks technologiques qui restent utiles pour comparer les systèmes et infrastructures d'IA actuels, couvrant les LLMs, les GPUs, les cloud GPUs, les agents IA, l'IA tabulaire et la cybersécurité.
Nous avons commencé par définir le périmètre du jeu de données. Nous sommes concentrés sur les benchmarks qui mesurent la capacité des modèles, les performances de l'infrastructure, le coût, la latence, la fiabilité ou la résistance à la contamination. La liste initiale des sources comprenait de grands fournisseurs de benchmarks et d'analyses tels que Artificial Analysis, SemiAnalysis, Vals IA, LMArena, AIMultiple et Epoch IA, ainsi que des sites officiels de benchmarks, des dépôts GitHub, des articles académiques, des pages de classement et des agrégateurs tiers pertinents.
Pour chaque benchmark, nous avons enregistré à la fois des champs descriptifs et évaluatifs. Les champs descriptifs indiquent ce qu'est le benchmark, ce qu'il mesure, quels produits ou modèles sont évalués et à quelle fréquence il est mis à jour. Les champs évaluatifs classent si le benchmark mesure la performance, le prix, la latence ou la fiabilité. Nous avons également collecté des informations sur la structure du benchmark et l'intégrité des données.
Nous avons privilégié les sources primaires dans la mesure du possible. Celles-ci comprenaient les pages officielles de méthodologie des benchmarks, les pages de classement, les dépôts GitHub, les articles de référence et la documentation des fournisseurs. Lorsqu'une source primaire ne fournissait pas un champ précis, nous avons utilisé des sources secondaires réputées ou des agrégateurs pour combler les lacunes, notamment pour les meilleurs scores, la couverture actuelle des modèles et les dates de mesure récentes. Des colonnes de source ont été incluses dans l'ensemble du jeu de données afin que la preuve de chaque valeur puisse être tracée jusqu'à sa source.
Citer cette recherche
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{ermut2026,
author = {Ermut, Sıla},
title = {{800+ Principaux benchmarks d'IA}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/ai-benchmarks}},
note = {AIMultiple. Consulté le 17 Août 2026}
}Résultats et horodatages de 250 points de données. Téléchargez les données utilisées dans cet article sous forme de fichier ZIP contenant un fichier CSV.
Elle a précédemment travaillé comme recruteuse dans des cabinets de gestion de projet et de conseil. Sıla est titulaire d’un master en psychologie sociale et d’une licence en relations internationales.
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.