Premium
Services
Premium

Benchmarks LLM

Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple. Voir la méthodologie.

MEILLEUR MODÈLE
Claude Opus 5
Indice 86
Meilleur rapport qualité-prix
DeepSeek V4 Flash 0731
$0.11 / 1M
Le plus rapide
Trinity Large Thinking
0.12s TTFT
Couverture
153 modèles
12 benchmarks · 701 évaluations
Indice d'intelligence AIMultiple

Classement

Les modèles les mieux notés sur tous les benchmarks.

Filter & Sort
#
Modèle
Index
Agentic RAG
ARC-AGI-1
ARC-AGI-2
ArxivMath
CritPt
FinanceReasoning
FrontierMath
LegalBench
MMMU-Pro
Terminal-Bench 2.1
Terminal-Bench Hard
Text-to-SQL
1
Claude Opus 5
Claude Opus 5
Anthropic
86
-989091299073878589--
2
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
81
879893-329083878389-74
3
Claude Fable 5
Claude Fable 5
Anthropic
79
989989792990888981856390
4
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
66
919784-308771858187-71
5
Claude Opus 4.8
Claude Opus 4.8
Anthropic
66
100937271-89568479855877
6
Claude Fable 5.1
Claude Fable 5.1
Anthropic
66
-9890-31-8889-91--
7
Gemini 3.7 Flash
Gemini 3.7 Flash
Google
62
-9685-14-37878686--
8
GPT-5.5 Pro
GPT-5.5 Pro
OpenAI
62
-9785-31-78-----
9
Kimi K3
Kimi K3
Moonshot AI
61
939560-238839868285-77
10
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
60
96----9181----79
Page 1 sur 16

Coût$10.00
Latence3.83s
Contexte1M
TTFT3.83s
ARC-AGI-1
98
ARC-AGI-2
90
ArxivMath
91
CritPt
29
FinanceReasoning
90
FrontierMath
73
LegalBench
87
MMMU-Pro
85
Terminal-Bench 2.1
89

Coût$8.00
Latence4.43s
Contexte1M
TTFT4.43s
Agentic RAG
87
ARC-AGI-1
98
ARC-AGI-2
93
CritPt
32
FinanceReasoning
90
FrontierMath
83
LegalBench
87
MMMU-Pro
83
Terminal-Bench 2.1
89
Text-to-SQL
74

Coût$20.00
Latence5.28s
Contexte1M
TTFT5.28s
Agentic RAG
98
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
CritPt
29
FinanceReasoning
90
FrontierMath
88
LegalBench
89
MMMU-Pro
81
Terminal-Bench 2.1
85
Terminal-Bench Hard
63
Text-to-SQL
90

Coût$4.50
Latence1.92s
Contexte1M
TTFT1.92s
Agentic RAG
91
ARC-AGI-1
97
ARC-AGI-2
84
CritPt
30
FinanceReasoning
87
FrontierMath
71
LegalBench
85
MMMU-Pro
81
Terminal-Bench 2.1
87
Text-to-SQL
71

Coût$10.00
Latence4.53s
Contexte1M
TTFT4.53s
Agentic RAG
100
ARC-AGI-1
93
ARC-AGI-2
72
ArxivMath
71
FinanceReasoning
89
FrontierMath
56
LegalBench
84
MMMU-Pro
79
Terminal-Bench 2.1
85
Terminal-Bench Hard
58
Text-to-SQL
77

Coût$20.00
Latence5.44s
Contexte1M
TTFT5.44s
ARC-AGI-1
98
ARC-AGI-2
90
CritPt
31
FrontierMath
88
LegalBench
89
Terminal-Bench 2.1
91

Coût$1.50
Latence6.05s
Contexte1M
TTFT6.05s
ARC-AGI-1
96
ARC-AGI-2
85
CritPt
14
FrontierMath
37
LegalBench
87
MMMU-Pro
86
Terminal-Bench 2.1
86

Coût$33.75
Latence3.65s
Contexte1M
TTFT3.65s
ARC-AGI-1
97
ARC-AGI-2
85
CritPt
31
FrontierMath
78

Coût$5.44
Latence0.93s
Contexte1M
TTFT0.93s
Agentic RAG
93
ARC-AGI-1
95
ARC-AGI-2
60
CritPt
23
FinanceReasoning
88
FrontierMath
39
LegalBench
86
MMMU-Pro
82
Terminal-Bench 2.1
85
Text-to-SQL
77

Coût$2.00
Latence10.25s
Contexte1M
TTFT10.25s
Agentic RAG
96
FinanceReasoning
91
FrontierMath
81
Text-to-SQL
79
Page 1 sur 16
Évolution dans le temps
Indice d'intelligence par date de sortie du modèle
Coût vs performance
Coût combiné par rapport à l'indice d'intelligence
Modèle × Benchmark
Meilleurs modèles sur les benchmarks sélectionnés
Méthodologie

Comment l'indice est construit

Chaque benchmark devient une position sur une échelle de 0 à 100, et l'indice est la moyenne pondérée de ces positions. Un benchmark sur lequel un modèle n'a pas été évalué compte comme la moyenne du champ, afin que les scores restent comparables. Indice = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).

AIMultiple
Agentic RAGRoutage multi-bases de données et génération de requêtes SQL sur 5 bases de données (BIRD-SQL, 500 questions).
Public
ARC-AGI-1Raisonnement abstrait few-shot sur des transformations de grilles ; le premier benchmark ARC Prize.
Public
ARC-AGI-2Nouvelles énigmes de raisonnement visuel évaluant la généralisation, et non la mémorisation.
Public
ArxivMathProblemes de mathematiques recents d'arXiv, executes peu apres publication pour limiter la contamination.
Public
BioMysteryBenchBenchmark d'Anthropic evaluant si les agents peuvent resoudre de vrais mysteres bio-informatiques a partir de donnees brutes.
Public
CritPtProblemes de physique de niveau recherche exigeant des derivations multi-etapes.
AIMultiple
FinanceReasoningRaisonnement financier complexe en plusieurs étapes sur 238 questions difficiles de FinanceReasoning.
Public
Frontier-BenchTaches logicielles agentiques sur des depots de pointe, notees par taux de resolution.
Public
FrontierMathProblèmes de mathématiques de recherche inédits, rédigés par des experts (niveaux 1 à 4).
Public
LegalBenchRaisonnement juridique participatif sur 162 tâches créées par des praticiens du droit.
Public
MMMU-ProComprehension multimodale de niveau universitaire entre disciplines, durcie contre les raccourcis textuels.
Public
Terminal-Bench 2.1Taches agentiques en terminal couvrant le genie logiciel, les donnees et l'administration systeme.
Public
Terminal-Bench HardLe sous-ensemble difficile de Terminal-Bench : des taches logicielles multi-etapes resolues dans un vrai terminal.
Public
Terminal-Bench-ScienceTaches en terminal issues de flux de travail reels de calcul scientifique.
AIMultiple
Text-to-SQLPrécision de la génération de requêtes SQL à partir du langage naturel sur plus de 35 LLM.
Mises à jour récentes

Mises à jour récentes

Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.

Google

Gemini 3.8 Flash

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Anthropic

Claude Fable 5.1

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Tencent

Hy4 preview

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Z AI

GLM 5.3 Flash

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Chronologie des sorties de modèles d'IALes 12 derniers modèles en 21 jours

Principales sorties de modèles d'IA des fournisseurs leaders au cours des 21 derniers jours.

Fournisseur
OpenAI
OpenAI
04 Sep 2026
GPT-6 Astra +1 de plusGPT-6 AstraGPT-6 Astra Pro
Alibaba Cloud
Alibaba Cloud
26 Août 2026
Qwen3.8 Flash
03 Sep 2026
Qwen3.8 Max (0902)
Google
Google
02 Sep 2026
Gemini 3.8 Flash
Meta
Meta
21 Août 2026
Muse Spark 1.2 Contributor
02 Sep 2026
Muse Spark 1.3 +1 de plusMuse Spark 1.3Muse Spark 1.3 Contributor
Anthropic
Anthropic
01 Sep 2026
Claude Fable 5.1
Tencent
Tencent
28 Août 2026
Hy4 preview
Z AI
Z AI
18 Août 2026
GLM 5.3
26 Août 2026
GLM 5.3 Flash

Explorez Cas d'utilisation, analyses et points de référence du LLM

LLM Automatisation: Top 7 outils & 8 études de cas 

LLM
Analyse
27 Août

L'automatisation LLM désigne le passage à des outils d'automatisation intelligents qui exploitent les LLMs, notamment des agents IA, des LLMs affinés et des RAG models pour automatiser et coordonner des tâches. Explorez ce qu'est l'automatisation LLM, ses principales applications concrètes et ses principaux outils : Large language models dans l'automatisation constituent une approche systématique qui…

En savoir plus
LLM
Évaluation en Monde Ouvert
26 Août

LLM Orchestration: 22 frameworks et passerelles

Optimiser l'orchestration LLM est essentiel pour améliorer les performances tout en maîtrisant l'utilisation des ressources. Pour évaluer la performance des différentes approches d'orchestration en pratique, nous avons évalué : Découvrez une sélection d'outils d'orchestration LLM, notamment les frameworks pour développeurs et les passerelles d'entreprise : L'orchestration LLM consiste à gérer et à intégrer plusieurs grands…

LLM
Benchmark
24 Août

AIM Enterprise: Benchmark d'entreprise agentique

Les entreprises utilisent des LLMs tous les jours pour leurs tâches courantes. Pour trouver les LLMs les plus rentables, nous avons conçu AIM Enterprise, un benchmark d'entreprise agentique, dans lequel nous avons utilisé 69 tâches d'entreprise réelles couvrant la stratégie, le marketing, les RH, les ventes et les opérations. Deux modèles de juge ont noté…

LLM
Benchmark
24 Août

Text-to-SQL: Comparaison de la précision des LLM

Nous avons exécuté 36 large language models sur 759 questions de BIRD-SQL, chaque model écrivant SQL contre une base de données qu’il devait identifier lui-même parmi 11 candidates. Toute requête analysable a été exécutée sur la base de données réelle et son ensemble de résultats comparé à l’ensemble de résultats de la requête de référence…

LLM
Analyse
21 Août

LLM Paramètres: GPT-5 High, Moyen, Bas et Minimal

Certains LLMs, comme OpenAI’s GPT-5 family, existent en différentes versions (par exemple, GPT-5, GPT-5-mini et GPT-5-nano) et avec divers réglages de paramètres, notamment élevé, moyen, bas et minimal. Ci-dessous, nous explorons les différences entre ces versions de modèles en rassemblant leurs performances de benchmark et les coûts d’exécution de ces benchmarks. Nous avons utilisé la…

LLM
Benchmark
21 Août

HALC-Bench: LLM Hallucination sur un benchmark de récupération en contexte long

HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark) mesure la résistance d'un LLM à fabriquer des preuves pour une métrique qui n'existe pas dans le document cible en utilisant 3 bottes de foin placées au début, au milieu et à la fin de la fenêtre de contexte du modèle, avec 204 questions. claude-fable-5 a répondu correctement…

LLM
Comparaison des Fonctionnalités
21 Août

Meilleurs outils LLMOps et comparaison avec les MLOPs

Les plateformes LLMOps gèrent le côté opérationnel de l’exécution des modèles de langage de grande taille : déploiement, surveillance, évaluation et gestion des coûts. Nous avons examiné les meilleurs outils LLMOps, leurs fonctionnalités principales, leurs modèles de tarification et leurs différences afin d’identifier la solution la mieux adaptée à différents cas d’usage. Une description de…

LLM
Analyse
19 Août

50+ Cas d'utilisation de ChatGPT avec des exemples concrets

ChatGPT a atteint environ 1 milliard d’utilisateurs actifs hebdomadaires début 2026, soit environ 10 % de la population mondiale.1 OpenAI a dépassé 20 milliards de dollars de revenus annuels pour 2025, confirmé par la directrice financière Sarah Friar.2 L’Anthropic Economic Index distingue deux modes d’utilisation : l’augmentation, où un humain interagit avec l’IA, et l’automatisation, où…

LLM
Analyse
19 Août

ChatGPT pour le service client: les 10 meilleurs cas d'utilisation

ChatGPT est passé du statut de nouveauté à celui d'infrastructure du service client. Les entreprises l'utilisent pour réduire les temps de réponse, absorber des volumes que leurs équipes ne peuvent pas gérer et diminuer le coût des interactions courantes. Mais les résultats varient fortement selon sa mise en œuvre. OpenAI a lancé GPT-5.6, un modèle…

LLM
Analyse
18 Août

L'avenir des grands modèles de langage

Découvrez l'avenir des grands modèles de langage en explorant des approches prometteuses, telles que l'auto-apprentissage, la vérification des faits et l'expertise parcimonieuse, qui pourraient remédier aux limites des LLM. Comparaison des taux de réussite des LLM Claude Sonnet 4.6 a dominé le benchmark avec un score global de 0.748, les variantes de base et de…

LLM
Benchmark
16 Août

Densité d'intelligence des 71 LLMs pour des modèles plus intelligents et plus denses

Nous avons suivi 71 LLMs publiés entre février 2023 et mai 2026 et avons collecté 10 benchmarks publics pour mesurer la densité d'intelligence. Nous avons divisé le score de capacité par la ressource que le modèle consomme (paramètres actifs, coût de calcul d'entraînement et prix d'inférence). Pour calculer la densité d'intelligence, nous avons exécuté les…