Premium
Services
Premium

Benchmarks LLM

Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple. Voir la méthodologie.

MEILLEUR MODÈLE
Claude Opus 5
Indice 86
Meilleur rapport qualité-prix
DeepSeek V4 Flash 0731
$0.11 / 1M
Le plus rapide
Trinity Large Thinking
0.12s TTFT
Couverture
153 modèles
12 benchmarks · 701 évaluations
Indice d'intelligence AIMultiple

Classement

Les modèles les mieux notés sur tous les benchmarks.

Filter & Sort
#
Modèle
Index
Agentic RAG
ARC-AGI-1
ARC-AGI-2
ArxivMath
CritPt
FinanceReasoning
FrontierMath
LegalBench
MMMU-Pro
Terminal-Bench 2.1
Terminal-Bench Hard
Text-to-SQL
1
Claude Opus 5
Claude Opus 5
Anthropic
86
-989091299073878589--
2
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
81
879893-329083878389-74
3
Claude Fable 5
Claude Fable 5
Anthropic
79
989989792990888981856390
4
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
66
919784-308771858187-71
5
Claude Opus 4.8
Claude Opus 4.8
Anthropic
66
100937271-89568479855877
6
Claude Fable 5.1
Claude Fable 5.1
Anthropic
66
-9890-31-8889-91--
7
Gemini 3.7 Flash
Gemini 3.7 Flash
Google
62
-9685-14-37878686--
8
GPT-5.5 Pro
GPT-5.5 Pro
OpenAI
62
-9785-31-78-----
9
Kimi K3
Kimi K3
Moonshot AI
61
939560-238839868285-77
10
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
60
96----9181----79
Page 1 sur 16

Coût$10.00
Latence3.83s
Contexte1M
TTFT3.83s
ARC-AGI-1
98
ARC-AGI-2
90
ArxivMath
91
CritPt
29
FinanceReasoning
90
FrontierMath
73
LegalBench
87
MMMU-Pro
85
Terminal-Bench 2.1
89

Coût$8.00
Latence4.43s
Contexte1M
TTFT4.43s
Agentic RAG
87
ARC-AGI-1
98
ARC-AGI-2
93
CritPt
32
FinanceReasoning
90
FrontierMath
83
LegalBench
87
MMMU-Pro
83
Terminal-Bench 2.1
89
Text-to-SQL
74

Coût$20.00
Latence5.28s
Contexte1M
TTFT5.28s
Agentic RAG
98
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
CritPt
29
FinanceReasoning
90
FrontierMath
88
LegalBench
89
MMMU-Pro
81
Terminal-Bench 2.1
85
Terminal-Bench Hard
63
Text-to-SQL
90

Coût$4.50
Latence1.92s
Contexte1M
TTFT1.92s
Agentic RAG
91
ARC-AGI-1
97
ARC-AGI-2
84
CritPt
30
FinanceReasoning
87
FrontierMath
71
LegalBench
85
MMMU-Pro
81
Terminal-Bench 2.1
87
Text-to-SQL
71

Coût$10.00
Latence4.53s
Contexte1M
TTFT4.53s
Agentic RAG
100
ARC-AGI-1
93
ARC-AGI-2
72
ArxivMath
71
FinanceReasoning
89
FrontierMath
56
LegalBench
84
MMMU-Pro
79
Terminal-Bench 2.1
85
Terminal-Bench Hard
58
Text-to-SQL
77

Coût$20.00
Latence5.44s
Contexte1M
TTFT5.44s
ARC-AGI-1
98
ARC-AGI-2
90
CritPt
31
FrontierMath
88
LegalBench
89
Terminal-Bench 2.1
91

Coût$1.50
Latence6.05s
Contexte1M
TTFT6.05s
ARC-AGI-1
96
ARC-AGI-2
85
CritPt
14
FrontierMath
37
LegalBench
87
MMMU-Pro
86
Terminal-Bench 2.1
86

Coût$33.75
Latence3.65s
Contexte1M
TTFT3.65s
ARC-AGI-1
97
ARC-AGI-2
85
CritPt
31
FrontierMath
78

Coût$5.44
Latence0.93s
Contexte1M
TTFT0.93s
Agentic RAG
93
ARC-AGI-1
95
ARC-AGI-2
60
CritPt
23
FinanceReasoning
88
FrontierMath
39
LegalBench
86
MMMU-Pro
82
Terminal-Bench 2.1
85
Text-to-SQL
77

Coût$2.00
Latence10.25s
Contexte1M
TTFT10.25s
Agentic RAG
96
FinanceReasoning
91
FrontierMath
81
Text-to-SQL
79
Page 1 sur 16
Évolution dans le temps
Indice d'intelligence par date de sortie du modèle
Coût vs performance
Coût combiné par rapport à l'indice d'intelligence
Modèle × Benchmark
Meilleurs modèles sur les benchmarks sélectionnés
Méthodologie

Comment l'indice est construit

Chaque benchmark devient une position sur une échelle de 0 à 100, et l'indice est la moyenne pondérée de ces positions. Un benchmark sur lequel un modèle n'a pas été évalué compte comme la moyenne du champ, afin que les scores restent comparables. Indice = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).

AIMultiple
Agentic RAGRoutage multi-bases de données et génération de requêtes SQL sur 5 bases de données (BIRD-SQL, 500 questions).
Public
ARC-AGI-1Raisonnement abstrait few-shot sur des transformations de grilles ; le premier benchmark ARC Prize.
Public
ARC-AGI-2Nouvelles énigmes de raisonnement visuel évaluant la généralisation, et non la mémorisation.
Public
ArxivMathProblemes de mathematiques recents d'arXiv, executes peu apres publication pour limiter la contamination.
Public
BioMysteryBenchBenchmark d'Anthropic evaluant si les agents peuvent resoudre de vrais mysteres bio-informatiques a partir de donnees brutes.
Public
CritPtProblemes de physique de niveau recherche exigeant des derivations multi-etapes.
AIMultiple
FinanceReasoningRaisonnement financier complexe en plusieurs étapes sur 238 questions difficiles de FinanceReasoning.
Public
Frontier-BenchTaches logicielles agentiques sur des depots de pointe, notees par taux de resolution.
Public
FrontierMathProblèmes de mathématiques de recherche inédits, rédigés par des experts (niveaux 1 à 4).
Public
LegalBenchRaisonnement juridique participatif sur 162 tâches créées par des praticiens du droit.
Public
MMMU-ProComprehension multimodale de niveau universitaire entre disciplines, durcie contre les raccourcis textuels.
Public
Terminal-Bench 2.1Taches agentiques en terminal couvrant le genie logiciel, les donnees et l'administration systeme.
Public
Terminal-Bench HardLe sous-ensemble difficile de Terminal-Bench : des taches logicielles multi-etapes resolues dans un vrai terminal.
Public
Terminal-Bench-ScienceTaches en terminal issues de flux de travail reels de calcul scientifique.
AIMultiple
Text-to-SQLPrécision de la génération de requêtes SQL à partir du langage naturel sur plus de 35 LLM.
Mises à jour récentes

Mises à jour récentes

Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.

Google

Gemini 3.8 Flash

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Anthropic

Claude Fable 5.1

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Tencent

Hy4 preview

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Z AI

GLM 5.3 Flash

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Chronologie des sorties de modèles d'IALes 12 derniers modèles en 21 jours

Principales sorties de modèles d'IA des fournisseurs leaders au cours des 21 derniers jours.

Fournisseur
OpenAI
OpenAI
04 Sep 2026
GPT-6 Astra +1 de plusGPT-6 AstraGPT-6 Astra Pro
Alibaba Cloud
Alibaba Cloud
26 Août 2026
Qwen3.8 Flash
03 Sep 2026
Qwen3.8 Max (0902)
Google
Google
02 Sep 2026
Gemini 3.8 Flash
Meta
Meta
21 Août 2026
Muse Spark 1.2 Contributor
02 Sep 2026
Muse Spark 1.3 +1 de plusMuse Spark 1.3Muse Spark 1.3 Contributor
Anthropic
Anthropic
01 Sep 2026
Claude Fable 5.1
Tencent
Tencent
28 Août 2026
Hy4 preview
Z AI
Z AI
18 Août 2026
GLM 5.3
26 Août 2026
GLM 5.3 Flash

Explorez Cas d'utilisation, analyses et points de référence du LLM

Benchmark de 40+ LLM en finance: Claude Fable 5 & GPT-5.6 Sol

LLM
Benchmark
14 Août

Nous avons évalué les LLM sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1 Ce sous-ensemble cible les tâches de raisonnement financier les plus difficiles, en évaluant le raisonnement quantitatif complexe à plusieurs étapes impliquant des concepts et des formules financiers. Notre évaluation a utilisé une conception de prompt personnalisée et des critères de…

En savoir plus
LLM
Benchmark
12 Août

LLM Benchmark de latence par cas d'usage

Nous avons benchmarké 11 des meilleurs grands modèles de langage avec un total de 1 320 requêtes, en séparant les modèles de raisonnement et de non-raisonnement, et mesuré la latence du premier token, la latence par token et le temps de réponse global. Vous trouverez des détails sur la façon dont nous avons mesuré la…

LLM
Benchmark
11 Août

Agentic IT: Can LLMs Design a Benchmark

We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…

LLM
Benchmark
4 Août

Comparer les modèles d'IA multimodaux sur le raisonnement visuel

Nous avons évalué 15 modèles d'IA multimodaux leaders sur le raisonnement visuel en utilisant 200 questions basées sur l'image. L'évaluation comprenait deux pistes : 100 questions de compréhension de graphiques testant l'interprétation de visualisations de données, et 100 questions de logique visuelle évaluant la reconnaissance de motifs et le raisonnement spatial. Chaque question a été…

LLM
Benchmark
2 Août

Passerelles IA pour OpenAI: Alternatives à OpenRouter

Nous avons benchmarké OpenRouter, SambaNova, TogetherAI, Groq et IA/ML API sur trois indicateurs (latence du premier token, latence totale et nombre de tokens de sortie), avec 300 tests utilisant des prompts courts (environ 18 tokens) et des prompts longs (environ 203 tokens) pour la latence totale. Si vous prévoyez d'utiliser l'une de ces passerelles IA,…

LLM
Benchmark
5 Juin

Grands modèles de langage en cybersécurité

Nous avons évalué 7 grands modèles de langage dans 9 domaines de la cybersécurité en utilisant SecBench, un benchmark à grande échelle et multi-format pour les tâches de sécurité. Nous avons testé chaque modèle sur 44 823 questions à choix multiples (QCM) et 3 087 questions à réponse courte (QRC), couvrant des domaines tels que…

LLM
Benchmark
15 Avr

LLM Quantification: BF16 vs FP8 vs INT4

Nous avons effectué des benchmarks de Qwen3-32B à 4 niveaux de précision (BF16, FP8, GPTQ-Int8, GPTQ-Int4) sur un seul NVIDIA H100 80GB GPU. Chaque configuration a été évaluée sur 2 benchmarks (~12,2K questions) couvrant les connaissances et la génération de code, ainsi que sur plus de 2 000 exécutions d'inférence pour mesurer le débit. Int4…