Premium
Services
Premium

Benchmarks LLM

Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple. Comment l'indice est construit

MEILLEUR MODÈLE
Claude Opus 5.5
Indice 76
Meilleur rapport qualité-prix
Qwen3.8 Flash
$0.23 / 1M
Le plus rapide
Command A+
0.22s TTFT
Indice d'intelligence AIMultiple

Classement

Les modèles les mieux notés sur tous les benchmarks.

Filter & Sort
#
Modèle
Index
AIM-Agentic-RAG
AIM-FinanceReasoning
AIM-Text-to-SQL
ARC-AGI-3
CritPt
FrontierMath
IFBench
MMMU-Pro
SciCode
Terminal-Bench 2.1
1
Claude Opus 5.5
Claude Opus 5.5
Anthropic
76
909288-32--8867-
2
GPT-6 Astra
GPT-6 Astra
OpenAI
74
848766633298-875690
3
Claude Fable 5.1
Claude Fable 5.1
Anthropic
73
849067-3188--6391
4
Qwen3.8 Flash
Qwen3.8 Flash
Alibaba Cloud
71
------81-4786
5
Muse Spark 1.1
Muse Spark 1.1
Meta
68
--------5878
6
Claude Opus 5
Claude Opus 5
Anthropic
67
859064302973-855689
7
Qwen3.8 Max
Qwen3.8 Max
Alibaba Cloud
66
83-51--46-825381
8
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
65
7790548328373835790
9
Kimi K3
Kimi K3
Moonshot AI
63
838848-2339-815985
10
Gemini 3.7 Flash
Gemini 3.7 Flash
Google
63
85-72-1437-866086
Page 1 sur 4

Coût$8.00
Latence1.16s
Contexte1M
TTFT1.16s
AIM-Agentic-RAG
90
AIM-FinanceReasoning
92
AIM-Text-to-SQL
88
CritPt
32
MMMU-Pro
88
SciCode
67

Coût$20.00
Latence4.75s
Contexte524k
TTFT4.75s
AIM-Agentic-RAG
84
AIM-FinanceReasoning
87
AIM-Text-to-SQL
66
ARC-AGI-3
63
CritPt
32
FrontierMath
98
MMMU-Pro
87
SciCode
56
Terminal-Bench 2.1
90

Coût$20.00
Latence1.93s
Contexte1M
TTFT1.93s
AIM-Agentic-RAG
84
AIM-FinanceReasoning
90
AIM-Text-to-SQL
67
CritPt
31
FrontierMath
88
SciCode
63
Terminal-Bench 2.1
91

Coût$0.23
Latence1.72s
Contexte1M
TTFT1.72s
IFBench
81
SciCode
47
Terminal-Bench 2.1
86

Coût$2.00
Latence1.47s
Contexte1M
TTFT1.47s
SciCode
58
Terminal-Bench 2.1
78

Coût$10.00
Latence2.58s
Contexte1M
TTFT2.58s
AIM-Agentic-RAG
85
AIM-FinanceReasoning
90
AIM-Text-to-SQL
64
ARC-AGI-3
30
CritPt
29
FrontierMath
73
MMMU-Pro
85
SciCode
56
Terminal-Bench 2.1
89

Coût$3.00
Latence56.57s
Contexte1M
TTFT56.57s
AIM-Agentic-RAG
83
AIM-Text-to-SQL
51
FrontierMath
46
MMMU-Pro
82
SciCode
53
Terminal-Bench 2.1
81

Coût$8.00
Latence3.06s
Contexte1M
TTFT3.06s
AIM-Agentic-RAG
77
AIM-FinanceReasoning
90
AIM-Text-to-SQL
54
ARC-AGI-3
8
CritPt
32
FrontierMath
83
IFBench
73
MMMU-Pro
83
SciCode
57
Terminal-Bench 2.1
90

Coût$3.00
Latence2.70s
Contexte1M
TTFT2.70s
AIM-Agentic-RAG
83
AIM-FinanceReasoning
88
AIM-Text-to-SQL
48
CritPt
23
FrontierMath
39
MMMU-Pro
81
SciCode
59
Terminal-Bench 2.1
85

Coût$0.76
Latence6.15s
Contexte1M
TTFT6.15s
AIM-Agentic-RAG
85
AIM-Text-to-SQL
72
CritPt
14
FrontierMath
37
MMMU-Pro
86
SciCode
60
Terminal-Bench 2.1
86
Page 1 sur 4
Évolution dans le temps
Indice d'intelligence par date de sortie du modèle
Coût vs performance
Coût combiné par rapport à l'indice d'intelligence
Modèle × Benchmark
Meilleurs modèles sur les benchmarks sélectionnés

Comment l'indice est construit

L'indice est la moyenne des scores d'un modèle sur les benchmarks listés ci-dessous, parmi ceux qu'il a réellement passés : un benchmark qu'il n'a jamais passé ne compte pas comme un zéro, il est simplement absent. Tous les benchmarks de l'indice comptent de manière égale. Un benchmark qui donne déjà un pourcentage de 0 à 100 est utilisé tel quel ; un benchmark sur une autre échelle est d'abord ramené sur 0-100. Un modèle doit avoir des résultats sur au moins deux benchmarks de l'indice pour être classé : un résultat unique ne lui donne pas un classement propre. Comme les scores sont utilisés tels quels, un benchmark que tout le champ trouve difficile tire vers le bas chaque score obtenu dessus, et un modèle mesuré sur des benchmarks plus difficiles le reporte dans sa moyenne.

Benchmarks utilisés

Mises à jour récentes

Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.

Anthropic

Claude Opus 5.5

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-6 Sol

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-6 Luna

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

X

Grok 4.7

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Chronologie des sorties de LLMLe rythme de l'innovation en IA
Laboratoires d'IA
Alibaba Cloud
Alibaba Cloud
27 juil 2026
Qwen3.7 Flash
03 août 2026
Qwen3.8 Max
12 août 2026
Qwen3.8 2.4T A95B
14 août 2026
Qwen3.8 27B
26 août 2026
Qwen3.8 Flash
03 sep 2026
Qwen3.8 Max (0902)
21 sep 2026
Qwen3.8 Omni Flash
23 sep 2026
Qwen3.8 Max Prime
Z AI
Z AI
18 août 2026
GLM 5.3
26 août 2026
GLM 5.3 Flash
18 sep 2026
GLM 5.3 FlashX
23 sep 2026
GLM 5.3 Prime
Anthropic
Anthropic
30 juin 2026
Claude Sonnet 5
24 juil 2026
Claude Opus 5
01 sep 2026
Claude Fable 5.1
22 sep 2026
Claude Opus 5.5
OpenAI
OpenAI
09 juil 2026
GPT-5.6 Luna +2 de plusGPT-5.6 LunaGPT-5.6 SolGPT-5.6 Terra
04 sep 2026
GPT-6 Astra
22 sep 2026
GPT-6 Luna +1 de plusGPT-6 LunaGPT-6 Sol
Cohere
Cohere
22 sep 2026
Command A+
X
X
08 juil 2026
Grok 4.5
12 août 2026
Grok 4.6
21 sep 2026
Grok 4.7
DeepSeek
DeepSeek
31 juil 2026
DeepSeek V4 Flash 0731
12 août 2026
DeepSeek V4 Pro 0813
21 août 2026
DeepSeek V4 Flash Vision Exp
10 sep 2026
DeepSeek V4.1 Flash
Meta
Meta
16 juil 2026
Muse Spark 1.1
05 août 2026
Muse Spark 1.2
09 août 2026
Muse Glimmer 30B
21 août 2026
Muse Spark 1.2 Contributor
02 sep 2026
Muse Spark 1.3 +1 de plusMuse Spark 1.3Muse Spark 1.3 Contributor
Google
Google
30 juin 2026
Nano Banana 2 Lite
21 juil 2026
Gemini 3.5 Flash Lite +1 de plusGemini 3.5 Flash LiteGemini 3.6 Flash
13 août 2026
Gemini 3.7 Flash
02 sep 2026
Gemini 3.8 Flash
Tencent
Tencent
06 juil 2026
Hy3
19 août 2026
Hy-MT2-7B
20 août 2026
Hy-MT2-1.8B +1 de plusHy-MT2-1.8BHy-MT2-30B-A3B
28 août 2026
Hy4 +1 de plusHy4Hy4 preview
Moonshot AI
Moonshot AI
16 juil 2026
Kimi K3

Explorez Cas d'utilisation, analyses et points de référence du LLM

Text-to-SQL: Comparaison de la précision des LLM

LLM
Benchmark
25 sep

Nous avons exécuté 36 large language models sur 759 questions de BIRD-SQL, chaque model écrivant SQL contre une base de données qu’il devait identifier lui-même parmi 11 candidates. Toute requête analysable a été exécutée sur la base de données réelle et son ensemble de résultats comparé à l’ensemble de résultats de la requête de référence…

En savoir plus
LLM
Analyse
25 sep

LLM Part de marché: comparer l'utilisation et l'adoption

Nous avons analysé la part de marché des LLM en combinant des données fondées sur l'utilisation et des estimations de visites web pour montrer comment la demande de grands modèles de langage est répartie entre les laboratoires d'IA et les applications d'IA. Lisez la méthodologie pour voir comment nous avons mesuré et calculé ces résultats.…

LLM
Benchmark
24 sep

Benchmark de 40+ LLMs en finance: Claude Fable 5 & GPT-5.6 Sol

Nous avons évalué des LLMs sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1 Ce sous-ensemble cible les tâches de raisonnement financier les plus difficiles, évaluant un raisonnement quantitatif complexe en plusieurs étapes impliquant des concepts et des formules financières. Notre évaluation a utilisé une conception de prompt personnalisée et des critères de notation…

LLM
Benchmark
21 sep

Comparer les modèles d'IA multimodaux sur le raisonnement visuel

Nous avons évalué 15 modèles d'IA multimodaux leaders sur le raisonnement visuel en utilisant 200 questions basées sur l'image. L'évaluation comprenait deux pistes : 100 questions de compréhension de graphiques testant l'interprétation de visualisations de données, et 100 questions de logique visuelle évaluant la reconnaissance de motifs et le raisonnement spatial. Chaque question a été…

LLM
Analyse
21 sep

Grands modèles multimodaux (LMM) vs LLMs

Nous avons évalué les performances des grands modèles multimodaux (LMM) dans des tâches de raisonnement financier en utilisant un jeu de données soigneusement sélectionné. En analysant un sous-ensemble d’échantillons financiers de haute qualité, nous évaluons les capacités des modèles à traiter et à raisonner avec des données multimodales dans le domaine financier. La section méthodologie…

LLM
Analyse
21 sep

LLM Calculateur de VRAM pour l'auto-hébergement

Auto-héberger un LLM signifie exécuter l'inférence sur du matériel contrôlé par l'opérateur plutôt que via une API tierce, ce qui modifie le coût, le contrôle des données et le profil de confidentialité. Qu'un modèle puisse s'exécuter dépend de la mémoire. Le calculateur estime la VRAM ou la mémoire unifiée dont un modèle a besoin pour…

LLM
Benchmark
18 sep

IT agentique: les agents IA peuvent-ils concevoir un benchmark ?

Nous avons testé 16 modèles sur une conception de benchmark en text-to-SQL et en appel d'outils. Chaque modèle a construit un benchmark par sujet, pour un total de 32 soumissions. Aucune soumission n'a réussi tous les critères de la grille d'évaluation. Les agents ont pu construire et exécuter des tests, mais aucun n'a démontré à…

LLM
Benchmark
17 sep

AIM Enterprise: Benchmark d'entreprise agentique

Les entreprises utilisent des LLM tous les jours pour leurs tâches courantes. Pour trouver les LLM les plus rentables, nous avons conçu AIM Enterprise, un benchmark d'entreprise agentique, dans lequel nous avons utilisé 69 tâches d'entreprise réelles couvrant la stratégie, le marketing, les RH, la vente et les opérations. Deux models juges ont noté chaque…

LLM
Analyse
17 sep

L'avenir des grands modèles linguistiques

Découvrez l’avenir des grands modèles linguistiques en explorant des approches prometteuses, comme l’auto-entraînement, la vérification des faits et l’expertise parcimonieuse, qui pourraient remédier aux limites des LLM. Comparaison du taux de réussite des LLM Claude Sonnet 4.6 a dominé le benchmark avec un score global de 0.748, les variantes de base et de réflexion étant…

LLM
Benchmark
15 sep

Large Language Models en cybersécurité

Nous avons évalué 7 large language models dans 9 domaines de cybersécurité à l’aide de SecBench, un benchmark à grande échelle et multi-format pour les tâches de sécurité. Nous avons testé chaque model sur 44 823 questions à choix multiples (MCQs) et 3 087 questions à réponse courte (SAQs), couvrant la sécurité des données, la gestion des…

LLM
Analyse
15 sep

LLM Lois d'échelle: analyse de chercheurs en IA

Les grands models de langage prédisent le token suivant en se basant sur des motifs appris à partir de données textuelles. Le terme lois d’échelle des LLM désigne des régularités empiriques qui relient les performances du model à la quantité de calcul, aux données d’entraînement et aux paramètres du model utilisés pendant l’entraînement. Pour comprendre…