Premium
Services
Premium

Benchmarks LLM

Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple. Comment l'indice est construit

MEILLEUR MODÈLE
Claude Opus 5.5
Indice 79
Meilleur rapport qualité-prix
Qwen3.8 Flash
$0.23 / 1M
Le plus rapide
Command A+
0.22s TTFT
Indice d'intelligence AIMultiple

Classement

Les modèles les mieux notés sur tous les benchmarks.

Filter & Sort
#
Modèle
Index
AIM-Agentic-RAG
AIM-AI-Bias
AIM-FinanceReasoning
AIM-Text-to-SQL
ARC-AGI-3
CritPt
FrontierMath
IFBench
MMMU-Pro
SciCode
Terminal-Bench 2.1
1
Claude Opus 5.5
Claude Opus 5.5
Anthropic
79
90949288-32--8867-
2
GPT-6 Astra
GPT-6 Astra
OpenAI
76
84988766633298-875690
3
Claude Fable 5.1
Claude Fable 5.1
Anthropic
73
84-9067-3188--6391
4
Qwen3.8 Flash
Qwen3.8 Flash
Alibaba Cloud
71
-------81-4786
5
Qwen3.8 Max
Qwen3.8 Max
Alibaba Cloud
70
8393-51--46-825381
6
Claude Opus 5
Claude Opus 5
Anthropic
68
85819064302973-855689
7
Muse Spark 1.1
Muse Spark 1.1
Meta
68
---------5878
8
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
67
778990548328373835790
9
Kimi K3
Kimi K3
Moonshot AI
66
83898848-2339-815985
10
Claude Sonnet 5
Claude Sonnet 5
Anthropic
65
73918738--29--5480
Page 1 sur 4

Coût$8.00
Latence1.16s
Contexte1M
TTFT1.16s
AIM-Agentic-RAG
90
AIM-AI-Bias
94
AIM-FinanceReasoning
92
AIM-Text-to-SQL
88
CritPt
32
MMMU-Pro
88
SciCode
67

Coût$20.00
Latence4.75s
Contexte524k
TTFT4.75s
AIM-Agentic-RAG
84
AIM-AI-Bias
98
AIM-FinanceReasoning
87
AIM-Text-to-SQL
66
ARC-AGI-3
63
CritPt
32
FrontierMath
98
MMMU-Pro
87
SciCode
56
Terminal-Bench 2.1
90

Coût$20.00
Latence1.93s
Contexte1M
TTFT1.93s
AIM-Agentic-RAG
84
AIM-FinanceReasoning
90
AIM-Text-to-SQL
67
CritPt
31
FrontierMath
88
SciCode
63
Terminal-Bench 2.1
91

Coût$0.23
Latence1.72s
Contexte1M
TTFT1.72s
IFBench
81
SciCode
47
Terminal-Bench 2.1
86

Coût$3.00
Latence56.57s
Contexte1M
TTFT56.57s
AIM-Agentic-RAG
83
AIM-AI-Bias
93
AIM-Text-to-SQL
51
FrontierMath
46
MMMU-Pro
82
SciCode
53
Terminal-Bench 2.1
81

Coût$10.00
Latence2.58s
Contexte1M
TTFT2.58s
AIM-Agentic-RAG
85
AIM-AI-Bias
81
AIM-FinanceReasoning
90
AIM-Text-to-SQL
64
ARC-AGI-3
30
CritPt
29
FrontierMath
73
MMMU-Pro
85
SciCode
56
Terminal-Bench 2.1
89

Coût$2.00
Latence1.47s
Contexte1M
TTFT1.47s
SciCode
58
Terminal-Bench 2.1
78

Coût$8.00
Latence3.06s
Contexte1M
TTFT3.06s
AIM-Agentic-RAG
77
AIM-AI-Bias
89
AIM-FinanceReasoning
90
AIM-Text-to-SQL
54
ARC-AGI-3
8
CritPt
32
FrontierMath
83
IFBench
73
MMMU-Pro
83
SciCode
57
Terminal-Bench 2.1
90

Coût$3.00
Latence2.70s
Contexte1M
TTFT2.70s
AIM-Agentic-RAG
83
AIM-AI-Bias
89
AIM-FinanceReasoning
88
AIM-Text-to-SQL
48
CritPt
23
FrontierMath
39
MMMU-Pro
81
SciCode
59
Terminal-Bench 2.1
85

Coût$4.00
Latence1.79s
Contexte1M
TTFT1.79s
AIM-Agentic-RAG
73
AIM-AI-Bias
91
AIM-FinanceReasoning
87
AIM-Text-to-SQL
38
FrontierMath
29
SciCode
54
Terminal-Bench 2.1
80
Page 1 sur 4
Évolution dans le temps
Indice d'intelligence par date de sortie du modèle
Coût vs performance
Coût combiné par rapport à l'indice d'intelligence
Modèle × Benchmark
Meilleurs modèles sur les benchmarks sélectionnés

Comment l'indice est construit

L'indice est la moyenne des scores d'un modèle sur les benchmarks listés ci-dessous, parmi ceux qu'il a réellement passés : un benchmark qu'il n'a jamais passé ne compte pas comme un zéro, il est simplement absent. Tous les benchmarks de l'indice comptent de manière égale. Un benchmark qui donne déjà un pourcentage de 0 à 100 est utilisé tel quel ; un benchmark sur une autre échelle est d'abord ramené sur 0-100. Un modèle doit avoir des résultats sur au moins deux benchmarks de l'indice pour être classé : un résultat unique ne lui donne pas un classement propre. Comme les scores sont utilisés tels quels, un benchmark que tout le champ trouve difficile tire vers le bas chaque score obtenu dessus, et un modèle mesuré sur des benchmarks plus difficiles le reporte dans sa moyenne.

Benchmarks utilisés

AIMultiple
AIM-Agentic-RAGRoutage multi-bases de données et génération de requêtes SQL sur 5 bases de données (BIRD-SQL, 500 questions).
AIMultiple
AIM-AI-BiasPer model per question per repetition bias evaluation results across 64 questions in both multiple choice and open ended formats, 27 models in the multiple choice condition and 26 in the open ended condition
AIMultiple
AIM-FinanceReasoningRaisonnement financier complexe en plusieurs étapes sur 238 questions difficiles de FinanceReasoning.
AIMultiple
AIM-Text-to-SQLPrécision de la génération de requêtes SQL à partir du langage naturel sur plus de 35 LLM.
Public
ARC-AGI-3Raisonnement interactif : les agents explorent des environnements de jeu inedits, se fixent des objectifs en cours de route et apprennent au fil des etapes. 100% equivaut a l'efficacite d'apprentissage humaine.
Public
CritPtProblemes de physique de niveau recherche exigeant des derivations multi-etapes.
Public
FrontierMathProblèmes de mathématiques de recherche inédits, rédigés par des experts (niveaux 1 à 4).
Public
IFBenchSuivi precis d'instructions sur 58 contraintes de sortie verifiables inedites.
Public
MMMU-ProComprehension multimodale de niveau universitaire entre disciplines, durcie contre les raccourcis textuels.
Public
SciCodeCodage scientifique de niveau recherche en physique, mathématiques, biologie et chimie (338 sous-problèmes)
Public
Terminal-Bench 2.1Taches agentiques en terminal couvrant le genie logiciel, les donnees et l'administration systeme.

Mises à jour récentes

Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.

Anthropic

Claude Opus 5.5

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-6 Sol

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-6 Luna

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

X

Grok 4.7

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Chronologie des sorties de LLMLe rythme de l'innovation en IA
Laboratoires d'IA
Alibaba Cloud
Alibaba Cloud
27 juil 2026
Qwen3.7 Flash
03 août 2026
Qwen3.8 Max
12 août 2026
Qwen3.8 2.4T A95B
14 août 2026
Qwen3.8 27B
26 août 2026
Qwen3.8 Flash
03 sep 2026
Qwen3.8 Max (0902)
21 sep 2026
Qwen3.8 Omni Flash
23 sep 2026
Qwen3.8 Max Prime
Z AI
Z AI
18 août 2026
GLM 5.3
26 août 2026
GLM 5.3 Flash
18 sep 2026
GLM 5.3 FlashX
23 sep 2026
GLM 5.3 Prime
Anthropic
Anthropic
24 juil 2026
Claude Opus 5
01 sep 2026
Claude Fable 5.1
22 sep 2026
Claude Opus 5.5
OpenAI
OpenAI
09 juil 2026
GPT-5.6 Luna +2 de plusGPT-5.6 LunaGPT-5.6 SolGPT-5.6 Terra
04 sep 2026
GPT-6 Astra
22 sep 2026
GPT-6 Luna +1 de plusGPT-6 LunaGPT-6 Sol
Cohere
Cohere
22 sep 2026
Command A+
X
X
08 juil 2026
Grok 4.5
12 août 2026
Grok 4.6
21 sep 2026
Grok 4.7
DeepSeek
DeepSeek
31 juil 2026
DeepSeek V4 Flash 0731
12 août 2026
DeepSeek V4 Pro 0813
21 août 2026
DeepSeek V4 Flash Vision Exp
10 sep 2026
DeepSeek V4.1 Flash
Meta
Meta
16 juil 2026
Muse Spark 1.1
05 août 2026
Muse Spark 1.2
09 août 2026
Muse Glimmer 30B
21 août 2026
Muse Spark 1.2 Contributor
02 sep 2026
Muse Spark 1.3 +1 de plusMuse Spark 1.3Muse Spark 1.3 Contributor
Google
Google
21 juil 2026
Gemini 3.5 Flash Lite +1 de plusGemini 3.5 Flash LiteGemini 3.6 Flash
13 août 2026
Gemini 3.7 Flash
02 sep 2026
Gemini 3.8 Flash
Tencent
Tencent
06 juil 2026
Hy3
19 août 2026
Hy-MT2-7B
20 août 2026
Hy-MT2-1.8B +1 de plusHy-MT2-1.8BHy-MT2-30B-A3B
28 août 2026
Hy4 +1 de plusHy4Hy4 preview
Moonshot AI
Moonshot AI
16 juil 2026
Kimi K3

Explorez Cas d'utilisation, analyses et points de référence du LLM

LLM Paramètres: GPT-5 High, Moyen, Bas et Minimal

LLM
Analyse
21 août

Certains LLMs, comme la gamme OpenAI GPT-5, existent en différentes versions (par exemple, GPT-5, GPT-5-mini et GPT-5-nano) et avec divers réglages de paramètres, notamment haut, moyen, bas et minimal. Ci-dessous, nous explorons les différences entre ces versions de model en rassemblant leurs performances benchmark et les coûts d’exécution des benchmarks. Nous avons utilisé la famille…

En savoir plus
LLM
Comparaison des Fonctionnalités
21 août

Meilleurs outils LLMOps et comparaison avec les MLOPs

Les plateformes LLMOps gèrent le côté opérationnel de l’exécution des modèles de langage de grande taille : déploiement, surveillance, évaluation et gestion des coûts. Nous avons examiné les meilleurs outils LLMOps, leurs fonctionnalités principales, leurs modèles de tarification et leurs différences afin d’identifier la solution la mieux adaptée à différents cas d’usage. Une description de…

LLM
Analyse
19 août

50+ Cas d'utilisation de ChatGPT avec des exemples concrets

ChatGPT a atteint environ 1 milliard d’utilisateurs actifs hebdomadaires début 2026, soit environ 10 % de la population mondiale.1 OpenAI a dépassé 20 milliards de dollars de revenus annuels pour 2025, confirmé par la directrice financière Sarah Friar.2 L’Anthropic Economic Index distingue deux modes d’utilisation : l’augmentation, où un humain interagit avec l’IA, et l’automatisation, où…

LLM
Analyse
19 août

ChatGPT pour le service client: les 10 meilleurs cas d'utilisation

ChatGPT est passé du statut de nouveauté à celui d'infrastructure du service client. Les entreprises l'utilisent pour réduire les temps de réponse, absorber des volumes que leurs équipes ne peuvent pas gérer et diminuer le coût des interactions courantes. Mais les résultats varient fortement selon sa mise en œuvre. OpenAI a lancé GPT-5.6, un modèle…

LLM
Benchmark
16 août

Densité d'intelligence des 71 LLMs pour des modèles plus intelligents et plus denses

Nous avons suivi 71 LLMs publiés entre février 2023 et mai 2026 et avons collecté 10 benchmarks publics pour mesurer la densité d'intelligence. Nous avons divisé le score de capacité par la ressource que le modèle consomme (paramètres actifs, coût de calcul d'entraînement et prix d'inférence). Pour calculer la densité d'intelligence, nous avons exécuté les…

LLM
Benchmark
12 août

LLM Benchmark de latence par cas d'usage

Nous avons benchmarké 11 des meilleurs grands modèles de langage avec un total de 1 320 requêtes, en séparant les modèles de raisonnement et de non-raisonnement, et mesuré la latence du premier token, la latence par token et le temps de réponse global. Vous trouverez des détails sur la façon dont nous avons mesuré la…

LLM
Benchmark
15 avr

LLM Quantification: BF16 vs FP8 vs INT4

Nous avons effectué des benchmarks de Qwen3-32B à 4 niveaux de précision (BF16, FP8, GPTQ-Int8, GPTQ-Int4) sur un seul NVIDIA H100 80GB GPU. Chaque configuration a été évaluée sur 2 benchmarks (~12,2K questions) couvrant les connaissances et la génération de code, ainsi que sur plus de 2 000 exécutions d'inférence pour mesurer le débit. Int4…