Premium
Services
Premium

Benchmarks LLM

Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple. Voir la méthodologie.

MEILLEUR MODÈLE
Claude Opus 5
Indice 86
Meilleur rapport qualité-prix
DeepSeek V4 Flash 0731
$0.11 / 1M
Le plus rapide
Trinity Large Thinking
0.12s TTFT
Couverture
151 modèles
12 benchmarks · 697 évaluations
Indice d'intelligence AIMultiple

Classement

Les modèles les mieux notés sur tous les benchmarks.

Filter & Sort
#
Modèle
Index
Agentic RAG
ARC-AGI-1
ARC-AGI-2
ArxivMath
CritPt
FinanceReasoning
FrontierMath
LegalBench
MMMU-Pro
Terminal-Bench 2.1
Terminal-Bench Hard
Text-to-SQL
1
Claude Opus 5
Claude Opus 5
Anthropic
86
-989091299073878589--
2
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
81
879893-329083878389-74
3
Claude Fable 5
Claude Fable 5
Anthropic
79
989989792990888981856390
4
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
67
919784-308771858187-71
5
Claude Opus 4.8
Claude Opus 4.8
Anthropic
66
100937271-89568479855877
6
Claude Fable 5.1
Claude Fable 5.1
Anthropic
66
-9890-31-8889-91--
7
Gemini 3.7 Flash
Gemini 3.7 Flash
Google
62
-9685-14-37878686--
8
GPT-5.5 Pro
GPT-5.5 Pro
OpenAI
62
-9785-31-78-----
9
Kimi K3
Kimi K3
Moonshot AI
61
939560-238839868285-77
10
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
60
96----9181----79
Page 1 sur 16

Coût$10.00
Latence3.83s
Contexte1M
TTFT3.83s
ARC-AGI-1
98
ARC-AGI-2
90
ArxivMath
91
CritPt
29
FinanceReasoning
90
FrontierMath
73
LegalBench
87
MMMU-Pro
85
Terminal-Bench 2.1
89

Coût$8.00
Latence4.43s
Contexte1M
TTFT4.43s
Agentic RAG
87
ARC-AGI-1
98
ARC-AGI-2
93
CritPt
32
FinanceReasoning
90
FrontierMath
83
LegalBench
87
MMMU-Pro
83
Terminal-Bench 2.1
89
Text-to-SQL
74

Coût$20.00
Latence5.28s
Contexte1M
TTFT5.28s
Agentic RAG
98
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
CritPt
29
FinanceReasoning
90
FrontierMath
88
LegalBench
89
MMMU-Pro
81
Terminal-Bench 2.1
85
Terminal-Bench Hard
63
Text-to-SQL
90

Coût$4.50
Latence1.92s
Contexte1M
TTFT1.92s
Agentic RAG
91
ARC-AGI-1
97
ARC-AGI-2
84
CritPt
30
FinanceReasoning
87
FrontierMath
71
LegalBench
85
MMMU-Pro
81
Terminal-Bench 2.1
87
Text-to-SQL
71

Coût$10.00
Latence4.53s
Contexte1M
TTFT4.53s
Agentic RAG
100
ARC-AGI-1
93
ARC-AGI-2
72
ArxivMath
71
FinanceReasoning
89
FrontierMath
56
LegalBench
84
MMMU-Pro
79
Terminal-Bench 2.1
85
Terminal-Bench Hard
58
Text-to-SQL
77

Coût$20.00
Latence5.44s
Contexte1M
TTFT5.44s
ARC-AGI-1
98
ARC-AGI-2
90
CritPt
31
FrontierMath
88
LegalBench
89
Terminal-Bench 2.1
91

Coût$1.50
Latence6.05s
Contexte1M
TTFT6.05s
ARC-AGI-1
96
ARC-AGI-2
85
CritPt
14
FrontierMath
37
LegalBench
87
MMMU-Pro
86
Terminal-Bench 2.1
86

Coût$33.75
Latence3.65s
Contexte1M
TTFT3.65s
ARC-AGI-1
97
ARC-AGI-2
85
CritPt
31
FrontierMath
78

Coût$5.44
Latence0.93s
Contexte1M
TTFT0.93s
Agentic RAG
93
ARC-AGI-1
95
ARC-AGI-2
60
CritPt
23
FinanceReasoning
88
FrontierMath
39
LegalBench
86
MMMU-Pro
82
Terminal-Bench 2.1
85
Text-to-SQL
77

Coût$2.00
Latence10.25s
Contexte1M
TTFT10.25s
Agentic RAG
96
FinanceReasoning
91
FrontierMath
81
Text-to-SQL
79
Page 1 sur 16
Évolution dans le temps
Indice d'intelligence par date de sortie du modèle
Coût vs performance
Coût combiné par rapport à l'indice d'intelligence
Modèle × Benchmark
Meilleurs modèles sur les benchmarks sélectionnés
Méthodologie

Comment l'indice est construit

Chaque benchmark devient une position sur une échelle de 0 à 100, et l'indice est la moyenne pondérée de ces positions. Un benchmark sur lequel un modèle n'a pas été évalué compte comme la moyenne du champ, afin que les scores restent comparables. Indice = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).

AIMultiple
Agentic RAGRoutage multi-bases de données et génération de requêtes SQL sur 5 bases de données (BIRD-SQL, 500 questions).
Public
ARC-AGI-1Raisonnement abstrait few-shot sur des transformations de grilles ; le premier benchmark ARC Prize.
Public
ARC-AGI-2Nouvelles énigmes de raisonnement visuel évaluant la généralisation, et non la mémorisation.
Public
ArxivMathProblemes de mathematiques recents d'arXiv, executes peu apres publication pour limiter la contamination.
Public
BioMysteryBenchBenchmark d'Anthropic evaluant si les agents peuvent resoudre de vrais mysteres bio-informatiques a partir de donnees brutes.
Public
CritPtProblemes de physique de niveau recherche exigeant des derivations multi-etapes.
AIMultiple
FinanceReasoningRaisonnement financier complexe en plusieurs étapes sur 238 questions difficiles de FinanceReasoning.
Public
Frontier-BenchTaches logicielles agentiques sur des depots de pointe, notees par taux de resolution.
Public
FrontierMathProblèmes de mathématiques de recherche inédits, rédigés par des experts (niveaux 1 à 4).
Public
LegalBenchRaisonnement juridique participatif sur 162 tâches créées par des praticiens du droit.
Public
MMMU-ProComprehension multimodale de niveau universitaire entre disciplines, durcie contre les raccourcis textuels.
Public
Terminal-Bench 2.1Taches agentiques en terminal couvrant le genie logiciel, les donnees et l'administration systeme.
Public
Terminal-Bench HardLe sous-ensemble difficile de Terminal-Bench : des taches logicielles multi-etapes resolues dans un vrai terminal.
Public
Terminal-Bench-ScienceTaches en terminal issues de flux de travail reels de calcul scientifique.
AIMultiple
Text-to-SQLPrécision de la génération de requêtes SQL à partir du langage naturel sur plus de 35 LLM.
Mises à jour récentes

Mises à jour récentes

Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.

Google

Gemini 3.8 Flash

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Anthropic

Claude Fable 5.1

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Tencent

Hy4 preview

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Z AI

GLM 5.3 Flash

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Chronologie des sorties de modèles d'IALes 12 derniers modèles en 21 jours

Principales sorties de modèles d'IA des fournisseurs leaders au cours des 21 derniers jours.

Fournisseur
OpenAI
OpenAI
04 Sep 2026
GPT-6 Astra +1 de plusGPT-6 AstraGPT-6 Astra Pro
Alibaba Cloud
Alibaba Cloud
26 Août 2026
Qwen3.8 Flash
03 Sep 2026
Qwen3.8 Max (0902)
Google
Google
02 Sep 2026
Gemini 3.8 Flash
Meta
Meta
21 Août 2026
Muse Spark 1.2 Contributor
02 Sep 2026
Muse Spark 1.3 +1 de plusMuse Spark 1.3Muse Spark 1.3 Contributor
Anthropic
Anthropic
01 Sep 2026
Claude Fable 5.1
Tencent
Tencent
28 Août 2026
Hy4 preview
Z AI
Z AI
18 Août 2026
GLM 5.3
26 Août 2026
GLM 5.3 Flash

Explorez Cas d'utilisation, analyses et points de référence du LLM

Comparer 9 grands modèles de langage dans le domaine de la santé

LLM
Comparaison des Fonctionnalités
4 Sep

Nous avons évalué 9 LLMs à l'aide du dataset MedQA, un benchmark d'examen clinique de niveau universitaire dérivé des questions de l'USMLE. Chaque modèle a répondu aux mêmes scénarios cliniques à choix multiples à l'aide d'un prompt standardisé, permettant une comparaison directe de la précision. Nous avons également enregistré la latence par question en divisant…

En savoir plus
LLM
Analyse
3 Sep

Grands modèles multimodaux (LMM) vs LLMs

Nous avons évalué les performances des grands modèles multimodaux (LMM) dans des tâches de raisonnement financier en utilisant un jeu de données soigneusement sélectionné. En analysant un sous-ensemble d’échantillons financiers de haute qualité, nous évaluons les capacités des modèles à traiter et à raisonner avec des données multimodales dans le domaine financier. La section méthodologie…

LLM
Analyse
2 Sep

Lois d'échelle des LLM: analyse de chercheurs en IA

Les grands modèles de langage prédisent le token suivant à partir de motifs appris dans les données textuelles. Le terme lois d'échelle des LLM désigne des régularités empiriques qui relient les performances du modèle à la quantité de calcul, aux données d'entraînement et aux paramètres du modèle utilisés pendant l'entraînement. Pour comprendre comment ces relations…

LLM
Analyse
2 Sep

LLM Outils d'observabilité: Weights & Biases, Langsmith

Les applications LLM sont passées de chats à un seul tour à des agents multi-étapes qui utilisent des outils, interrogent des bases de données et se coordonnent avec d’autres modèles, ce qui rend leur comportement plus difficile à interpréter. L’observabilité des LLM offre une visibilité continue sur ces flux de travail complexes, aidant les organisations…

LLM
Comparaison des Fonctionnalités
2 Sep

Cloud LLM vs local LLMs: exemples & avantages

Les LLMs cloud, alimentés par des modèles avancés comme GPT-5.5 et Claude Opus 4.7, offrent évolutivité et accessibilité. Inversement, les LLMs locaux, pilotés par des modèles open source tels que Llama 4, DeepSeek V4 et Qwen3.6-Plus, garantissent une confidentialité et une personnalisation renforcées. Découvrez ce que sont les LLMs cloud, leurs forces et faiblesses, les…

LLM
Benchmark
1 Sep

Simulation d'audience: Les LLM peuvent-elles prédire le comportement humain ?

En marketing, évaluer avec quelle précision les LLMs prédisent le comportement humain est crucial pour estimer leur efficacité à anticiper les besoins du public et pour reconnaître les risques de décalage, de communication inefficace ou d'influence non désirée. La simulation d'audience avec des LLMs permet de modéliser des publics virtuels, aidant les organisations à anticiper…

LLM
Analyse
1 Sep

LLM Guide de fine-tuning pour les entreprises

Suivez les liens pour les solutions spécifiques aux défis de sortie de votre LLM. Si votre LLM : L’adoption généralisée des grands modèles de langage (LLM) a amélioré notre capacité à traiter le langage humain. Cependant, leur entraînement générique donne souvent des performances sous-optimales pour des tâches spécifiques. Pour surmonter cette limitation, des méthodes de…

LLM
Analyse
1 Sep

LLM Part de marché: Comparer l'utilisation et l'adoption

Nous avons analysé la part de marché des LLM en combinant des données basées sur l'utilisation et des estimations de visites web pour montrer comment la demande pour les grands modèles de langage est répartie entre les laboratoires d'IA et les applications d'IA : Consultez la méthodologie pour voir comment nous avons mesuré et calculé…

LLM
Analyse
1 Sep

10+ exemples de grands modèles de langage

Nous avons rassemblé des benchmarks open source pour comparer les principaux grands modèles de langage propriétaires et open source. Choisissez votre cas d’usage pour trouver le modèle adapté. Vous pouvez évaluer les grands modèles de langage en examinant leurs performances sur les benchmarks et leur latence réelle (disponible en cliquant sur le nom de chaque…

LLM
Analyse
31 Août

LLM Calculateur de VRAM pour l'auto-hébergement

Auto-héberger un LLM signifie exécuter l'inférence sur du matériel contrôlé par l'opérateur plutôt que via une API tierce, ce qui modifie le coût, le contrôle des données et le profil de confidentialité. Qu'un modèle puisse s'exécuter dépend de la mémoire. Le calculateur estime la VRAM ou la mémoire unifiée dont un modèle a besoin pour…

LLM
Comparaison des Fonctionnalités
27 Août

LLM Tarification: Top 15+ fournisseurs comparés

La tarification des LLM s’étale sur quatre ordres de grandeur : les modèles les moins chers ont été lancés à moins de $0,03 par million de tokens, tandis que les paliers de raisonnement frontière ont été lancés jusqu’à $262.50. Le graphique ci-dessous suit les prix de lancement : chaque point est le prix moyen des…