Services
Contactez-nous

Benchmarks LLM

Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple. Voir la méthodologie.

MEILLEUR MODÈLE
Claude Fable 5
Indice 92
Meilleur rapport qualité-prix
MiniMax M3
$0.42 / 1M
Le plus rapide
GPT OSS 120B
0.23s TTFT
Couverture
64 modèles
8 benchmarks · 336 évaluations
Indice d'intelligence AIMultiple

Classement

Les modèles les mieux notés sur tous les benchmarks.

Filter & Sort
#
Modèle
Index
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Page 1 sur 7

Coût$20.00
Latence4.02s
Contexte1M
TTFT4.02s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Coût$6.00
Latence2.93s
Contexte1M
TTFT2.93s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Coût$11.25
Latence4.31s
Contexte1M
TTFT4.31s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Coût$3.00
Latence7.25s
Contexte500k
TTFT7.25s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Coût$11.25
Latence0.70s
Contexte272k
TTFT0.70s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Coût$4.50
Latence1.62s
Contexte1M
TTFT1.62s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Coût$11.25
Latence11.11s
Contexte1M
TTFT11.11s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Coût$10.00
Latence1.71s
Contexte1M
TTFT1.71s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Coût$4.50
Latence-
Contexte1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Coût$4.50
Latence22.02s
Contexte1M
TTFT22.02s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Page 1 sur 7
Évolution dans le temps
Indice d'intelligence par date de sortie du modèle
Coût vs performance
Coût combiné par rapport à l'indice d'intelligence
Modèle × Benchmark
Meilleurs modèles sur les benchmarks sélectionnés
Méthodologie

Comment l'indice est construit

L'indice d'intelligence normalise chaque benchmark sur une échelle de 0 à 100 et fait la moyenne de la position relative d'un modèle sur les benchmarks pour lesquels il a été évalué. Chaque benchmark ci-dessous alimente ce score.

AIMultiple
FinanceReasoningRaisonnement financier complexe en plusieurs étapes sur 238 questions difficiles de FinanceReasoning.
AIMultiple
Text-to-SQLPrécision de la génération de requêtes SQL à partir du langage naturel sur plus de 35 LLM.
AIMultiple
Agentic RAGRoutage multi-bases de données et génération de requêtes SQL sur 5 bases de données (BIRD-SQL, 500 questions).
AIMultiple
AI MemoryRécupération de données numériques en contexte long selon la position dans le document (100 éléments, 14 transcriptions).
AIMultiple
AI HallucinationRésistance à l'invention de métriques non mentionnées dans des documents à contexte long (204 pièges, 14 transcriptions).
Public
Humanity's Last ExamRaisonnement à livre fermé de niveau expert dans plus de 100 disciplines académiques (2,5k questions).
Public
SciCodeCodage scientifique de niveau recherche en physique, mathématiques, biologie et chimie (338 sous-problèmes)
Public
LegalBenchRaisonnement juridique participatif sur 162 tâches créées par des praticiens du droit.
Public
FrontierMathProblèmes de mathématiques de recherche inédits, rédigés par des experts (niveaux 1 à 4).
Public
ARC-AGI-2Nouvelles énigmes de raisonnement visuel évaluant la généralisation, et non la mémorisation.
Public
Swe-BenchTickets GitHub réels résolus de bout en bout (jeu complet de 2 294 instances).
Public
LiveCodeBenchProblèmes de programmation compétitive sans contamination, mis à jour en continu.
AIMultiple
Agentic LLM BenchmarkCodage agentique sur 10 tâches de développement logiciel via un outil CLI (~3 500 étapes de validation).
Mises à jour récentes

Mises à jour récentes

Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.

Moonshot AI

Kimi K3

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Sol

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Terra

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Chronologie des sorties de modèles d'IALes 15 derniers modèles en 41 jours

Principales sorties de modèles d'IA des fournisseurs leaders au cours des 41 derniers jours.

Fournisseur
Google
Google
21 Juil 2026
Gemini 3.5 Flash Lite +1 de plusGemini 3.5 Flash LiteGemini 3.6 Flash
13 Août 2026
Gemini 3.7 Flash
Meta
Meta
16 Juil 2026
Muse Spark 1.1
05 Août 2026
Muse Spark 1.2
09 Août 2026
Muse Glimmer 30B
Anthropic
Anthropic
24 Juil 2026
Claude Opus 5
Moonshot AI
Moonshot AI
16 Juil 2026
Kimi K3
OpenAI
OpenAI
09 Juil 2026
GPT-5.6 Luna +5 de plusGPT-5.6 LunaGPT-5.6 Luna ProGPT-5.6 SolGPT-5.6 Sol ProGPT-5.6 TerraGPT-5.6 Terra Pro
X
X
08 Juil 2026
Grok 4.5

Explorez Cas d'utilisation, analyses et points de référence du LLM

LLM Calculateur VRAM pour l'auto-hébergement

LLM
Analyse
12 Juil

Auto-héberger un LLM signifie exécuter l'inférence sur du matériel que l'opérateur contrôle, plutôt que via une API tierce, ce qui modifie le coût, le contrôle des données et le profil de confidentialité. Qu'un modèle puisse fonctionner ou non dépend de la mémoire. Le calculateur estime la VRAM ou la mémoire unifiée dont un modèle a…

En savoir plus
LLM
Analyse
2 Juil

LLM Part de marché: Comparer l'utilisation et l'adoption

Nous avons analysé la part de marché des LLM en combinant des données basées sur l'utilisation et des estimations de visites web pour montrer comment la demande pour les grands modèles de langage est répartie entre les laboratoires d'IA et les applications d'IA : Consultez la méthodologie pour voir comment nous avons mesuré et calculé…

LLM
Analyse
26 Juin

LLM Paramètres: GPT-5 High, Moyen, Bas et Minimal

Certains LLMs, comme OpenAI’s GPT-5 family, existent en différentes versions (par exemple, GPT-5, GPT-5-mini et GPT-5-nano) et avec divers réglages de paramètres, notamment élevé, moyen, bas et minimal. Ci-dessous, nous explorons les différences entre ces versions de modèles en rassemblant leurs performances de benchmark et les coûts d’exécution de ces benchmarks. Nous avons utilisé la…

LLM
Analyse
22 Juin

10+ exemples de grands modèles de langage

Nous avons rassemblé des benchmarks open source pour comparer les principaux grands modèles de langage propriétaires et open source. Choisissez votre cas d’usage pour trouver le modèle adapté. Vous pouvez évaluer les grands modèles de langage en examinant leurs performances sur les benchmarks et leur latence réelle (disponible en cliquant sur le nom de chaque…

LLM
Comparaison des Fonctionnalités
22 Juin

Cloud LLM vs local LLMs: exemples & avantages

Les LLMs cloud, alimentés par des modèles avancés comme GPT-5.5 et Claude Opus 4.7, offrent évolutivité et accessibilité. Inversement, les LLMs locaux, pilotés par des modèles open source tels que Llama 4, DeepSeek V4 et Qwen3.6-Plus, garantissent une confidentialité et une personnalisation renforcées. Découvrez ce que sont les LLMs cloud, leurs forces et faiblesses, les…

LLM
Benchmark
5 Juin

Grands modèles de langage en cybersécurité

Nous avons évalué 7 grands modèles de langage dans 9 domaines de la cybersécurité en utilisant SecBench, un benchmark à grande échelle et multi-format pour les tâches de sécurité. Nous avons testé chaque modèle sur 44 823 questions à choix multiples (QCM) et 3 087 questions à réponse courte (QRC), couvrant des domaines tels que…

LLM
Benchmark
15 Avr

LLM Quantification: BF16 vs FP8 vs INT4

Nous avons effectué des benchmarks de Qwen3-32B à 4 niveaux de précision (BF16, FP8, GPTQ-Int8, GPTQ-Int4) sur un seul NVIDIA H100 80GB GPU. Chaque configuration a été évaluée sur 2 benchmarks (~12,2K questions) couvrant les connaissances et la génération de code, ainsi que sur plus de 2 000 exécutions d'inférence pour mesurer le débit. Int4…