Services
Contactez-nous

Benchmarks LLM

Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple.

Dernière mise à jour Juin 2026
MEILLEUR MODÈLE
Claude Fable 5
Indice 92
Meilleur rapport qualité-prix
MiniMax M3
$0.42 / 1M
Le plus rapide
GPT OSS 120B
0.19s TTFT
Couverture
64 modèles
8 benchmarks · 336 évaluations
Indice d'intelligence AIMultiple

Classement

Les modèles les mieux notés sur tous les benchmarks.

Filter & Sort
#
Modèle
Index
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Page 1 sur 7

Coût$20.00
Latence3.98s
Contexte1M
TTFT3.98s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Coût$6.00
Latence252.11s
Contexte1M
TTFT252.11s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Coût$11.25
Latence2.47s
Contexte1M
TTFT2.47s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Coût$3.00
Latence10.26s
Contexte500k
TTFT10.26s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Coût$11.25
Latence1.03s
Contexte272k
TTFT1.03s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Coût$5.63
Latence1.92s
Contexte1M
TTFT1.92s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Coût$11.25
Latence11.46s
Contexte1M
TTFT11.46s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Coût$10.00
Latence1.75s
Contexte1M
TTFT1.75s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Coût$4.50
Latence-
Contexte1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Coût$4.50
Latence33.83s
Contexte1M
TTFT33.83s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Page 1 sur 7

Graphiques

Modèles suivant "Meilleures performances"

Évolution dans le temps
Indice d'intelligence par date de sortie du modèle
Coût vs performance
Coût combiné par rapport à l'indice d'intelligence
Modèle × Benchmark
Meilleurs modèles sur les benchmarks sélectionnés
Méthodologie

Comment l'indice est construit

L'indice d'intelligence normalise chaque benchmark sur une échelle de 0 à 100 et fait la moyenne de la position relative d'un modèle sur les benchmarks pour lesquels il a été évalué. Chaque benchmark ci-dessous alimente ce score.

Mises à jour récentes

Mises à jour récentes

Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.

Moonshot AI

Kimi K3

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Sol

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Terra

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Explorez Cas d'utilisation, analyses et points de référence du LLM

Simulation d'audience: les LLM peuvent-ils prédire le comportement humain ?

LLM
Benchmark
22 Juin

En marketing, évaluer dans quelle mesure les LLMs prédisent le comportement humain est crucial pour apprécier leur efficacité à anticiper les besoins du public et à reconnaître les risques de décalage, de communication inefficace ou d'influence non intentionnelle. La simulation d'audience avec des LLM permet de modéliser des audiences virtuelles, aidant les organisations à anticiper…

En savoir plus
LLM
Benchmark
15 Juin

Passerelles IA pour OpenAI: Alternatives à OpenRouter

Nous avons comparé OpenRouter, SambaNova, TogetherAI, Groq et l'IA/ML API sur trois indicateurs (latence du premier token, latence totale et nombre de tokens de sortie), avec 300 tests utilisant des prompts courts (environ 18 tokens) et des prompts longs (environ 203 tokens) pour la latence totale. Si vous prévoyez d'utiliser l'une de ces passerelles IA,…

LLM
Benchmark
5 Juin

Grands modèles de langage en cybersécurité

Nous avons évalué 7 grands modèles de langage dans 9 domaines de la cybersécurité en utilisant SecBench, un benchmark à grande échelle et multi-format pour les tâches de sécurité. Nous avons testé chaque modèle sur 44 823 questions à choix multiples (QCM) et 3 087 questions à réponse courte (QRC), couvrant des domaines tels que…

LLM
Analyse
26 Mai

ChatGPT pour le service client: Top 10 des cas d'utilisation

ChatGPT est passé de la nouveauté à l'infrastructure dans le service client. Les entreprises l'utilisent pour réduire les temps de réponse, gérer des volumes que leurs équipes ne peuvent pas absorber et réduire le coût des interactions de routine. Mais les résultats varient considérablement selon la manière dont il est mis en œuvre. OpenAI a…

LLM
Benchmark
15 Avr

LLM Quantification: BF16 vs FP8 vs INT4

Nous avons effectué des benchmarks de Qwen3-32B à 4 niveaux de précision (BF16, FP8, GPTQ-Int8, GPTQ-Int4) sur un seul NVIDIA H100 80GB GPU. Chaque configuration a été évaluée sur 2 benchmarks (~12,2K questions) couvrant les connaissances et la génération de code, ainsi que sur plus de 2 000 exécutions d'inférence pour mesurer le débit. Int4…