Services
Contactez-nous

Benchmarks LLM

Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple.

Dernière mise à jour Juin 2026
MEILLEUR MODÈLE
Claude Fable 5
Indice 92
Meilleur rapport qualité-prix
MiniMax M3
$0.42 / 1M
Le plus rapide
GPT OSS 120B
0.19s TTFT
Couverture
64 modèles
8 benchmarks · 336 évaluations
Indice d'intelligence AIMultiple

Classement

Les modèles les mieux notés sur tous les benchmarks.

Filter & Sort
#
Modèle
Index
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Page 1 sur 7

Coût$20.00
Latence3.98s
Contexte1M
TTFT3.98s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Coût$6.00
Latence252.11s
Contexte1M
TTFT252.11s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Coût$11.25
Latence2.47s
Contexte1M
TTFT2.47s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Coût$3.00
Latence10.26s
Contexte500k
TTFT10.26s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Coût$11.25
Latence1.03s
Contexte272k
TTFT1.03s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Coût$5.63
Latence1.92s
Contexte1M
TTFT1.92s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Coût$11.25
Latence11.46s
Contexte1M
TTFT11.46s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Coût$10.00
Latence1.75s
Contexte1M
TTFT1.75s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Coût$4.50
Latence-
Contexte1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Coût$4.50
Latence33.83s
Contexte1M
TTFT33.83s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Page 1 sur 7

Graphiques

Modèles suivant "Meilleures performances"

Évolution dans le temps
Indice d'intelligence par date de sortie du modèle
Coût vs performance
Coût combiné par rapport à l'indice d'intelligence
Modèle × Benchmark
Meilleurs modèles sur les benchmarks sélectionnés
Méthodologie

Comment l'indice est construit

L'indice d'intelligence normalise chaque benchmark sur une échelle de 0 à 100 et fait la moyenne de la position relative d'un modèle sur les benchmarks pour lesquels il a été évalué. Chaque benchmark ci-dessous alimente ce score.

Mises à jour récentes

Mises à jour récentes

Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.

Moonshot AI

Kimi K3

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Sol

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Terra

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Explorez Cas d'utilisation, analyses et points de référence du LLM

50+ Cas d'utilisation de ChatGPT avec des exemples concrets

LLM
Analyse
6 Juil

ChatGPT a atteint environ 1 milliard d'utilisateurs actifs hebdomadaires au début de 2026, soit environ 10 % de la population mondiale.1 OpenAI a dépassé 20 milliards de dollars de revenus annuels pour 2025, confirmé par la directrice financière Sarah Friar.2 L'indice économique Anthropic distingue deux modes d'utilisation : l'augmentation, dans laquelle un humain interagit avec…

En savoir plus
LLM
Benchmark
2 Juil

Comparer les modèles d'IA multimodaux sur le raisonnement visuel

Nous avons évalué 15 modèles d’IA multimodaux de pointe sur le raisonnement visuel à l’aide de 200 questions visuelles. L’évaluation comprenait deux volets : 100 questions de compréhension de graphiques testant l’interprétation de visualisations de données, et 100 questions de logique visuelle évaluant la reconnaissance de motifs et le raisonnement spatial. Chaque question a été…

LLM
Analyse
2 Juil

LLM Part de marché: Comparer l'utilisation et l'adoption

Nous avons analysé la part de marché des LLM en combinant des données basées sur l'utilisation et des estimations de visites web pour montrer comment la demande pour les grands modèles de langage est répartie entre les laboratoires d'IA et les applications d'IA : Consultez la méthodologie pour voir comment nous avons mesuré et calculé…

LLM
Comparaison des Fonctionnalités
2 Juil

Meilleurs outils LLMOps & comparaison avec MLOPs

Les plateformes LLMOps gèrent l'aspect opérationnel de l'exécution des grands modèles de langage : déploiement, surveillance, évaluation et gestion des coûts. Nous avons examiné les principaux outils LLMOps, leurs fonctionnalités de base, leurs modèles de tarification et leurs différences afin d'aider à identifier le meilleur choix pour divers cas d'utilisation. Une ventilation de chaque métrique…

LLM
Comparaison des Fonctionnalités
29 Juin

Comparer 9 grands modèles de langage dans le secteur de la santé

Nous avons évalué 9 LLMs à l'aide du jeu de données MedQA, un benchmark d'examen clinique de niveau universitaire issu de questions de l'USMLE. Chaque modèle a répondu aux mêmes scénarios cliniques à choix multiples en utilisant un prompt standardisé, permettant une comparaison directe de la précision. Nous avons également mesuré la latence par question…

LLM
Analyse
26 Juin

LLM Paramètres: GPT-5 High, Moyen, Bas et Minimal

Certains LLMs, comme OpenAI’s GPT-5 family, existent en différentes versions (par exemple, GPT-5, GPT-5-mini et GPT-5-nano) et avec divers réglages de paramètres, notamment élevé, moyen, bas et minimal. Ci-dessous, nous explorons les différences entre ces versions de modèles en rassemblant leurs performances de benchmark et les coûts d’exécution de ces benchmarks. Nous avons utilisé la…

LLM
Évaluation en Monde Ouvert
25 Juin

LLM Orchestration: Top 22 frameworks et gateways

L'optimisation de l'orchestration LLM est essentielle pour améliorer les performances tout en gardant l'utilisation des ressources sous contrôle. Pour évaluer comment différentes approches d'orchestration se comportent en pratique, nous avons benchmarké : Découvrez une sélection d'outils d'orchestration LLM, incluant des frameworks pour développeurs et des gateways d'entreprise : L'orchestration LLM consiste à gérer et à…

LLM
Analyse
25 Juin

L'avenir des grands modèles de langage

Découvrez l'avenir des grands modèles de langage en explorant des approches prometteuses, telles que l'auto-entraînement, la vérification des faits et l'expertise éparse, qui pourraient remédier aux limites des LLM. Comparaison des taux de succès des LLMs Claude Sonnet 4.6 a dominé le benchmark avec un score global de 0.748, les variantes de base et de…

LLM
Analyse
22 Juin

Grands modèles multimodaux (LMMs) vs LLMs

Nous avons évalué la performance des grands modèles multimodaux (LMMs) dans des tâches de raisonnement financier en utilisant un jeu de données soigneusement sélectionné. En analysant un sous-ensemble d'échantillons financiers de haute qualité, nous évaluons les capacités des modèles à traiter et à raisonner avec des données multimodales dans le domaine financier. La section méthodologie…

LLM
Analyse
22 Juin

10+ exemples de grands modèles de langage

Nous avons rassemblé des benchmarks open source pour comparer les principaux grands modèles de langage propriétaires et open source. Choisissez votre cas d’usage pour trouver le modèle adapté. Vous pouvez évaluer les grands modèles de langage en examinant leurs performances sur les benchmarks et leur latence réelle (disponible en cliquant sur le nom de chaque…

LLM
Comparaison des Fonctionnalités
22 Juin

Cloud LLM vs local LLMs: exemples & avantages

Les LLMs cloud, alimentés par des modèles avancés comme GPT-5.5 et Claude Opus 4.7, offrent évolutivité et accessibilité. Inversement, les LLMs locaux, pilotés par des modèles open source tels que Llama 4, DeepSeek V4 et Qwen3.6-Plus, garantissent une confidentialité et une personnalisation renforcées. Découvrez ce que sont les LLMs cloud, leurs forces et faiblesses, les…