Services
Contactez-nous

Benchmarks LLM

Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple. Voir la méthodologie.

MEILLEUR MODÈLE
Claude Fable 5
Indice 92
Meilleur rapport qualité-prix
MiniMax M3
$0.42 / 1M
Le plus rapide
GPT OSS 120B
0.23s TTFT
Couverture
64 modèles
8 benchmarks · 336 évaluations
Indice d'intelligence AIMultiple

Classement

Les modèles les mieux notés sur tous les benchmarks.

Filter & Sort
#
Modèle
Index
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Page 1 sur 7

Coût$20.00
Latence4.02s
Contexte1M
TTFT4.02s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Coût$6.00
Latence2.93s
Contexte1M
TTFT2.93s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Coût$11.25
Latence4.31s
Contexte1M
TTFT4.31s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Coût$3.00
Latence7.25s
Contexte500k
TTFT7.25s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Coût$11.25
Latence0.70s
Contexte272k
TTFT0.70s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Coût$4.50
Latence1.62s
Contexte1M
TTFT1.62s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Coût$11.25
Latence11.11s
Contexte1M
TTFT11.11s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Coût$10.00
Latence1.71s
Contexte1M
TTFT1.71s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Coût$4.50
Latence-
Contexte1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Coût$4.50
Latence22.02s
Contexte1M
TTFT22.02s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Page 1 sur 7
Évolution dans le temps
Indice d'intelligence par date de sortie du modèle
Coût vs performance
Coût combiné par rapport à l'indice d'intelligence
Modèle × Benchmark
Meilleurs modèles sur les benchmarks sélectionnés
Méthodologie

Comment l'indice est construit

L'indice d'intelligence normalise chaque benchmark sur une échelle de 0 à 100 et fait la moyenne de la position relative d'un modèle sur les benchmarks pour lesquels il a été évalué. Chaque benchmark ci-dessous alimente ce score.

AIMultiple
FinanceReasoningRaisonnement financier complexe en plusieurs étapes sur 238 questions difficiles de FinanceReasoning.
AIMultiple
Text-to-SQLPrécision de la génération de requêtes SQL à partir du langage naturel sur plus de 35 LLM.
AIMultiple
Agentic RAGRoutage multi-bases de données et génération de requêtes SQL sur 5 bases de données (BIRD-SQL, 500 questions).
AIMultiple
AI MemoryRécupération de données numériques en contexte long selon la position dans le document (100 éléments, 14 transcriptions).
AIMultiple
AI HallucinationRésistance à l'invention de métriques non mentionnées dans des documents à contexte long (204 pièges, 14 transcriptions).
Public
Humanity's Last ExamRaisonnement à livre fermé de niveau expert dans plus de 100 disciplines académiques (2,5k questions).
Public
SciCodeCodage scientifique de niveau recherche en physique, mathématiques, biologie et chimie (338 sous-problèmes)
Public
LegalBenchRaisonnement juridique participatif sur 162 tâches créées par des praticiens du droit.
Public
FrontierMathProblèmes de mathématiques de recherche inédits, rédigés par des experts (niveaux 1 à 4).
Public
ARC-AGI-2Nouvelles énigmes de raisonnement visuel évaluant la généralisation, et non la mémorisation.
Public
Swe-BenchTickets GitHub réels résolus de bout en bout (jeu complet de 2 294 instances).
Public
LiveCodeBenchProblèmes de programmation compétitive sans contamination, mis à jour en continu.
AIMultiple
Agentic LLM BenchmarkCodage agentique sur 10 tâches de développement logiciel via un outil CLI (~3 500 étapes de validation).
Mises à jour récentes

Mises à jour récentes

Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.

Moonshot AI

Kimi K3

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Sol

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Terra

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Chronologie des sorties de modèles d'IALes 15 derniers modèles en 41 jours

Principales sorties de modèles d'IA des fournisseurs leaders au cours des 41 derniers jours.

Fournisseur
Z AI
Z AI
18 Août 2026
GLM 5.3
Google
Google
21 Juil 2026
Gemini 3.5 Flash Lite +1 de plusGemini 3.5 Flash LiteGemini 3.6 Flash
13 Août 2026
Gemini 3.7 Flash
Meta
Meta
16 Juil 2026
Muse Spark 1.1
05 Août 2026
Muse Spark 1.2
09 Août 2026
Muse Glimmer 30B
Anthropic
Anthropic
24 Juil 2026
Claude Opus 5
Moonshot AI
Moonshot AI
16 Juil 2026
Kimi K3
OpenAI
OpenAI
09 Juil 2026
GPT-5.6 Luna +5 de plusGPT-5.6 LunaGPT-5.6 Luna ProGPT-5.6 SolGPT-5.6 Sol ProGPT-5.6 TerraGPT-5.6 Terra Pro

Explorez Cas d'utilisation, analyses et points de référence du LLM

L'avenir des grands modèles de langage

LLM
Analyse
18 Août

Découvrez l'avenir des grands modèles de langage en explorant des approches prometteuses, telles que l'auto-apprentissage, la vérification des faits et l'expertise parcimonieuse, qui pourraient remédier aux limites des LLM. Comparaison des taux de réussite des LLM Claude Sonnet 4.6 a dominé le benchmark avec un score global de 0.748, les variantes de base et de…

En savoir plus
LLM18 Août

LLM Tarification: comparatif des 15+ principaux fournisseurs

LLM la tarification s'étend sur trois ordres de grandeur : les models de base les moins chers coûtent moins de $0,20 par million de tokens, tandis que les niveaux de raisonnement de pointe sont lancés à des prix allant jusqu'à $262.50. Le graphique ci-dessous suit l'évolution des prix de lancement : chaque model se situe…

LLM
Analyse
18 Août

ChatGPT pour le service client: les 10 meilleurs cas d'utilisation

ChatGPT est passé du statut de nouveauté à celui d'infrastructure du service client. Les entreprises l'utilisent pour réduire les temps de réponse, absorber des volumes que leurs équipes ne peuvent pas gérer et diminuer le coût des interactions courantes. Mais les résultats varient fortement selon sa mise en œuvre. OpenAI a lancé GPT-5.6, un modèle…

LLM
Analyse
17 Août

LLM Automatisation: Top 7 des outils et 8 études de cas 

L'automatisation LLM désigne le passage à des outils d'automatisation intelligents qui exploitent les LLM, notamment les agents IA, les LLM affinés et les modèles RAG pour automatiser et coordonner les tâches. Découvrez ce qu'est l'automatisation LLM, ses principales applications concrètes et ses principaux outils : Les grands modèles de langage dans l'automatisation constituent une approche…

LLM
Analyse
17 Août

Grands modèles multimodaux (LMM) vs LLMs

Nous avons évalué les performances des grands modèles multimodaux (LMM) dans des tâches de raisonnement financier à l’aide d’un dataset soigneusement sélectionné. En analysant un sous-ensemble d’échantillons financiers de haute qualité, nous évaluons la capacité des modèles à traiter et à raisonner avec des données multimodales dans le domaine financier. La section méthodologie fournit des…

LLM
Comparaison des Fonctionnalités
17 Août

Comparatif de 9 Large Language Models dans le domaine de la santé

Nous avons évalué 9 LLMs à l'aide du dataset MedQA, un benchmark d'examen clinique de niveau universitaire dérivé des questions de l'USMLE. Chaque model a répondu aux mêmes scénarios cliniques à choix multiples en utilisant un prompt standardisé, ce qui permet une comparaison directe de la précision. Nous avons également enregistré la latence par question…

LLM
Benchmark
16 Août

Densité d'intelligence des 71 LLMs pour des modèles plus intelligents et plus denses

Nous avons suivi 71 LLMs publiés entre février 2023 et mai 2026 et avons collecté 10 benchmarks publics pour mesurer la densité d'intelligence. Nous avons divisé le score de capacité par la ressource que le modèle consomme (paramètres actifs, coût de calcul d'entraînement et prix d'inférence). Pour calculer la densité d'intelligence, nous avons exécuté les…

LLM
Analyse
14 Août

50+ Cas d'utilisation de ChatGPT avec des exemples concrets

ChatGPT a atteint environ 1 milliard d’utilisateurs actifs hebdomadaires début 2026, soit environ 10 % de la population mondiale.1 OpenAI a dépassé 20 milliards de dollars de revenus annuels pour 2025, confirmé par la directrice financière Sarah Friar.2 L’Anthropic Economic Index distingue deux modes d’utilisation : l’augmentation, où un humain interagit avec l’IA, et l’automatisation, où…

LLM
Benchmark
14 Août

Benchmark de 40+ LLM en finance: Claude Fable 5 & GPT-5.6 Sol

Nous avons évalué les LLM sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1 Ce sous-ensemble cible les tâches de raisonnement financier les plus difficiles, en évaluant le raisonnement quantitatif complexe à plusieurs étapes impliquant des concepts et des formules financiers. Notre évaluation a utilisé une conception de prompt personnalisée et des critères de…

LLM
Benchmark
14 Août

AIM Enterprise: Benchmark d'entreprise agentique

Les entreprises utilisent des LLM au quotidien pour leurs tâches habituelles. Pour trouver les LLM les plus rentables, nous avons conçu AIM Enterprise, un benchmark d'entreprise agentique, où nous avons utilisé 69 tâches d'entreprise dans différentes catégories. Chaque modèle a livré un fichier par tâche. Les scores sont relatifs : les juges classent chaque réponse…

LLM
Analyse
13 Août

Lois d'échelle des LLM: analyse de chercheurs en IA

Les grands modèles de langage prédisent le token suivant à partir de motifs appris dans les données textuelles. Le terme lois d'échelle des LLM désigne des régularités empiriques qui relient les performances du modèle à la quantité de calcul, aux données d'entraînement et aux paramètres du modèle utilisés pendant l'entraînement. Pour comprendre comment ces relations…