Services
Contactez-nous

Benchmarks LLM

Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple.

Dernière mise à jour Juin 2026
MEILLEUR MODÈLE
Claude Fable 5
Indice 92
Meilleur rapport qualité-prix
MiniMax M3
$0.42 / 1M
Le plus rapide
GPT OSS 120B
0.19s TTFT
Couverture
64 modèles
8 benchmarks · 336 évaluations
Indice d'intelligence AIMultiple

Classement

Les modèles les mieux notés sur tous les benchmarks.

Filter & Sort
#
Modèle
Index
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Page 1 sur 7

Coût$20.00
Latence3.98s
Contexte1M
TTFT3.98s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Coût$6.00
Latence252.11s
Contexte1M
TTFT252.11s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Coût$11.25
Latence2.47s
Contexte1M
TTFT2.47s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Coût$3.00
Latence10.26s
Contexte500k
TTFT10.26s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Coût$11.25
Latence1.03s
Contexte272k
TTFT1.03s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Coût$5.63
Latence1.92s
Contexte1M
TTFT1.92s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Coût$11.25
Latence11.46s
Contexte1M
TTFT11.46s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Coût$10.00
Latence1.75s
Contexte1M
TTFT1.75s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Coût$4.50
Latence-
Contexte1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Coût$4.50
Latence33.83s
Contexte1M
TTFT33.83s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Page 1 sur 7

Graphiques

Modèles suivant "Meilleures performances"

Évolution dans le temps
Indice d'intelligence par date de sortie du modèle
Coût vs performance
Coût combiné par rapport à l'indice d'intelligence
Modèle × Benchmark
Meilleurs modèles sur les benchmarks sélectionnés
Méthodologie

Comment l'indice est construit

L'indice d'intelligence normalise chaque benchmark sur une échelle de 0 à 100 et fait la moyenne de la position relative d'un modèle sur les benchmarks pour lesquels il a été évalué. Chaque benchmark ci-dessous alimente ce score.

Mises à jour récentes

Mises à jour récentes

Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.

Moonshot AI

Kimi K3

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Sol

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Terra

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Explorez Cas d'utilisation, analyses et points de référence du LLM

Lois d'échelle des LLM: Analyse des chercheurs en IA

LLM
Analyse
24 Juil

Les grands modèles de langage prédisent le token suivant en se basant sur les motifs appris à partir de données textuelles. Le terme lois d'échelle des LLM fait référence aux régularités empiriques qui relient les performances d'un modèle à la quantité de calcul, aux données d'entraînement et au nombre de paramètres du modèle utilisés pendant…

En savoir plus
LLM23 Juil

Tarification LLM: Top 15+ fournisseurs comparés

Les prix des API changent à chaque génération de modèle. Le graphique ci-dessous place chaque modèle à sa date de lancement, indique son prix de lancement par million de tokens, utilise un ratio mixte de 3:1 entre entrée et sortie, et classe les modèles en huit catégories de taille. Les prix sont les tarifs API…

LLM
Benchmark
17 Juil

De texte à SQL: Comparaison de la précision des LLM

J'utilise SQL pour l'analyse de données depuis 18 ans, depuis mes débuts en tant que consultant. Traduire des questions en langage naturel en SQL rend les données plus accessibles, permettant à quiconque, même sans compétences techniques, de travailler directement avec les bases de données. Nous avons utilisé notre méthodologie de benchmark de texte vers SQL…

LLM
Analyse
16 Juil

LLM Guide de fine-tuning pour les entreprises

Suivez les liens pour les solutions spécifiques aux défis de sortie de votre LLM. Si votre LLM : L’adoption généralisée des grands modèles de langage (LLM) a amélioré notre capacité à traiter le langage humain. Cependant, leur entraînement générique donne souvent des performances sous-optimales pour des tâches spécifiques. Pour surmonter cette limitation, des méthodes de…

LLM
Analyse
16 Juil

LLM Outils d'observabilité: Weights & Biases, Langsmith

LLM applications se sont étendues des conversations en aller-simple aux agents à étapes multiples qui utilisent des outils, interrogent des bases de données, et se coordonnent avec d'autres modèles, rendant leur comportement plus difficile à interpréter. L'observabilité LLM offre une visibilité continue sur ces flux de travail complexes, aidant les organisations à surveiller la qualité,…

LLM
Analyse
12 Juil

LLM Calculateur VRAM pour l'auto-hébergement

Auto-héberger un LLM signifie exécuter l'inférence sur du matériel que l'opérateur contrôle, plutôt que via une API tierce, ce qui modifie le coût, le contrôle des données et le profil de confidentialité. Qu'un modèle puisse fonctionner ou non dépend de la mémoire. Le calculateur estime la VRAM ou la mémoire unifiée dont un modèle a…

LLM
Benchmark
10 Juil

Benchmark de 40+ LLMs en finance: Claude Fable 5 & GPT-5.6 Sol

Nous avons évalué 40+ LLMs en finance sur 238 questions difficiles du benchmark FinanceReasoning afin d'identifier les modèles qui excellent dans les tâches de raisonnement financier complexes telles que l'analyse des états financiers, les prévisions et les calculs de ratios. Nous avons évalué les LLMs sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1…

LLM
Analyse
10 Juil

Automatisation LLM: Top 7 des outils & 8 études de cas 

L'automatisation LLM désigne le passage à des outils d'automatisation intelligents qui exploitent les LLM, y compris les agents IA, les LLM fine-tunés et les modèles RAG pour automatiser et coordonner les tâches. Découvrez ce qu'est l'automatisation LLM, ses principales applications concrètes et les outils majeurs : Les grands modèles de langage en automatisation constituent une…

LLM
Benchmark
8 Juil

LLM Benchmark de latence par cas d'utilisation

Nous avons benchmarké 11 grands modèles de langage avec un total de 1,320 requêtes, en séparant les modèles de raisonnement des modèles sans raisonnement, et nous avons mesuré la latence du premier token, la latence par token, et le temps de réponse global. Vous pouvez trouver des détails sur la façon dont nous avons mesuré…

LLM
Benchmark
7 Juil

HALC-Bench: LLM Hallucination sur le banc d'essai de récupération en contexte long

HALC-Bench (LLM Hallucination sur le banc d'essai de récupération en contexte long) mesure la résistance d'un LLM à fabriquer des preuves pour une métrique qui n'existe pas dans le document cible en utilisant 3 meules de foin placées au début, au milieu et à la fin de la fenêtre de contexte du modèle, avec 204…

LLM
Benchmark
7 Juil

Densité d'intelligence de 71 LLMs: modèles plus intelligents et plus denses

Nous avons suivi 71 LLMs publiés entre février 2023 et mai 2026 et collecté 10 benchmarks publics pour mesurer la densité d'intelligence. Nous avons divisé le score de capacité par la ressource que le modèle consomme (paramètres actifs, calcul d'entraînement et prix d'inférence). Pour calculer la densité d'intelligence, nous avons suivi les étapes suivantes :…