Services
Contactez-nous

Benchmarks LLM

Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple. Voir la méthodologie.

MEILLEUR MODÈLE
Claude Fable 5
Indice 92
Meilleur rapport qualité-prix
MiniMax M3
$0.42 / 1M
Le plus rapide
GPT OSS 120B
0.23s TTFT
Couverture
64 modèles
8 benchmarks · 336 évaluations
Indice d'intelligence AIMultiple

Classement

Les modèles les mieux notés sur tous les benchmarks.

Filter & Sort
#
Modèle
Index
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Page 1 sur 7

Coût$20.00
Latence4.02s
Contexte1M
TTFT4.02s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Coût$6.00
Latence2.93s
Contexte1M
TTFT2.93s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Coût$11.25
Latence4.31s
Contexte1M
TTFT4.31s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Coût$3.00
Latence7.25s
Contexte500k
TTFT7.25s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Coût$11.25
Latence0.70s
Contexte272k
TTFT0.70s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Coût$4.50
Latence1.62s
Contexte1M
TTFT1.62s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Coût$11.25
Latence11.11s
Contexte1M
TTFT11.11s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Coût$10.00
Latence1.71s
Contexte1M
TTFT1.71s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Coût$4.50
Latence-
Contexte1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Coût$4.50
Latence22.02s
Contexte1M
TTFT22.02s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Page 1 sur 7
Évolution dans le temps
Indice d'intelligence par date de sortie du modèle
Coût vs performance
Coût combiné par rapport à l'indice d'intelligence
Modèle × Benchmark
Meilleurs modèles sur les benchmarks sélectionnés
Méthodologie

Comment l'indice est construit

L'indice d'intelligence normalise chaque benchmark sur une échelle de 0 à 100 et fait la moyenne de la position relative d'un modèle sur les benchmarks pour lesquels il a été évalué. Chaque benchmark ci-dessous alimente ce score.

AIMultiple
FinanceReasoningRaisonnement financier complexe en plusieurs étapes sur 238 questions difficiles de FinanceReasoning.
AIMultiple
Text-to-SQLPrécision de la génération de requêtes SQL à partir du langage naturel sur plus de 35 LLM.
AIMultiple
Agentic RAGRoutage multi-bases de données et génération de requêtes SQL sur 5 bases de données (BIRD-SQL, 500 questions).
AIMultiple
AI MemoryRécupération de données numériques en contexte long selon la position dans le document (100 éléments, 14 transcriptions).
AIMultiple
AI HallucinationRésistance à l'invention de métriques non mentionnées dans des documents à contexte long (204 pièges, 14 transcriptions).
Public
Humanity's Last ExamRaisonnement à livre fermé de niveau expert dans plus de 100 disciplines académiques (2,5k questions).
Public
SciCodeCodage scientifique de niveau recherche en physique, mathématiques, biologie et chimie (338 sous-problèmes)
Public
LegalBenchRaisonnement juridique participatif sur 162 tâches créées par des praticiens du droit.
Public
FrontierMathProblèmes de mathématiques de recherche inédits, rédigés par des experts (niveaux 1 à 4).
Public
ARC-AGI-2Nouvelles énigmes de raisonnement visuel évaluant la généralisation, et non la mémorisation.
Public
Swe-BenchTickets GitHub réels résolus de bout en bout (jeu complet de 2 294 instances).
Public
LiveCodeBenchProblèmes de programmation compétitive sans contamination, mis à jour en continu.
AIMultiple
Agentic LLM BenchmarkCodage agentique sur 10 tâches de développement logiciel via un outil CLI (~3 500 étapes de validation).
Mises à jour récentes

Mises à jour récentes

Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.

Moonshot AI

Kimi K3

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Sol

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Terra

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Chronologie des sorties de modèles d'IALes 15 derniers modèles en 41 jours

Principales sorties de modèles d'IA des fournisseurs leaders au cours des 41 derniers jours.

Fournisseur
Google
Google
21 Juil 2026
Gemini 3.5 Flash Lite +1 de plusGemini 3.5 Flash LiteGemini 3.6 Flash
13 Août 2026
Gemini 3.7 Flash
Meta
Meta
16 Juil 2026
Muse Spark 1.1
05 Août 2026
Muse Spark 1.2
09 Août 2026
Muse Glimmer 30B
Anthropic
Anthropic
24 Juil 2026
Claude Opus 5
Moonshot AI
Moonshot AI
16 Juil 2026
Kimi K3
OpenAI
OpenAI
09 Juil 2026
GPT-5.6 Luna +5 de plusGPT-5.6 LunaGPT-5.6 Luna ProGPT-5.6 SolGPT-5.6 Sol ProGPT-5.6 TerraGPT-5.6 Terra Pro
X
X
08 Juil 2026
Grok 4.5

Explorez Cas d'utilisation, analyses et points de référence du LLM

LLM Outils d'observabilité: Weights & Biases, Langsmith

LLM
Analyse
13 Août

Les applications LLM sont passées de chats à un seul tour à des agents multi-étapes qui utilisent des outils, interrogent des bases de données et se coordonnent avec d’autres modèles, ce qui rend leur comportement plus difficile à interpréter. L’observabilité des LLM offre une visibilité continue sur ces flux de travail complexes, aidant les organisations…

En savoir plus
LLM
Benchmark
12 Août

LLM Benchmark de latence par cas d'usage

Nous avons benchmarké 11 des meilleurs grands modèles de langage avec un total de 1 320 requêtes, en séparant les modèles de raisonnement et de non-raisonnement, et mesuré la latence du premier token, la latence par token et le temps de réponse global. Vous trouverez des détails sur la façon dont nous avons mesuré la…

LLM
Comparaison des Fonctionnalités
12 Août

Meilleurs outils LLMOps & comparaison avec MLOPs

Les plateformes LLMOps gèrent l'aspect opérationnel de l'exécution des grands modèles de langage : déploiement, surveillance, évaluation et gestion des coûts. Nous avons examiné les principaux outils LLMOps, leurs fonctionnalités de base, leurs modèles de tarification et leurs différences afin d'aider à identifier le meilleur choix pour divers cas d'utilisation. Une ventilation de chaque métrique…

LLM
Benchmark
11 Août

Agentic IT: Can LLMs Design a Benchmark

We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…

LLM
Benchmark
9 Août

Text-to-SQL: Comparaison de la précision des LLM

Nous avons exécuté 36 grands modèles de langage sur 759 questions de BIRD-SQL, chaque modèle écrivant du SQL contre une base de données qu'il devait identifier par lui-même parmi 11 candidates. Chaque requête analysable a été exécutée contre la base de données réelle et son ensemble de résultats comparé à l'ensemble de résultats de la…

LLM
Évaluation en Monde Ouvert
6 Août

LLM Orchestration: 22 frameworks et passerelles

L'optimisation de l'orchestration LLM est essentielle pour améliorer les performances tout en maîtrisant l'utilisation des ressources. Pour évaluer comment différentes approches d'orchestration se comportent en pratique, nous avons effectué des benchmarks : Découvrez une sélection d'outils d'orchestration LLM, y compris les frameworks développeur et les passerelles d'entreprise : L'orchestration LLM consiste à gérer et intégrer…

LLM
Benchmark
4 Août

HALC-Bench: LLM Hallucination sur un benchmark de récupération en contexte long

HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark) mesure la résistance d'un LLM à fabriquer des preuves pour une métrique qui n'existe pas dans le document cible en utilisant 3 bottes de foin placées au début, au milieu et à la fin de la fenêtre de contexte du modèle, avec 204 questions. claude-fable-5 a répondu correctement…

LLM
Benchmark
4 Août

Comparer les modèles d'IA multimodaux sur le raisonnement visuel

Nous avons évalué 15 modèles d'IA multimodaux leaders sur le raisonnement visuel en utilisant 200 questions basées sur l'image. L'évaluation comprenait deux pistes : 100 questions de compréhension de graphiques testant l'interprétation de visualisations de données, et 100 questions de logique visuelle évaluant la reconnaissance de motifs et le raisonnement spatial. Chaque question a été…

LLM
Benchmark
4 Août

Simulation d'audience: Les LLM peuvent-elles prédire le comportement humain ?

En marketing, évaluer avec quelle précision les LLMs prédisent le comportement humain est crucial pour estimer leur efficacité à anticiper les besoins du public et pour reconnaître les risques de décalage, de communication inefficace ou d'influence non désirée. La simulation d'audience avec des LLMs permet de modéliser des publics virtuels, aidant les organisations à anticiper…

LLM
Benchmark
2 Août

Passerelles IA pour OpenAI: Alternatives à OpenRouter

Nous avons benchmarké OpenRouter, SambaNova, TogetherAI, Groq et IA/ML API sur trois indicateurs (latence du premier token, latence totale et nombre de tokens de sortie), avec 300 tests utilisant des prompts courts (environ 18 tokens) et des prompts longs (environ 203 tokens) pour la latence totale. Si vous prévoyez d'utiliser l'une de ces passerelles IA,…

LLM
Analyse
16 Juil

LLM Guide de fine-tuning pour les entreprises

Suivez les liens pour les solutions spécifiques aux défis de sortie de votre LLM. Si votre LLM : L’adoption généralisée des grands modèles de langage (LLM) a amélioré notre capacité à traiter le langage humain. Cependant, leur entraînement générique donne souvent des performances sous-optimales pour des tâches spécifiques. Pour surmonter cette limitation, des méthodes de…