Premium
Services
Premium

Benchmarks LLM

Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple. Comment l'indice est construit

MEILLEUR MODÈLE
Claude Opus 5.5
Indice 79
Meilleur rapport qualité-prix
Qwen3.8 Flash
$0.23 / 1M
Le plus rapide
Command A+
0.22s TTFT
Indice d'intelligence AIMultiple

Classement

Les modèles les mieux notés sur tous les benchmarks.

Filter & Sort
#
Modèle
Index
AIM-Agentic-RAG
AIM-AI-Bias
AIM-FinanceReasoning
AIM-Text-to-SQL
ARC-AGI-3
CritPt
FrontierMath
IFBench
MMMU-Pro
SciCode
Terminal-Bench 2.1
1
Claude Opus 5.5
Claude Opus 5.5
Anthropic
79
90949288-32--8867-
2
GPT-6 Astra
GPT-6 Astra
OpenAI
76
84988766633298-875690
3
Claude Fable 5.1
Claude Fable 5.1
Anthropic
73
84-9067-3188--6391
4
Qwen3.8 Flash
Qwen3.8 Flash
Alibaba Cloud
71
-------81-4786
5
Qwen3.8 Max
Qwen3.8 Max
Alibaba Cloud
70
8393-51--46-825381
6
Claude Opus 5
Claude Opus 5
Anthropic
68
85819064302973-855689
7
Muse Spark 1.1
Muse Spark 1.1
Meta
68
---------5878
8
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
67
778990548328373835790
9
Kimi K3
Kimi K3
Moonshot AI
66
83898848-2339-815985
10
Claude Sonnet 5
Claude Sonnet 5
Anthropic
65
73918738--29--5480
Page 1 sur 4

Coût$8.00
Latence1.16s
Contexte1M
TTFT1.16s
AIM-Agentic-RAG
90
AIM-AI-Bias
94
AIM-FinanceReasoning
92
AIM-Text-to-SQL
88
CritPt
32
MMMU-Pro
88
SciCode
67

Coût$20.00
Latence4.75s
Contexte524k
TTFT4.75s
AIM-Agentic-RAG
84
AIM-AI-Bias
98
AIM-FinanceReasoning
87
AIM-Text-to-SQL
66
ARC-AGI-3
63
CritPt
32
FrontierMath
98
MMMU-Pro
87
SciCode
56
Terminal-Bench 2.1
90

Coût$20.00
Latence1.93s
Contexte1M
TTFT1.93s
AIM-Agentic-RAG
84
AIM-FinanceReasoning
90
AIM-Text-to-SQL
67
CritPt
31
FrontierMath
88
SciCode
63
Terminal-Bench 2.1
91

Coût$0.23
Latence1.72s
Contexte1M
TTFT1.72s
IFBench
81
SciCode
47
Terminal-Bench 2.1
86

Coût$3.00
Latence56.57s
Contexte1M
TTFT56.57s
AIM-Agentic-RAG
83
AIM-AI-Bias
93
AIM-Text-to-SQL
51
FrontierMath
46
MMMU-Pro
82
SciCode
53
Terminal-Bench 2.1
81

Coût$10.00
Latence2.58s
Contexte1M
TTFT2.58s
AIM-Agentic-RAG
85
AIM-AI-Bias
81
AIM-FinanceReasoning
90
AIM-Text-to-SQL
64
ARC-AGI-3
30
CritPt
29
FrontierMath
73
MMMU-Pro
85
SciCode
56
Terminal-Bench 2.1
89

Coût$2.00
Latence1.47s
Contexte1M
TTFT1.47s
SciCode
58
Terminal-Bench 2.1
78

Coût$8.00
Latence3.06s
Contexte1M
TTFT3.06s
AIM-Agentic-RAG
77
AIM-AI-Bias
89
AIM-FinanceReasoning
90
AIM-Text-to-SQL
54
ARC-AGI-3
8
CritPt
32
FrontierMath
83
IFBench
73
MMMU-Pro
83
SciCode
57
Terminal-Bench 2.1
90

Coût$3.00
Latence2.70s
Contexte1M
TTFT2.70s
AIM-Agentic-RAG
83
AIM-AI-Bias
89
AIM-FinanceReasoning
88
AIM-Text-to-SQL
48
CritPt
23
FrontierMath
39
MMMU-Pro
81
SciCode
59
Terminal-Bench 2.1
85

Coût$4.00
Latence1.79s
Contexte1M
TTFT1.79s
AIM-Agentic-RAG
73
AIM-AI-Bias
91
AIM-FinanceReasoning
87
AIM-Text-to-SQL
38
FrontierMath
29
SciCode
54
Terminal-Bench 2.1
80
Page 1 sur 4
Évolution dans le temps
Indice d'intelligence par date de sortie du modèle
Coût vs performance
Coût combiné par rapport à l'indice d'intelligence
Modèle × Benchmark
Meilleurs modèles sur les benchmarks sélectionnés

Comment l'indice est construit

L'indice est la moyenne des scores d'un modèle sur les benchmarks listés ci-dessous, parmi ceux qu'il a réellement passés : un benchmark qu'il n'a jamais passé ne compte pas comme un zéro, il est simplement absent. Tous les benchmarks de l'indice comptent de manière égale. Un benchmark qui donne déjà un pourcentage de 0 à 100 est utilisé tel quel ; un benchmark sur une autre échelle est d'abord ramené sur 0-100. Un modèle doit avoir des résultats sur au moins deux benchmarks de l'indice pour être classé : un résultat unique ne lui donne pas un classement propre. Comme les scores sont utilisés tels quels, un benchmark que tout le champ trouve difficile tire vers le bas chaque score obtenu dessus, et un modèle mesuré sur des benchmarks plus difficiles le reporte dans sa moyenne.

Benchmarks utilisés

AIMultiple
AIM-Agentic-RAGRoutage multi-bases de données et génération de requêtes SQL sur 5 bases de données (BIRD-SQL, 500 questions).
AIMultiple
AIM-AI-BiasPer model per question per repetition bias evaluation results across 64 questions in both multiple choice and open ended formats, 27 models in the multiple choice condition and 26 in the open ended condition
AIMultiple
AIM-FinanceReasoningRaisonnement financier complexe en plusieurs étapes sur 238 questions difficiles de FinanceReasoning.
AIMultiple
AIM-Text-to-SQLPrécision de la génération de requêtes SQL à partir du langage naturel sur plus de 35 LLM.
Public
ARC-AGI-3Raisonnement interactif : les agents explorent des environnements de jeu inedits, se fixent des objectifs en cours de route et apprennent au fil des etapes. 100% equivaut a l'efficacite d'apprentissage humaine.
Public
CritPtProblemes de physique de niveau recherche exigeant des derivations multi-etapes.
Public
FrontierMathProblèmes de mathématiques de recherche inédits, rédigés par des experts (niveaux 1 à 4).
Public
IFBenchSuivi precis d'instructions sur 58 contraintes de sortie verifiables inedites.
Public
MMMU-ProComprehension multimodale de niveau universitaire entre disciplines, durcie contre les raccourcis textuels.
Public
SciCodeCodage scientifique de niveau recherche en physique, mathématiques, biologie et chimie (338 sous-problèmes)
Public
Terminal-Bench 2.1Taches agentiques en terminal couvrant le genie logiciel, les donnees et l'administration systeme.

Mises à jour récentes

Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.

Anthropic

Claude Opus 5.5

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-6 Sol

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

OpenAI

GPT-6 Luna

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

X

Grok 4.7

Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.

Chronologie des sorties de LLMLe rythme de l'innovation en IA
Laboratoires d'IA
Alibaba Cloud
Alibaba Cloud
27 juil 2026
Qwen3.7 Flash
03 août 2026
Qwen3.8 Max
12 août 2026
Qwen3.8 2.4T A95B
14 août 2026
Qwen3.8 27B
26 août 2026
Qwen3.8 Flash
03 sep 2026
Qwen3.8 Max (0902)
21 sep 2026
Qwen3.8 Omni Flash
23 sep 2026
Qwen3.8 Max Prime
Z AI
Z AI
18 août 2026
GLM 5.3
26 août 2026
GLM 5.3 Flash
18 sep 2026
GLM 5.3 FlashX
23 sep 2026
GLM 5.3 Prime
Anthropic
Anthropic
30 juin 2026
Claude Sonnet 5
24 juil 2026
Claude Opus 5
01 sep 2026
Claude Fable 5.1
22 sep 2026
Claude Opus 5.5
OpenAI
OpenAI
09 juil 2026
GPT-5.6 Luna +2 de plusGPT-5.6 LunaGPT-5.6 SolGPT-5.6 Terra
04 sep 2026
GPT-6 Astra
22 sep 2026
GPT-6 Luna +1 de plusGPT-6 LunaGPT-6 Sol
Cohere
Cohere
22 sep 2026
Command A+
X
X
08 juil 2026
Grok 4.5
12 août 2026
Grok 4.6
21 sep 2026
Grok 4.7
DeepSeek
DeepSeek
31 juil 2026
DeepSeek V4 Flash 0731
12 août 2026
DeepSeek V4 Pro 0813
21 août 2026
DeepSeek V4 Flash Vision Exp
10 sep 2026
DeepSeek V4.1 Flash
Meta
Meta
16 juil 2026
Muse Spark 1.1
05 août 2026
Muse Spark 1.2
09 août 2026
Muse Glimmer 30B
21 août 2026
Muse Spark 1.2 Contributor
02 sep 2026
Muse Spark 1.3 +1 de plusMuse Spark 1.3Muse Spark 1.3 Contributor
Google
Google
30 juin 2026
Nano Banana 2 Lite
21 juil 2026
Gemini 3.5 Flash Lite +1 de plusGemini 3.5 Flash LiteGemini 3.6 Flash
13 août 2026
Gemini 3.7 Flash
02 sep 2026
Gemini 3.8 Flash
Tencent
Tencent
06 juil 2026
Hy3
19 août 2026
Hy-MT2-7B
20 août 2026
Hy-MT2-1.8B +1 de plusHy-MT2-1.8BHy-MT2-30B-A3B
28 août 2026
Hy4 +1 de plusHy4Hy4 preview
Moonshot AI
Moonshot AI
16 juil 2026
Kimi K3

Explorez Cas d'utilisation, analyses et points de référence du LLM

Comparer 9 grands modèles de langage dans le domaine de la santé

LLM
Comparaison des Fonctionnalités
15 sep

Nous avons évalué 9 LLMs à l'aide du dataset MedQA, un benchmark d'examen clinique de niveau universitaire dérivé des questions de l'USMLE. Chaque modèle a répondu aux mêmes scénarios cliniques à choix multiples à l'aide d'un prompt standardisé, permettant une comparaison directe de la précision. Nous avons également enregistré la latence par question en divisant…

En savoir plus
LLM
Benchmark
15 sep

Simulation d'audience: Les LLM peuvent-elles prédire le comportement humain ?

En marketing, évaluer avec quelle précision les LLMs prédisent le comportement humain est crucial pour estimer leur efficacité à anticiper les besoins du public et pour reconnaître les risques de décalage, de communication inefficace ou d'influence non désirée. La simulation d'audience avec des LLMs permet de modéliser des publics virtuels, aidant les organisations à anticiper…

LLM
Benchmark
15 sep

HALC-Bench: LLM Hallucination sur le benchmark de récupération en contexte long

HALC-Bench (LLM Hallucination sur le benchmark de récupération en contexte long) mesure la résistance d’un modèle de langage de grande taille à fabriquer des preuves pour une mesure qui n’existe pas dans le document cible, en utilisant 3 meules de foin placées au début, au milieu et à la fin de la fenêtre de contexte…

LLM
Benchmark
15 sep

Passerelles IA pour OpenAI: alternatives à OpenRouter

Nous avons évalué OpenRouter, SambaNova, TogetherAI, Groq et IA/ML API selon trois indicateurs (latence du premier token, latence totale et nombre de tokens de sortie), avec 300 tests utilisant des prompts courts (environ 18 tokens) et des prompts longs (environ 203 tokens) pour la latence totale. Si vous prévoyez d'utiliser l'une de ces passerelles IA,…

LLM
Analyse
2 sep

LLM Outils d'observabilité: Weights & Biases, Langsmith

Les applications LLM sont passées de chats à un seul tour à des agents multi-étapes qui utilisent des outils, interrogent des bases de données et se coordonnent avec d’autres modèles, ce qui rend leur comportement plus difficile à interpréter. L’observabilité des LLM offre une visibilité continue sur ces flux de travail complexes, aidant les organisations…

LLM
Comparaison des Fonctionnalités
2 sep

Cloud LLM vs local LLMs: exemples & avantages

Les LLMs cloud, alimentés par des modèles avancés comme GPT-5.5 et Claude Opus 4.7, offrent évolutivité et accessibilité. Inversement, les LLMs locaux, pilotés par des modèles open source tels que Llama 4, DeepSeek V4 et Qwen3.6-Plus, garantissent une confidentialité et une personnalisation renforcées. Découvrez ce que sont les LLMs cloud, leurs forces et faiblesses, les…

LLM
Analyse
1 sep

LLM Guide de fine-tuning pour les entreprises

Suivez les liens pour les solutions spécifiques aux défis de sortie de votre LLM. Si votre LLM : L’adoption généralisée des grands modèles de langage (LLM) a amélioré notre capacité à traiter le langage humain. Cependant, leur entraînement générique donne souvent des performances sous-optimales pour des tâches spécifiques. Pour surmonter cette limitation, des méthodes de…

LLM
Analyse
1 sep

10+ exemples de grands modèles de langage

Nous avons rassemblé des benchmarks open source pour comparer les principaux grands modèles de langage propriétaires et open source. Choisissez votre cas d’usage pour trouver le modèle adapté. Vous pouvez évaluer les grands modèles de langage en examinant leurs performances sur les benchmarks et leur latence réelle (disponible en cliquant sur le nom de chaque…

LLM
Comparaison des Fonctionnalités
27 août

LLM Tarification: Top 15+ fournisseurs comparés

La tarification des LLM s’étend sur quatre ordres de grandeur : les modèles les moins chers ont été lancés à moins de 0.03 $ par million de tokens, tandis que les niveaux de raisonnement de pointe ont été lancés jusqu’à 262.50 $. Le graphique ci-dessous suit les prix de lancement : chaque point représente le…

LLM
Analyse
27 août

LLM Automatisation: Top 7 outils & 8 études de cas 

L'automatisation LLM désigne le passage à des outils d'automatisation intelligents qui exploitent les LLMs, notamment des agents IA, des LLMs affinés et des RAG models pour automatiser et coordonner des tâches. Explorez ce qu'est l'automatisation LLM, ses principales applications concrètes et ses principaux outils : Large language models dans l'automatisation constituent une approche systématique qui…

LLM
Évaluation en Monde Ouvert
26 août

LLM Orchestration: 22 frameworks et passerelles

Optimiser l'orchestration LLM est essentiel pour améliorer les performances tout en maîtrisant l'utilisation des ressources. Pour évaluer la performance des différentes approches d'orchestration en pratique, nous avons évalué : Découvrez une sélection d'outils d'orchestration LLM, notamment les frameworks pour développeurs et les passerelles d'entreprise : L'orchestration LLM consiste à gérer et à intégrer plusieurs grands…