Le modèle le plus récent de l'indice d'intelligence AIMultiple est Kimi K3.
Benchmarks LLM
Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple. Voir la méthodologie.
Classement
Les modèles les mieux notés sur tous les benchmarks.
# | Modèle | Index | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Page 1 sur 7 | ||||||||||
Comment l'indice est construit
L'indice d'intelligence normalise chaque benchmark sur une échelle de 0 à 100 et fait la moyenne de la position relative d'un modèle sur les benchmarks pour lesquels il a été évalué. Chaque benchmark ci-dessous alimente ce score.
Mises à jour récentes
Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.
Kimi K3
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
GPT-5.6 Sol
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
GPT-5.6 Terra
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
GPT-5.6 Sol Pro
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
Principales sorties de modèles d'IA des fournisseurs leaders au cours des 41 derniers jours.
Explorez Cas d'utilisation, analyses et points de référence du LLM
LLM Part de marché: Comparer l'utilisation et l'adoption
Nous avons analysé la part de marché des LLM en combinant des données basées sur l'utilisation et des estimations de visites web pour montrer comment la demande pour les grands modèles de langage est répartie entre les laboratoires d'IA et les applications d'IA : Consultez la méthodologie pour voir comment nous avons mesuré et calculé…
LLM Paramètres: GPT-5 High, Moyen, Bas et Minimal
Certains LLMs, comme OpenAI’s GPT-5 family, existent en différentes versions (par exemple, GPT-5, GPT-5-mini et GPT-5-nano) et avec divers réglages de paramètres, notamment élevé, moyen, bas et minimal. Ci-dessous, nous explorons les différences entre ces versions de modèles en rassemblant leurs performances de benchmark et les coûts d’exécution de ces benchmarks. Nous avons utilisé la…
10+ exemples de grands modèles de langage
Nous avons rassemblé des benchmarks open source pour comparer les principaux grands modèles de langage propriétaires et open source. Choisissez votre cas d’usage pour trouver le modèle adapté. Vous pouvez évaluer les grands modèles de langage en examinant leurs performances sur les benchmarks et leur latence réelle (disponible en cliquant sur le nom de chaque…
Cloud LLM vs local LLMs: exemples & avantages
Les LLMs cloud, alimentés par des modèles avancés comme GPT-5.5 et Claude Opus 4.7, offrent évolutivité et accessibilité. Inversement, les LLMs locaux, pilotés par des modèles open source tels que Llama 4, DeepSeek V4 et Qwen3.6-Plus, garantissent une confidentialité et une personnalisation renforcées. Découvrez ce que sont les LLMs cloud, leurs forces et faiblesses, les…
Grands modèles de langage en cybersécurité
Nous avons évalué 7 grands modèles de langage dans 9 domaines de la cybersécurité en utilisant SecBench, un benchmark à grande échelle et multi-format pour les tâches de sécurité. Nous avons testé chaque modèle sur 44 823 questions à choix multiples (QCM) et 3 087 questions à réponse courte (QRC), couvrant des domaines tels que…
LLM Quantification: BF16 vs FP8 vs INT4
Nous avons effectué des benchmarks de Qwen3-32B à 4 niveaux de précision (BF16, FP8, GPTQ-Int8, GPTQ-Int4) sur un seul NVIDIA H100 80GB GPU. Chaque configuration a été évaluée sur 2 benchmarks (~12,2K questions) couvrant les connaissances et la génération de code, ainsi que sur plus de 2 000 exécutions d'inférence pour mesurer le débit. Int4…