Le modèle le plus récent de l'indice d'intelligence AIMultiple est Gemini 3.8 Flash.
Benchmarks LLM
Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple. Voir la méthodologie.
Classement
Les modèles les mieux notés sur tous les benchmarks.
# | Modèle | Index | Agentic RAG | ARC-AGI-1 | ARC-AGI-2 | ArxivMath | CritPt | FinanceReasoning | FrontierMath | LegalBench | MMMU-Pro | Terminal-Bench 2.1 | Terminal-Bench Hard | Text-to-SQL |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 Anthropic | 86 | - | 98 | 90 | 91 | 29 | 90 | 73 | 87 | 85 | 89 | - | - |
| 2 | GPT-5.6 Sol OpenAI | 81 | 87 | 98 | 93 | - | 32 | 90 | 83 | 87 | 83 | 89 | - | 74 |
| 3 | Claude Fable 5 Anthropic | 79 | 98 | 99 | 89 | 79 | 29 | 90 | 88 | 89 | 81 | 85 | 63 | 90 |
| 4 | GPT-5.6 Terra OpenAI | 66 | 91 | 97 | 84 | - | 30 | 87 | 71 | 85 | 81 | 87 | - | 71 |
| 5 | Claude Opus 4.8 Anthropic | 66 | 100 | 93 | 72 | 71 | - | 89 | 56 | 84 | 79 | 85 | 58 | 77 |
| 6 | Claude Fable 5.1 Anthropic | 66 | - | 98 | 90 | - | 31 | - | 88 | 89 | - | 91 | - | - |
| 7 | Gemini 3.7 Flash Google | 62 | - | 96 | 85 | - | 14 | - | 37 | 87 | 86 | 86 | - | - |
| 8 | GPT-5.5 Pro OpenAI | 62 | - | 97 | 85 | - | 31 | - | 78 | - | - | - | - | - |
| 9 | Kimi K3 Moonshot AI | 61 | 93 | 95 | 60 | - | 23 | 88 | 39 | 86 | 82 | 85 | - | 77 |
| 10 | GPT-5.6 Sol Pro OpenAI | 60 | 96 | - | - | - | - | 91 | 81 | - | - | - | - | 79 |
Comment l'indice est construit
Chaque benchmark devient une position sur une échelle de 0 à 100, et l'indice est la moyenne pondérée de ces positions. Un benchmark sur lequel un modèle n'a pas été évalué compte comme la moyenne du champ, afin que les scores restent comparables. Indice = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).
Mises à jour récentes
Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.
Gemini 3.8 Flash
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
Claude Fable 5.1
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
Hy4 preview
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
GLM 5.3 Flash
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
Principales sorties de modèles d'IA des fournisseurs leaders au cours des 21 derniers jours.
Explorez Cas d'utilisation, analyses et points de référence du LLM
LLM Benchmark de latence par cas d'usage
Nous avons benchmarké 11 des meilleurs grands modèles de langage avec un total de 1 320 requêtes, en séparant les modèles de raisonnement et de non-raisonnement, et mesuré la latence du premier token, la latence par token et le temps de réponse global. Vous trouverez des détails sur la façon dont nous avons mesuré la…
Agentic IT: Can LLMs Design a Benchmark
We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…
Comparer les modèles d'IA multimodaux sur le raisonnement visuel
Nous avons évalué 15 modèles d'IA multimodaux leaders sur le raisonnement visuel en utilisant 200 questions basées sur l'image. L'évaluation comprenait deux pistes : 100 questions de compréhension de graphiques testant l'interprétation de visualisations de données, et 100 questions de logique visuelle évaluant la reconnaissance de motifs et le raisonnement spatial. Chaque question a été…
Passerelles IA pour OpenAI: Alternatives à OpenRouter
Nous avons benchmarké OpenRouter, SambaNova, TogetherAI, Groq et IA/ML API sur trois indicateurs (latence du premier token, latence totale et nombre de tokens de sortie), avec 300 tests utilisant des prompts courts (environ 18 tokens) et des prompts longs (environ 203 tokens) pour la latence totale. Si vous prévoyez d'utiliser l'une de ces passerelles IA,…
Grands modèles de langage en cybersécurité
Nous avons évalué 7 grands modèles de langage dans 9 domaines de la cybersécurité en utilisant SecBench, un benchmark à grande échelle et multi-format pour les tâches de sécurité. Nous avons testé chaque modèle sur 44 823 questions à choix multiples (QCM) et 3 087 questions à réponse courte (QRC), couvrant des domaines tels que…
LLM Quantification: BF16 vs FP8 vs INT4
Nous avons effectué des benchmarks de Qwen3-32B à 4 niveaux de précision (BF16, FP8, GPTQ-Int8, GPTQ-Int4) sur un seul NVIDIA H100 80GB GPU. Chaque configuration a été évaluée sur 2 benchmarks (~12,2K questions) couvrant les connaissances et la génération de code, ainsi que sur plus de 2 000 exécutions d'inférence pour mesurer le débit. Int4…