Le modèle le plus récent de l'indice d'intelligence AIMultiple est Claude Opus 5.5.
Benchmarks LLM
Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple. Comment l'indice est construit
Classement
Les modèles les mieux notés sur tous les benchmarks.
# | Modèle | Index | AIM-Agentic-RAG | AIM-AI-Bias | AIM-FinanceReasoning | AIM-Text-to-SQL | ARC-AGI-3 | CritPt | FrontierMath | IFBench | MMMU-Pro | SciCode | Terminal-Bench 2.1 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 Anthropic | 79 | 90 | 94 | 92 | 88 | - | 32 | - | - | 88 | 67 | - |
| 2 | GPT-6 Astra OpenAI | 76 | 84 | 98 | 87 | 66 | 63 | 32 | 98 | - | 87 | 56 | 90 |
| 3 | Claude Fable 5.1 Anthropic | 73 | 84 | - | 90 | 67 | - | 31 | 88 | - | - | 63 | 91 |
| 4 | Qwen3.8 Flash Alibaba Cloud | 71 | - | - | - | - | - | - | - | 81 | - | 47 | 86 |
| 5 | Qwen3.8 Max Alibaba Cloud | 70 | 83 | 93 | - | 51 | - | - | 46 | - | 82 | 53 | 81 |
| 6 | Claude Opus 5 Anthropic | 68 | 85 | 81 | 90 | 64 | 30 | 29 | 73 | - | 85 | 56 | 89 |
| 7 | Muse Spark 1.1 Meta | 68 | - | - | - | - | - | - | - | - | - | 58 | 78 |
| 8 | GPT-5.6 Sol OpenAI | 67 | 77 | 89 | 90 | 54 | 8 | 32 | 83 | 73 | 83 | 57 | 90 |
| 9 | Kimi K3 Moonshot AI | 66 | 83 | 89 | 88 | 48 | - | 23 | 39 | - | 81 | 59 | 85 |
| 10 | Claude Sonnet 5 Anthropic | 65 | 73 | 91 | 87 | 38 | - | - | 29 | - | - | 54 | 80 |
Comment l'indice est construit
L'indice est la moyenne des scores d'un modèle sur les benchmarks listés ci-dessous, parmi ceux qu'il a réellement passés : un benchmark qu'il n'a jamais passé ne compte pas comme un zéro, il est simplement absent. Tous les benchmarks de l'indice comptent de manière égale. Un benchmark qui donne déjà un pourcentage de 0 à 100 est utilisé tel quel ; un benchmark sur une autre échelle est d'abord ramené sur 0-100. Un modèle doit avoir des résultats sur au moins deux benchmarks de l'indice pour être classé : un résultat unique ne lui donne pas un classement propre. Comme les scores sont utilisés tels quels, un benchmark que tout le champ trouve difficile tire vers le bas chaque score obtenu dessus, et un modèle mesuré sur des benchmarks plus difficiles le reporte dans sa moyenne.
Benchmarks utilisés
Mises à jour récentes
Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.
Claude Opus 5.5
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
GPT-6 Sol
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
GPT-6 Luna
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
Grok 4.7
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
Explorez Cas d'utilisation, analyses et points de référence du LLM
Meilleurs outils LLMOps et comparaison avec les MLOPs
Les plateformes LLMOps gèrent le côté opérationnel de l’exécution des modèles de langage de grande taille : déploiement, surveillance, évaluation et gestion des coûts. Nous avons examiné les meilleurs outils LLMOps, leurs fonctionnalités principales, leurs modèles de tarification et leurs différences afin d’identifier la solution la mieux adaptée à différents cas d’usage. Une description de…
50+ Cas d'utilisation de ChatGPT avec des exemples concrets
ChatGPT a atteint environ 1 milliard d’utilisateurs actifs hebdomadaires début 2026, soit environ 10 % de la population mondiale.1 OpenAI a dépassé 20 milliards de dollars de revenus annuels pour 2025, confirmé par la directrice financière Sarah Friar.2 L’Anthropic Economic Index distingue deux modes d’utilisation : l’augmentation, où un humain interagit avec l’IA, et l’automatisation, où…
ChatGPT pour le service client: les 10 meilleurs cas d'utilisation
ChatGPT est passé du statut de nouveauté à celui d'infrastructure du service client. Les entreprises l'utilisent pour réduire les temps de réponse, absorber des volumes que leurs équipes ne peuvent pas gérer et diminuer le coût des interactions courantes. Mais les résultats varient fortement selon sa mise en œuvre. OpenAI a lancé GPT-5.6, un modèle…
Densité d'intelligence des 71 LLMs pour des modèles plus intelligents et plus denses
Nous avons suivi 71 LLMs publiés entre février 2023 et mai 2026 et avons collecté 10 benchmarks publics pour mesurer la densité d'intelligence. Nous avons divisé le score de capacité par la ressource que le modèle consomme (paramètres actifs, coût de calcul d'entraînement et prix d'inférence). Pour calculer la densité d'intelligence, nous avons exécuté les…
LLM Benchmark de latence par cas d'usage
Nous avons benchmarké 11 des meilleurs grands modèles de langage avec un total de 1 320 requêtes, en séparant les modèles de raisonnement et de non-raisonnement, et mesuré la latence du premier token, la latence par token et le temps de réponse global. Vous trouverez des détails sur la façon dont nous avons mesuré la…
LLM Quantification: BF16 vs FP8 vs INT4
Nous avons effectué des benchmarks de Qwen3-32B à 4 niveaux de précision (BF16, FP8, GPTQ-Int8, GPTQ-Int4) sur un seul NVIDIA H100 80GB GPU. Chaque configuration a été évaluée sur 2 benchmarks (~12,2K questions) couvrant les connaissances et la génération de code, ainsi que sur plus de 2 000 exécutions d'inférence pour mesurer le débit. Int4…