Le modèle le plus récent de l'indice d'intelligence AIMultiple est Claude Opus 5.5.
Benchmarks LLM
Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple. Comment l'indice est construit
Classement
Les modèles les mieux notés sur tous les benchmarks.
# | Modèle | Index | AIM-Agentic-RAG | AIM-FinanceReasoning | AIM-Text-to-SQL | ARC-AGI-3 | CritPt | FrontierMath | IFBench | MMMU-Pro | SciCode | Terminal-Bench 2.1 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 Anthropic | 76 | 90 | 92 | 88 | - | 32 | - | - | 88 | 67 | - |
| 2 | GPT-6 Astra OpenAI | 74 | 84 | 87 | 66 | 63 | 32 | 98 | - | 87 | 56 | 90 |
| 3 | Claude Fable 5.1 Anthropic | 73 | 84 | 90 | 67 | - | 31 | 88 | - | - | 63 | 91 |
| 4 | Qwen3.8 Flash Alibaba Cloud | 71 | - | - | - | - | - | - | 81 | - | 47 | 86 |
| 5 | Muse Spark 1.1 Meta | 68 | - | - | - | - | - | - | - | - | 58 | 78 |
| 6 | Claude Opus 5 Anthropic | 67 | 85 | 90 | 64 | 30 | 29 | 73 | - | 85 | 56 | 89 |
| 7 | Qwen3.8 Max Alibaba Cloud | 66 | 83 | - | 51 | - | - | 46 | - | 82 | 53 | 81 |
| 8 | GPT-5.6 Sol OpenAI | 65 | 77 | 90 | 54 | 8 | 32 | 83 | 73 | 83 | 57 | 90 |
| 9 | Kimi K3 Moonshot AI | 63 | 83 | 88 | 48 | - | 23 | 39 | - | 81 | 59 | 85 |
| 10 | Gemini 3.7 Flash Google | 63 | 85 | - | 72 | - | 14 | 37 | - | 86 | 60 | 86 |
Comment l'indice est construit
L'indice est la moyenne des scores d'un modèle sur les benchmarks listés ci-dessous, parmi ceux qu'il a réellement passés : un benchmark qu'il n'a jamais passé ne compte pas comme un zéro, il est simplement absent. Tous les benchmarks de l'indice comptent de manière égale. Un benchmark qui donne déjà un pourcentage de 0 à 100 est utilisé tel quel ; un benchmark sur une autre échelle est d'abord ramené sur 0-100. Un modèle doit avoir des résultats sur au moins deux benchmarks de l'indice pour être classé : un résultat unique ne lui donne pas un classement propre. Comme les scores sont utilisés tels quels, un benchmark que tout le champ trouve difficile tire vers le bas chaque score obtenu dessus, et un modèle mesuré sur des benchmarks plus difficiles le reporte dans sa moyenne.
Benchmarks utilisés
Mises à jour récentes
Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.
Claude Opus 5.5
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
GPT-6 Sol
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
GPT-6 Luna
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
Grok 4.7
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
Explorez Cas d'utilisation, analyses et points de référence du LLM
LLM Part de marché: comparer l'utilisation et l'adoption
Nous avons analysé la part de marché des LLM en combinant des données fondées sur l'utilisation et des estimations de visites web pour montrer comment la demande de grands modèles de langage est répartie entre les laboratoires d'IA et les applications d'IA. Lisez la méthodologie pour voir comment nous avons mesuré et calculé ces résultats.…
Benchmark de 40+ LLMs en finance: Claude Fable 5 & GPT-5.6 Sol
Nous avons évalué des LLMs sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1 Ce sous-ensemble cible les tâches de raisonnement financier les plus difficiles, évaluant un raisonnement quantitatif complexe en plusieurs étapes impliquant des concepts et des formules financières. Notre évaluation a utilisé une conception de prompt personnalisée et des critères de notation…
Comparer les modèles d'IA multimodaux sur le raisonnement visuel
Nous avons évalué 15 modèles d'IA multimodaux leaders sur le raisonnement visuel en utilisant 200 questions basées sur l'image. L'évaluation comprenait deux pistes : 100 questions de compréhension de graphiques testant l'interprétation de visualisations de données, et 100 questions de logique visuelle évaluant la reconnaissance de motifs et le raisonnement spatial. Chaque question a été…
Grands modèles multimodaux (LMM) vs LLMs
Nous avons évalué les performances des grands modèles multimodaux (LMM) dans des tâches de raisonnement financier en utilisant un jeu de données soigneusement sélectionné. En analysant un sous-ensemble d’échantillons financiers de haute qualité, nous évaluons les capacités des modèles à traiter et à raisonner avec des données multimodales dans le domaine financier. La section méthodologie…
LLM Calculateur de VRAM pour l'auto-hébergement
Auto-héberger un LLM signifie exécuter l'inférence sur du matériel contrôlé par l'opérateur plutôt que via une API tierce, ce qui modifie le coût, le contrôle des données et le profil de confidentialité. Qu'un modèle puisse s'exécuter dépend de la mémoire. Le calculateur estime la VRAM ou la mémoire unifiée dont un modèle a besoin pour…
IT agentique: les agents IA peuvent-ils concevoir un benchmark ?
Nous avons testé 16 modèles sur une conception de benchmark en text-to-SQL et en appel d'outils. Chaque modèle a construit un benchmark par sujet, pour un total de 32 soumissions. Aucune soumission n'a réussi tous les critères de la grille d'évaluation. Les agents ont pu construire et exécuter des tests, mais aucun n'a démontré à…
AIM Enterprise: Benchmark d'entreprise agentique
Les entreprises utilisent des LLM tous les jours pour leurs tâches courantes. Pour trouver les LLM les plus rentables, nous avons conçu AIM Enterprise, un benchmark d'entreprise agentique, dans lequel nous avons utilisé 69 tâches d'entreprise réelles couvrant la stratégie, le marketing, les RH, la vente et les opérations. Deux models juges ont noté chaque…
L'avenir des grands modèles linguistiques
Découvrez l’avenir des grands modèles linguistiques en explorant des approches prometteuses, comme l’auto-entraînement, la vérification des faits et l’expertise parcimonieuse, qui pourraient remédier aux limites des LLM. Comparaison du taux de réussite des LLM Claude Sonnet 4.6 a dominé le benchmark avec un score global de 0.748, les variantes de base et de réflexion étant…
Large Language Models en cybersécurité
Nous avons évalué 7 large language models dans 9 domaines de cybersécurité à l’aide de SecBench, un benchmark à grande échelle et multi-format pour les tâches de sécurité. Nous avons testé chaque model sur 44 823 questions à choix multiples (MCQs) et 3 087 questions à réponse courte (SAQs), couvrant la sécurité des données, la gestion des…
LLM Lois d'échelle: analyse de chercheurs en IA
Les grands models de langage prédisent le token suivant en se basant sur des motifs appris à partir de données textuelles. Le terme lois d’échelle des LLM désigne des régularités empiriques qui relient les performances du model à la quantité de calcul, aux données d’entraînement et aux paramètres du model utilisés pendant l’entraînement. Pour comprendre…