Le modèle le plus récent de l'indice d'intelligence AIMultiple est Gemini 3.8 Flash.
Benchmarks LLM
Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple. Voir la méthodologie.
Classement
Les modèles les mieux notés sur tous les benchmarks.
# | Modèle | Index | Agentic RAG | ARC-AGI-1 | ARC-AGI-2 | ArxivMath | CritPt | FinanceReasoning | FrontierMath | LegalBench | MMMU-Pro | Terminal-Bench 2.1 | Terminal-Bench Hard | Text-to-SQL |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 Anthropic | 86 | - | 98 | 90 | 91 | 29 | 90 | 73 | 87 | 85 | 89 | - | - |
| 2 | GPT-5.6 Sol OpenAI | 81 | 87 | 98 | 93 | - | 32 | 90 | 83 | 87 | 83 | 89 | - | 74 |
| 3 | Claude Fable 5 Anthropic | 79 | 98 | 99 | 89 | 79 | 29 | 90 | 88 | 89 | 81 | 85 | 63 | 90 |
| 4 | GPT-5.6 Terra OpenAI | 66 | 91 | 97 | 84 | - | 30 | 87 | 71 | 85 | 81 | 87 | - | 71 |
| 5 | Claude Opus 4.8 Anthropic | 66 | 100 | 93 | 72 | 71 | - | 89 | 56 | 84 | 79 | 85 | 58 | 77 |
| 6 | Claude Fable 5.1 Anthropic | 66 | - | 98 | 90 | - | 31 | - | 88 | 89 | - | 91 | - | - |
| 7 | Gemini 3.7 Flash Google | 62 | - | 96 | 85 | - | 14 | - | 37 | 87 | 86 | 86 | - | - |
| 8 | GPT-5.5 Pro OpenAI | 62 | - | 97 | 85 | - | 31 | - | 78 | - | - | - | - | - |
| 9 | Kimi K3 Moonshot AI | 61 | 93 | 95 | 60 | - | 23 | 88 | 39 | 86 | 82 | 85 | - | 77 |
| 10 | GPT-5.6 Sol Pro OpenAI | 60 | 96 | - | - | - | - | 91 | 81 | - | - | - | - | 79 |
Comment l'indice est construit
Chaque benchmark devient une position sur une échelle de 0 à 100, et l'indice est la moyenne pondérée de ces positions. Un benchmark sur lequel un modèle n'a pas été évalué compte comme la moyenne du champ, afin que les scores restent comparables. Indice = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).
Mises à jour récentes
Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.
Gemini 3.8 Flash
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
Claude Fable 5.1
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
Hy4 preview
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
GLM 5.3 Flash
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
Principales sorties de modèles d'IA des fournisseurs leaders au cours des 21 derniers jours.
Explorez Cas d'utilisation, analyses et points de référence du LLM
LLM Orchestration: 22 frameworks et passerelles
Optimiser l'orchestration LLM est essentiel pour améliorer les performances tout en maîtrisant l'utilisation des ressources. Pour évaluer la performance des différentes approches d'orchestration en pratique, nous avons évalué : Découvrez une sélection d'outils d'orchestration LLM, notamment les frameworks pour développeurs et les passerelles d'entreprise : L'orchestration LLM consiste à gérer et à intégrer plusieurs grands…
AIM Enterprise: Benchmark d'entreprise agentique
Les entreprises utilisent des LLMs tous les jours pour leurs tâches courantes. Pour trouver les LLMs les plus rentables, nous avons conçu AIM Enterprise, un benchmark d'entreprise agentique, dans lequel nous avons utilisé 69 tâches d'entreprise réelles couvrant la stratégie, le marketing, les RH, les ventes et les opérations. Deux modèles de juge ont noté…
Text-to-SQL: Comparaison de la précision des LLM
Nous avons exécuté 36 large language models sur 759 questions de BIRD-SQL, chaque model écrivant SQL contre une base de données qu’il devait identifier lui-même parmi 11 candidates. Toute requête analysable a été exécutée sur la base de données réelle et son ensemble de résultats comparé à l’ensemble de résultats de la requête de référence…
LLM Paramètres: GPT-5 High, Moyen, Bas et Minimal
Certains LLMs, comme OpenAI’s GPT-5 family, existent en différentes versions (par exemple, GPT-5, GPT-5-mini et GPT-5-nano) et avec divers réglages de paramètres, notamment élevé, moyen, bas et minimal. Ci-dessous, nous explorons les différences entre ces versions de modèles en rassemblant leurs performances de benchmark et les coûts d’exécution de ces benchmarks. Nous avons utilisé la…
HALC-Bench: LLM Hallucination sur un benchmark de récupération en contexte long
HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark) mesure la résistance d'un LLM à fabriquer des preuves pour une métrique qui n'existe pas dans le document cible en utilisant 3 bottes de foin placées au début, au milieu et à la fin de la fenêtre de contexte du modèle, avec 204 questions. claude-fable-5 a répondu correctement…
Meilleurs outils LLMOps et comparaison avec les MLOPs
Les plateformes LLMOps gèrent le côté opérationnel de l’exécution des modèles de langage de grande taille : déploiement, surveillance, évaluation et gestion des coûts. Nous avons examiné les meilleurs outils LLMOps, leurs fonctionnalités principales, leurs modèles de tarification et leurs différences afin d’identifier la solution la mieux adaptée à différents cas d’usage. Une description de…
50+ Cas d'utilisation de ChatGPT avec des exemples concrets
ChatGPT a atteint environ 1 milliard d’utilisateurs actifs hebdomadaires début 2026, soit environ 10 % de la population mondiale.1 OpenAI a dépassé 20 milliards de dollars de revenus annuels pour 2025, confirmé par la directrice financière Sarah Friar.2 L’Anthropic Economic Index distingue deux modes d’utilisation : l’augmentation, où un humain interagit avec l’IA, et l’automatisation, où…
ChatGPT pour le service client: les 10 meilleurs cas d'utilisation
ChatGPT est passé du statut de nouveauté à celui d'infrastructure du service client. Les entreprises l'utilisent pour réduire les temps de réponse, absorber des volumes que leurs équipes ne peuvent pas gérer et diminuer le coût des interactions courantes. Mais les résultats varient fortement selon sa mise en œuvre. OpenAI a lancé GPT-5.6, un modèle…
L'avenir des grands modèles de langage
Découvrez l'avenir des grands modèles de langage en explorant des approches prometteuses, telles que l'auto-apprentissage, la vérification des faits et l'expertise parcimonieuse, qui pourraient remédier aux limites des LLM. Comparaison des taux de réussite des LLM Claude Sonnet 4.6 a dominé le benchmark avec un score global de 0.748, les variantes de base et de…
Densité d'intelligence des 71 LLMs pour des modèles plus intelligents et plus denses
Nous avons suivi 71 LLMs publiés entre février 2023 et mai 2026 et avons collecté 10 benchmarks publics pour mesurer la densité d'intelligence. Nous avons divisé le score de capacité par la ressource que le modèle consomme (paramètres actifs, coût de calcul d'entraînement et prix d'inférence). Pour calculer la densité d'intelligence, nous avons exécuté les…