Benchmarks LLM
Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple.
Classement
Les modèles les mieux notés sur tous les benchmarks.
# | Modèle | Index | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Page 1 sur 7 | ||||||||||
Graphiques
Modèles suivant "Meilleures performances"
Comment l'indice est construit
L'indice d'intelligence normalise chaque benchmark sur une échelle de 0 à 100 et fait la moyenne de la position relative d'un modèle sur les benchmarks pour lesquels il a été évalué. Chaque benchmark ci-dessous alimente ce score.
Mises à jour récentes
Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.
Kimi K3
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
GPT-5.6 Sol
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
GPT-5.6 Terra
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
GPT-5.6 Sol Pro
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
Explorez Cas d'utilisation, analyses et points de référence du LLM
Comparer les modèles d'IA multimodaux sur le raisonnement visuel
Nous avons évalué 15 modèles d’IA multimodaux de pointe sur le raisonnement visuel à l’aide de 200 questions visuelles. L’évaluation comprenait deux volets : 100 questions de compréhension de graphiques testant l’interprétation de visualisations de données, et 100 questions de logique visuelle évaluant la reconnaissance de motifs et le raisonnement spatial. Chaque question a été…
LLM Part de marché: Comparer l'utilisation et l'adoption
Nous avons analysé la part de marché des LLM en combinant des données basées sur l'utilisation et des estimations de visites web pour montrer comment la demande pour les grands modèles de langage est répartie entre les laboratoires d'IA et les applications d'IA : Consultez la méthodologie pour voir comment nous avons mesuré et calculé…
Meilleurs outils LLMOps & comparaison avec MLOPs
Les plateformes LLMOps gèrent l'aspect opérationnel de l'exécution des grands modèles de langage : déploiement, surveillance, évaluation et gestion des coûts. Nous avons examiné les principaux outils LLMOps, leurs fonctionnalités de base, leurs modèles de tarification et leurs différences afin d'aider à identifier le meilleur choix pour divers cas d'utilisation. Une ventilation de chaque métrique…
Comparer 9 grands modèles de langage dans le secteur de la santé
Nous avons évalué 9 LLMs à l'aide du jeu de données MedQA, un benchmark d'examen clinique de niveau universitaire issu de questions de l'USMLE. Chaque modèle a répondu aux mêmes scénarios cliniques à choix multiples en utilisant un prompt standardisé, permettant une comparaison directe de la précision. Nous avons également mesuré la latence par question…
LLM Paramètres: GPT-5 High, Moyen, Bas et Minimal
Certains LLMs, comme OpenAI’s GPT-5 family, existent en différentes versions (par exemple, GPT-5, GPT-5-mini et GPT-5-nano) et avec divers réglages de paramètres, notamment élevé, moyen, bas et minimal. Ci-dessous, nous explorons les différences entre ces versions de modèles en rassemblant leurs performances de benchmark et les coûts d’exécution de ces benchmarks. Nous avons utilisé la…
LLM Orchestration: Top 22 frameworks et gateways
L'optimisation de l'orchestration LLM est essentielle pour améliorer les performances tout en gardant l'utilisation des ressources sous contrôle. Pour évaluer comment différentes approches d'orchestration se comportent en pratique, nous avons benchmarké : Découvrez une sélection d'outils d'orchestration LLM, incluant des frameworks pour développeurs et des gateways d'entreprise : L'orchestration LLM consiste à gérer et à…
L'avenir des grands modèles de langage
Découvrez l'avenir des grands modèles de langage en explorant des approches prometteuses, telles que l'auto-entraînement, la vérification des faits et l'expertise éparse, qui pourraient remédier aux limites des LLM. Comparaison des taux de succès des LLMs Claude Sonnet 4.6 a dominé le benchmark avec un score global de 0.748, les variantes de base et de…
Grands modèles multimodaux (LMMs) vs LLMs
Nous avons évalué la performance des grands modèles multimodaux (LMMs) dans des tâches de raisonnement financier en utilisant un jeu de données soigneusement sélectionné. En analysant un sous-ensemble d'échantillons financiers de haute qualité, nous évaluons les capacités des modèles à traiter et à raisonner avec des données multimodales dans le domaine financier. La section méthodologie…
10+ exemples de grands modèles de langage
Nous avons rassemblé des benchmarks open source pour comparer les principaux grands modèles de langage propriétaires et open source. Choisissez votre cas d’usage pour trouver le modèle adapté. Vous pouvez évaluer les grands modèles de langage en examinant leurs performances sur les benchmarks et leur latence réelle (disponible en cliquant sur le nom de chaque…
Cloud LLM vs local LLMs: exemples & avantages
Les LLMs cloud, alimentés par des modèles avancés comme GPT-5.5 et Claude Opus 4.7, offrent évolutivité et accessibilité. Inversement, les LLMs locaux, pilotés par des modèles open source tels que Llama 4, DeepSeek V4 et Qwen3.6-Plus, garantissent une confidentialité et une personnalisation renforcées. Découvrez ce que sont les LLMs cloud, leurs forces et faiblesses, les…