Benchmarks LLM
Un indice d'intelligence unique et transparent combinant des benchmarks publics avec les propres évaluations agentiques, RAG et de raisonnement d'entreprise d'AIMultiple.
Classement
Les modèles les mieux notés sur tous les benchmarks.
# | Modèle | Index | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Page 1 sur 7 | ||||||||||
Graphiques
Modèles suivant "Meilleures performances"
Comment l'indice est construit
L'indice d'intelligence normalise chaque benchmark sur une échelle de 0 à 100 et fait la moyenne de la position relative d'un modèle sur les benchmarks pour lesquels il a été évalué. Chaque benchmark ci-dessous alimente ce score.
Mises à jour récentes
Derniers changements de l'indice d'intelligence, de la couverture des modèles et de la méthodologie de benchmarks d'AIMultiple.
Kimi K3
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
GPT-5.6 Sol
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
GPT-5.6 Terra
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
GPT-5.6 Sol Pro
Nouveau modèle ajouté à l'indice d'intelligence AIMultiple.
Explorez Cas d'utilisation, analyses et points de référence du LLM
Tarification LLM: Top 15+ fournisseurs comparés
Les prix des API changent à chaque génération de modèle. Le graphique ci-dessous place chaque modèle à sa date de lancement, indique son prix de lancement par million de tokens, utilise un ratio mixte de 3:1 entre entrée et sortie, et classe les modèles en huit catégories de taille. Les prix sont les tarifs API…
De texte à SQL: Comparaison de la précision des LLM
J'utilise SQL pour l'analyse de données depuis 18 ans, depuis mes débuts en tant que consultant. Traduire des questions en langage naturel en SQL rend les données plus accessibles, permettant à quiconque, même sans compétences techniques, de travailler directement avec les bases de données. Nous avons utilisé notre méthodologie de benchmark de texte vers SQL…
LLM Guide de fine-tuning pour les entreprises
Suivez les liens pour les solutions spécifiques aux défis de sortie de votre LLM. Si votre LLM : L’adoption généralisée des grands modèles de langage (LLM) a amélioré notre capacité à traiter le langage humain. Cependant, leur entraînement générique donne souvent des performances sous-optimales pour des tâches spécifiques. Pour surmonter cette limitation, des méthodes de…
LLM Outils d'observabilité: Weights & Biases, Langsmith
LLM applications se sont étendues des conversations en aller-simple aux agents à étapes multiples qui utilisent des outils, interrogent des bases de données, et se coordonnent avec d'autres modèles, rendant leur comportement plus difficile à interpréter. L'observabilité LLM offre une visibilité continue sur ces flux de travail complexes, aidant les organisations à surveiller la qualité,…
LLM Calculateur VRAM pour l'auto-hébergement
Auto-héberger un LLM signifie exécuter l'inférence sur du matériel que l'opérateur contrôle, plutôt que via une API tierce, ce qui modifie le coût, le contrôle des données et le profil de confidentialité. Qu'un modèle puisse fonctionner ou non dépend de la mémoire. Le calculateur estime la VRAM ou la mémoire unifiée dont un modèle a…
Benchmark de 40+ LLMs en finance: Claude Fable 5 & GPT-5.6 Sol
Nous avons évalué 40+ LLMs en finance sur 238 questions difficiles du benchmark FinanceReasoning afin d'identifier les modèles qui excellent dans les tâches de raisonnement financier complexes telles que l'analyse des états financiers, les prévisions et les calculs de ratios. Nous avons évalué les LLMs sur 238 questions difficiles du benchmark FinanceReasoning (Tang et al.).1…
Automatisation LLM: Top 7 des outils & 8 études de cas
L'automatisation LLM désigne le passage à des outils d'automatisation intelligents qui exploitent les LLM, y compris les agents IA, les LLM fine-tunés et les modèles RAG pour automatiser et coordonner les tâches. Découvrez ce qu'est l'automatisation LLM, ses principales applications concrètes et les outils majeurs : Les grands modèles de langage en automatisation constituent une…
LLM Benchmark de latence par cas d'utilisation
Nous avons benchmarké 11 grands modèles de langage avec un total de 1,320 requêtes, en séparant les modèles de raisonnement des modèles sans raisonnement, et nous avons mesuré la latence du premier token, la latence par token, et le temps de réponse global. Vous pouvez trouver des détails sur la façon dont nous avons mesuré…
HALC-Bench: LLM Hallucination sur le banc d'essai de récupération en contexte long
HALC-Bench (LLM Hallucination sur le banc d'essai de récupération en contexte long) mesure la résistance d'un LLM à fabriquer des preuves pour une métrique qui n'existe pas dans le document cible en utilisant 3 meules de foin placées au début, au milieu et à la fin de la fenêtre de contexte du modèle, avec 204…
Densité d'intelligence de 71 LLMs: modèles plus intelligents et plus denses
Nous avons suivi 71 LLMs publiés entre février 2023 et mai 2026 et collecté 10 benchmarks publics pour mesurer la densité d'intelligence. Nous avons divisé le score de capacité par la ressource que le modèle consomme (paramètres actifs, calcul d'entraînement et prix d'inférence). Pour calculer la densité d'intelligence, nous avons suivi les étapes suivantes :…