Services
Contactez-nous

Densité d'intelligence des 71 LLMs pour des modèles plus intelligents et plus denses

Hazal Şimşek
Hazal Şimşek
mis à jour le 7 juil. 2026

Nous avons suivi 71 LLMs publiés entre février 2023 et mai 2026 et avons collecté 10 benchmarks publics pour mesurer la densité d'intelligence. Nous avons divisé le score de capacité par la ressource que le modèle consomme (paramètres actifs, coût de calcul d'entraînement et prix d'inférence).

Loading Chart

Aperçu de la densité d'intelligence des LLM

Pour calculer la densité d'intelligence, nous avons exécuté les étapes suivantes :

  • Efficacité des ressources : Nous avons divisé la capacité de chaque modèle par deux métriques de ressources :
    • Paramètres actifs : Un proxy pour le coût de mémoire et de service (pour les modèles à poids ouverts).
    • Prix d'inférence : Efficacité-coût du marché basée sur la tarification mixte de l'API par million de tokens.
    • Note sur le coût de calcul d'entraînement (FLOP) : Nous avions initialement inclus un troisième axe, le coût de calcul d'entraînement (FLOP), mais nous l'avons retiré car sa pente négative sur les benchmarks Standard saturés a entraîné l'indice composite 2023–2024 dans un creux contre-intuitif.
  • Regroupement des benchmarks : Pour empêcher la saturation des scores de masquer les gains d'efficacité, nous avons évalué les capacités sur deux ères de benchmarks distinctes :
    • Benchmarks standard (2023–2024) : MMLU (5-shot), GSM8K (8-shot CoT), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
    • Benchmarks avancés (2024–2026) : MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
  • Indexation chaînée : Nous avons calculé la croissance d'une année sur l'autre au sein de groupes de benchmarks correspondants et les avons chaînés de manière multiplicative à partir d'une base 2023 de 100 pour tracer la tendance cumulée.

Voir la méthodologie pour l'approche de notation et les ventilations par ressource.

Résultats de densité d'intelligence des LLM

D'ici la mi-2026, l'écosystème de l'IA a fourni près de 15 fois plus d'intelligence par unité de ressource (paramètres et dollars) que la référence 2023. Deux points à noter en lisant la tendance :

  • Le bond 2024–2025 (+362 %) surestime le gain réel : Les benchmarks avancés étaient nouveaux en 2024 et une poignée de modèles y avaient des scores, de sorte que la référence 2024 est artificiellement basse. L'essentiel de la « poussée » provient du remplissage du panel, et non d'un bond d'efficacité sur un an.
  • Le gain 2025–2026 (+105 %) est là où se trouve la véritable histoire : Il est mesuré sur un nombre beaucoup plus grand de modèles et il est porté par des sorties open-weight de petite taille comme Qwen 3.6-35B-A3B et DeepSeek V4 Flash, qui égalent la capacité des modèles fermés de pointe à une fraction de la taille et du coût.

Capacité des LLM

Le graphique de densité montre l'efficacité. Pour le contextualiser, nous avons également mesuré la capacité brute sur la même période : à quel point ces modèles sont-ils réellement devenus plus intelligents avant tout ajustement des ressources ?

Capacité indexée à 100 en 2023, moyennée sur tous les modèles publiés chaque année.

Les axes et l'info-bulle fonctionnent comme dans le graphique de densité, l'axe Y suivant la performance brute des benchmarks plutôt que la densité.

Un score de capacité de 100 en 2023 est passé à 468 d'ici 2026, soit une amélioration d'environ 4.7×. Année par année :

  • 2024 (+88 %) : Progression rapide sur les benchmarks standard avant leur saturation.
  • 2025 (+105 %) : Même progression rapide, mesurée sur les benchmarks avancés plus difficiles qui ont remplacé les standards.
  • 2026 (+22 %) : Le ralentissement est un signe précoce que les benchmarks avancés commencent aussi à saturer.

Mettre les deux graphiques côte à côte :

  • La capacité a augmenté de 4.7× tandis que la densité d'intelligence a augmenté de 8.9×.
  • Les modèles sont devenus à la fois plus intelligents et plus efficaces. Ils n'ont pas besoin de proportionnellement plus de paramètres, de coût de calcul d'entraînement ou d'argent pour fonctionner.

Notez que : Le chiffre de capacité de 4.7× est une ampleur crédible. Le chiffre de densité de 8.9× est plus fragile (le groupe avancé de 2024 compte moins de points de données, ce qui amplifie le taux de croissance de cette année-là) ; considérez-le donc comme un signal directionnel plutôt que comme un multiplicateur précis.

Quel LLM a la plus haute densité d'intelligence ?

La densité d'intelligence dépend de la ressource mesurée et du groupe de benchmarks sur lequel nous évaluons. Le leader change pour chaque combinaison.

Densité par paramètre actif (open-weight)

Cette vue mesure l'efficacité avec laquelle un modèle concentre la capacité dans ses poids. Les paramètres actifs comptent parce que les modèles Mixture-of-Experts (MoE) acheminent chaque token par une fraction des poids totaux. DeepSeek V3 possède 671B de paramètres totaux mais 37B actifs par token, et le chiffre de 37B reflète le coût de service effectif.

Leaders des benchmarks standard

  • LLaMA 3.1 8B (juil. 2024) : 100.0
  • LLaMA 3 8B (avr. 2024) : 85.0
  • LLaMA 4 Maverick (avr. 2025) : 55.9
  • Mixtral 8x7B (déc. 2023) : 47.4
  • Mistral 7B (sept. 2023) : 46.3

Leaders des benchmarks avancés

  • Qwen 3.6-35B-A3B (avr. 2026) : 100.0 (3B paramètres actifs ; le score repose sur un seul benchmark, SWE-bench Verified à 73.4 %, à interpréter en conséquence)
  • GPT-OSS 20B (août 2025) : 85.2 (3.6B paramètres actifs)
  • GPT-OSS 120B (août 2025) : 64.4 (5.1B paramètres actifs)
  • Qwen 3.5 9B (mars 2026) : 35.2 (9B paramètres denses)
  • DeepSeek V4 Flash (avr. 2026) : 26.0

Le classement des benchmarks standard n'a plus bougé depuis fin 2024 parce que les benchmarks ont saturé, et non parce que les progrès se sont arrêtés. GPT-4 a obtenu 90.2 aux benchmarks standard début 2023 mais 17.3 aux benchmarks avancés.

Densité par FLOP d'entraînement (open-weight)

Cette vue récompense la curation des données, les choix d'architecture et les recettes d'entraînement plutôt que les dépenses brutes.

Note : la densité par FLOP sur les benchmarks standard semble diminuer avec le temps. Il s'agit d'un artefact de saturation, et non d'une baisse de l'efficacité d'entraînement. Les benchmarks plus anciens ne mesurent plus les gains récents, de sorte que les scores de capacité se compriment tandis que le coût de calcul d'entraînement continue de croître.

Leaders des benchmarks standard

  • Mistral 7B (sept. 2023) : 100.0 (toujours le point d'ancrage du panel, plus de deux ans après)
  • LLaMA 3 8B (avr. 2024) : 40.8
  • LLaMA 1 (févr. 2023) : 37.0
  • DeepSeek V2 (mai 2024) : 32.6
  • Mixtral 8x7B (déc. 2023) : 27.1

Leaders des benchmarks avancés

  • Qwen 3.5 9B (mars 2026) : 100.0
  • Qwen 3.6-35B-A3B (avr. 2026) : 28.4
  • DeepSeek V4 Flash (avr. 2026) : 6.4

Le résultat de Qwen 3.5 (9B) est remarquable : un modèle dense de 9B entraîné avec environ 1.5 × 10²³ FLOP qui obtient 81.2 de capacité sur les benchmarks avancés. Son coût de calcul d'entraînement est environ un ordre de grandeur inférieur à DeepSeek V4 Pro, mais l'écart de capacité est plus faible.

Densité par dollar d'inférence

La densité par dollar est l'axe sur lequel les modèles open-weight et les modèles fermés de pointe peuvent être directement comparés, car la tarification de l'API est vérifiable publiquement. Nous utilisons les prix stabilisés pour le chiffre principal afin de refléter les baisses post-lancement.

Leaders des benchmarks standard

  • Mistral Small 3 24B (janv. 2025) : 100.0 à $0,10 / $0,30 par million de tokens via l'API de première partie de Mistral
  • Gemini 1.5 Flash (mai 2024) : 99.3 (modèle à poids fermés au score le plus élevé après sa baisse de prix d'août 2024)
  • DeepSeek V2 (mai 2024) : 66.0 à $0,27 / $1,10 par million de tokens
  • DeepSeek V3 (déc. 2024) : 30.9
  • DeepSeek R1 (janv. 2025) : 17.8

Leaders des benchmarks avancés

  • GPT-OSS 120B (août 2025) : 100.0 (la référence de prix est la médiane inter-fournisseurs d'OpenRouter, car OpenAI n'a pas hébergé le modèle sur une API de première partie)
  • GPT-OSS 20B (août 2025) : 80.0
  • DeepSeek V4 Flash (avr. 2026) : 44.0 à $0,06 / $0,42 par million de tokens via l'API de première partie de DeepSeek
  • DeepSeek V3.2 (déc. 2025) : 22.5
  • Mistral Small 3 24B (janv. 2025) : 20.9
  • DeepSeek V4 Pro (avr. 2026) : 16.0 à $0,54 mixte, avec 97.8 de capacité sur les benchmarks avancés. Cela place V4 Pro à 2.2 points de capacité de Claude Opus 4.7 à environ 1/18 du prix mixte ($0,54 contre $10,00).

L'écart des modèles fermés de pointe ne s'est pas réduit

Les modèles de raisonnement fermés de Anthropic, OpenAI et Google se regroupent entre 0 et 6 sur la densité par dollar des benchmarks avancés tout au long de la période du panel. GPT-4 en mars 2023 a obtenu 0.0. Claude Opus 4.7 en avril 2026 a obtenu 0.9.

Les laboratoires fermés ont réduit leurs prix absolus :

  • Claude Opus est passé de $30 à $10 par million de tokens entre Opus 4 et Opus 4.5.
  • L'o3 d'OpenAI est passé de $10/$40 au lancement à $2/$8 en prix stabilisé.
  • Gemini 1.5 Flash a baissé d'environ 78 %.

Mais l'écart relatif par rapport aux leaders de densité open-weight est resté d'environ 30 à 50× sur la période. DeepSeek a fixé un prix proche de $0,18 par million en 2024 (V2) et proche de $0,18 par million en 2026 (V4 Flash). Le plancher de prix open-weight n'a pas bougé, et le plancher des modèles fermés phares n'a pas suffisamment bougé pour combler l'écart. La concurrence par les prix se déroule sur le segment de la génération précédente, où d'anciens modèles fermés sont maintenus en vie comme alternatives bon marché, et non à la frontière.

La nouvelle direction : les benchmarks agentiques

Les benchmarks avancés utilisés pour mesurer les performances de l'IA commencent à perdre de leur efficacité, comme les suites de tests plus anciennes qu'ils ont remplacées. Les laboratoires ont commencé à publier des benchmarks agentiques (SWE-Bench Pro, SWE-bench Verified, Terminal-Bench, OSWorld-Verified, Finance Agent) au lieu des anciens tests de raisonnement. Nous avons commencé à construire un panel pour suivre ce changement.

Par exemple, le plus récent modèle de pointe, Claude Opus 4.8, publie ses résultats presque entièrement sur ces benchmarks LLM agentique, sans scores sur les benchmarks de raisonnement que suit notre panel principal.

Taux de résolution de SWE-Bench Pro par date de sortie, noté sur le harnais standardisé SEAL de Scale. Parmi les modèles représentés :

  • Les meilleurs modèles à poids fermés : Claude Fable 5 (80.3 %), Claude Opus 4.5 (45.9 %), Claude Sonnet 4.5 (43.6 %) et Gemini 3 Pro Preview (43.3 %).
  • Les meilleurs modèles open-weight : GLM 5.2 (62.1 %), Qwen3-Coder-480B-A35B (38.7 %), Kimi K2 Instruct (27.7 %) et Qwen3-235B-A22B (21.4 %).

Explorez les benchmarks agentiques en consultant les benchmarks de codage agentique, la recherche agentique et la surveillance agentique.

Défis de la comparaison des performances agentiques

Évaluer et comparer les résultats des benchmarks agentiques présente plusieurs difficultés clés :

  • Accent sur les métriques de capacité : Nous pouvons afficher les scores de capacité, car les données de ressources nécessaires pour mesurer la densité (nombre de paramètres, coût de calcul d'entraînement et tarification vérifiée par modèle) restent incomplètes ou non divulguées par les laboratoires fermés.
  • Sensibilité au niveau du système : Les scores des benchmarks mesurent le système entier, et non le modèle d'IA seul. Comme les scores dépendent fortement du « scaffolding » (le framework logiciel environnant), le même modèle peut donner des résultats très différents selon le harnais d'agent utilisé.
  • Protocole de standardisation : Pour garantir une comparaison équitable, ce rapport trace exclusivement les données SWE-Bench Pro provenant d'un environnement unique et standardisé (leaderboard SEAL de Scale). Les autres scores rapportés par les laboratoires utilisent des harnais différents et ne sont pas directement comparables.
  • Exclusion de Claude Opus 4.8 : Bien qu'Opus 4.8 auto-déclare un record de 69.2 % sur SWE-Bench Pro, il a été testé sur le harnais interne d'Anthropic et n'a pas encore été évalué par SEAL de Scale. Pour maintenir une stricte cohérence des données, nous notons son score ici plutôt que de le tracer.

SWE-Bench Pro provient du harnais standardisé SEAL de Scale. Les autres colonnes sont rapportées par les laboratoires sur des harnais variables et ne sont pas directement comparables entre les lignes. Les tirets signifient qu'aucun score vérifié n'a été trouvé.

Ces trois modèles ont été exécutés sur le harnais mini-swe-agent ; ils sont donc exclus du nuage de points pour le maintenir comparable.

Laissez notre équipe automatiser l'un de vos processus métier avec des agents IA, gratuitement.
Automatiser un processus

Méthodologie de la densité d'intelligence

Couverture du panel

  • Modèles : 71 LLMs publiés de février 2023 à avril 2026. 37 modèles ont des scores sur les benchmarks standard et 54 sur les benchmarks avancés. Les modèles sans groupe de benchmarks complet sont exclus des calculs de densité de ce groupe.
  • Benchmarks : 10 benchmarks publics, tous rapportés par les laboratoires et traçables jusqu'à une source primaire. Nous n'avons ré-exécuté aucun benchmark.
  • Ressources : Pour chaque modèle, nous avons divisé son score de capacité par trois ressources indépendamment :
    • Paramètres actifs : Un proxy pour le coût de mémoire et de service. Limité aux modèles open-weight, car les laboratoires à poids fermés (OpenAI, Anthropic, Google) ne divulguent pas le nombre de paramètres.
    • Coût de calcul d'entraînement (FLOP) : Un proxy pour l'efficacité d'entraînement. Également limité aux modèles open-weight. Les chiffres de FLOP sont principalement des estimations d'Epoch IA et doivent être lus comme directionnels.
    • Prix d'inférence : Le prix qu'un acheteur paie réellement à l'API. La capacité est divisée par le prix mixte par million de tokens à un ratio entrée-sortie de 3:1. Les modèles ouverts comme fermés participent, car la tarification de l'API est publiquement vérifiable.

Pourquoi deux groupes de benchmarks ?

Les modèles publiés en 2024 ont saturé les benchmarks standard que les laboratoires d'IA utilisaient depuis 2020. Une fois que les modèles de pointe atteignent 90 % ou plus sur un benchmark, le test ne distingue plus les modèles forts des modèles plus forts. Les laboratoires ont réagi en introduisant des benchmarks plus difficiles.

Nous traitons ce changement comme une rupture nette pour deux raisons :

  • Premièrement, mélanger des benchmarks faciles et difficiles dans un seul score de capacité permettrait à un score saturé sur un benchmark facile de masquer un score faible sur un benchmark difficile. Un modèle qui obtient 85 à MMLU-Pro est plus fort qu'un modèle qui obtient 85 à MMLU. Traiter les deux comme équivalents comprime la plage des scores et récompense les benchmarks plus anciens.
  • Deuxièmement, les deux suites ont des distributions de scores différentes : les benchmarks standard se regroupent en haut (la plupart des modèles de pointe au-dessus de 85), tandis que les benchmarks avancés ont une dispersion plus large (modèles de tête autour de 90, niveau intermédiaire autour de 50, modèles plus faibles en dessous de 30). Un z-score calculé sur les deux à la fois fausserait l'estimation de la variance.

Nous calculons la capacité pour chaque groupe indépendamment :

  • Benchmarks standard (2023–2024) : MMLU (5-shot), GSM8K (8-shot chaîne de raisonnement), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
  • Benchmarks avancés (2024–2026) : MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.

Un score de 90 aux benchmarks standard n'est pas équivalent à 90 aux benchmarks avancés. Pour tout modèle publié à partir de fin 2024, les benchmarks avancés sont la référence pertinente.

Formule de capacité

Pour chaque benchmark b et chaque modèle m :

Nous utilisons l'écart-type de population (divise par N, et non par N−1). Cela correspond au calcul pandas d'origine avec ddof=0 et garantit que l'ajout d'un nouveau modèle ne modifie pas rétroactivement l'estimation de la variance.

Nous moyennons ensuite les z-scores disponibles par modèle au sein de chaque groupe de benchmarks et nous appliquons une remise à l'échelle min-max pour obtenir un score relatif au panel de 0 à 100.

Formule de densité

Pour chaque vue de densité :

Le dénominateur change selon la vue : paramètres actifs en milliards, FLOP d'entraînement divisé par 10²⁴, ou prix mixte par million de tokens.

Méthodologie de l'indice chaîné

Les deux graphiques d'indice en haut de l'article (Densité d'intelligence et Capacité) montrent une croissance cumulée sur une seule ligne indexée à 100 en 2023, sur le modèle du format de rendement cumulé du S&P 500. Nous chaînons les taux de croissance d'une année sur l'autre à travers la transition des benchmarks plutôt que de tracer des valeurs absolues.

Étape 1. Calculer la moyenne annuelle de la métrique pour chaque groupe de benchmarks :

Pour l'indice de densité d'intelligence, la métrique est la moyenne par ligne des trois scores de densité par modèle (Densité combinée A ou B). Pour l'indice de capacité, la métrique est le score de capacité relatif au panel (Capability_A ou Capability_B).

Étape 2. Pour chaque transition d'une année à l'autre, calculer la croissance au sein d'un seul groupe de benchmarks. Les deux années doivent provenir du même groupe :

Étape 3. Chaîner de manière multiplicative à partir d'une base 2023 de 100 :

Sélection du groupe par transition :

  • 2023 – 2024 : Benchmarks standard (les avancés comptent 1 modèle en 2023, trop peu pour calculer une moyenne stable)
  • 2024 – 2025 : Benchmarks avancés (les standard ont saturé fin 2024 ; les avancés comptent 16 modèles en 2024 et 27 en 2025)
  • 2025 – 2026 : Benchmarks avancés (les standard ne sont pas rapportés pour 2026)

L'indice chaîné suppose que les populations sous-jacentes sont comparables d'une année à l'autre au sein d'un groupe. Notre panel est hétérogène (modèles différents chaque année, avec une couverture de benchmarks différente) ; les valeurs chaînées doivent donc être lues comme un résumé directionnel plutôt que comme un multiplicateur précis.

Principes fondamentaux d'évaluation pour la mesure de la densité d'intelligence

  • Benchmarks standard de l'industrie : Nous n'introduisons aucun benchmark personnalisé.
  • Sources primaires : Chaque score de benchmark est traçable jusqu'à l'article de publication du modèle, à la fiche du modèle ou à l'annonce officielle. Lorsque la source primaire n'a pas rapporté de benchmark, la cellule est laissée vide plutôt qu'imputée.
  • Indicateurs de couverture (N) : Pour chaque modèle, nous indiquons le nombre de benchmarks contribuant à son score de capacité dans chaque groupe. Les modèles avec N=1 reçoivent un score plus bruité que ceux avec N=5. Le cas N=1 s'applique à Qwen 3.6 35B A3B (SWE-bench Verified) et à quelques sorties phares fermées de 2026.

Sources de tarification des modèles à poids fermés

La tarification est la partie de l'indice la plus sensible aux cohortes. Nous utilisons la hiérarchie suivante :

  1. Annonce de lancement du laboratoire (préférée) : Prix indiqué dans le billet de lancement du laboratoire, la documentation de l'API ou la couverture de presse contemporaine.
  2. Médiane inter-fournisseurs d'Artificial Analysis (solution de repli pour les modèles à poids) : Utilisée pour trois lignes Llama 3.1 (8B, 70B, 405B) et les lignes GPT-OSS, car aucune API de première partie n'existe.
  3. Poids sans couverture : 22 lignes sur 69 n'ont pas de prix par dollar enregistré. Elles apparaissent dans les graphiques de capacité et par paramètre, mais sont absentes des graphiques par dollar.

Nous suivons deux pistes de prix : le prix de lancement (prix de première partie le jour de la sortie) et le prix stabilisé (prix de première partie actuel, ou le dernier avant dépréciation). Six modèles du panel ont été réévalués après leur lancement :

  • Gemini 1.5 Pro : de $3,50/$10,50 à $1,25/$5,00 (octobre 2024)
  • GPT-4o : de $5,00/$15,00 à $2,50/$10,00 (octobre 2024)
  • Gemini 1.5 Flash : de $0,35/$1,05 à $0,075/$0,30 (août 2024)
  • Claude 3.5 Haiku : de $1,00/$5,00 à $0,80/$4,00 (décembre 2024)
  • o3 : de $10,00/$40,00 à $2,00/$8,00 (juin 2025)

La densité par dollar principale utilise la tarification stabilisée. Pour 37 lignes tarifées sur 43, les prix de lancement et stabilisés sont identiques.

Cadence de mise à jour

Nous mettons à jour l'indice chaque mois. Chaque mise à jour ajoute de nouvelles lignes de modèles pour toute sortie de pointe ou notable du mois précédent, actualise la tarification lorsque les laboratoires ont ajusté leurs tarifs, complète les benchmarks nouvellement rapportés pour les lignes existantes et recalcule les z-scores sur l'ensemble du panel. Les nouvelles entrées de modèles déplacent la moyenne et l'écart-type de chaque benchmark ; les scores existants de 0 à 100 évoluent donc avec le panel. Les instantanés historiques sont préservés.

Limites de l'évaluation de la densité d'intelligence

  • Optimisme des laboratoires : Les scores des benchmarks proviennent des laboratoires eux-mêmes. Les ré-exécutions indépendantes sont généralement inférieures de 5 à 13 points. Les lignes de tendance sont informatives sur le plan directionnel, mais pas précises au point près.
  • Modes de raisonnement et non-raisonnement non séparés : Les modèles publiés en 2025 et 2026 prennent en charge des options de réflexion étendue qui peuvent faire varier les scores de mathématiques et de codage de 5 à 15 points. Nous utilisons les scores du mode par défaut lorsqu'ils sont identifiables.
  • Les chiffres de FLOP d'entraînement sont surtout des estimations : Une poignée de lignes ont des FLOP confirmés par le laboratoire. Le reste est extrapolé à partir des paramètres divulgués et des tokens d'entraînement, principalement via Epoch IA.
  • Nombre de paramètres des modèles fermés inconnu : Les densités par paramètre et par FLOP sont vides pour les lignes fermées de pointe. Les modèles fermés participent à la densité par dollar.
  • Scores relatifs au panel : Les scores de densité sont remis à l'échelle min-max au sein du panel. Un nouveau modèle avec un ratio brut plus élevé déplace le score 0–100 de chaque modèle existant. Pour comparer les versions du panel, utilisez les ratios bruts sous-jacents plutôt que les scores remis à l'échelle.
Ne manquez pas nos benchmarks et analyses basées sur les données. Le bouton ouvre Google ; sélectionner AIMultiple confirme que vous souhaitez voir AIMultiple plus souvent dans les résultats de recherche Google.
GoogleAjouter comme source préférée

Qu'est-ce que la densité d'intelligence ?

La densité d'intelligence représente une nouvelle métrique pour évaluer la quantité de connaissances et de capacités de raisonnement qu'un modèle peut concentrer dans une seule unité de mémoire ou de calcul. Elle mesure l'architecture du modèle en évaluant l'efficacité avec laquelle il utilise chaque paramètre pour générer de la valeur.

Dans ce cadre, l'axe des x représente souvent le nombre de paramètres du modèle tandis que l'axe des y suit les performances sur des tâches difficiles. Une densité élevée se produit lorsque les modèles démontrent des capacités supérieures sans nécessiter le coût computationnel massif associé aux modèles plus grands. Ce processus prouve que l'intelligence ne dépend pas uniquement de la quantité de données ou de l'échelle de l'entraînement, mais plutôt de la manière dont les logiciels et les algorithmes organisent cette information.

Auparavant, la communauté de l'IA s'appuyait sur la mise à l'échelle des paramètres du modèle pour atteindre des performances plus élevées, ce qui aboutissait à des systèmes massifs et gourmands en ressources. Avec ce changement d'orientation, l'optimisation algorithmique est priorisée par rapport au volume brut pour produire plus d'intelligence à partir de modèles plus petits. 

Pourquoi est-il important de mesurer la densité d'intelligence ?

Les systèmes efficaces doivent optimiser le temps d'inférence et l'utilisation de la mémoire. Identifier le point à partir duquel davantage de tokens ou de calcul supplémentaire ne produisent plus de gains significatifs aide l'industrie à comprendre les limites supérieures des grands modèles de langage actuels. Les principales raisons de mesurer la densité d'intelligence peuvent être résumées ainsi :

  • La communauté de l'IA sous-estime les frais généraux à long terme de la maintenance de modèles surdimensionnés dans les centres de données.
  • La création de valeur dans les applications pratiques dépend du rapport entre la qualité de la sortie et la puissance nécessaire pour la produire.
  • La loi de Moore pour le matériel ne peut pas soutenir la croissance des modèles de langage sans progrès correspondants dans la manière dont nous les optimisons.
  • L'apprentissage par renforcement et une meilleure distribution des données permettent aux outils de nouvelle génération d'atteindre des benchmarks autrefois réservés aux humains. Apprenez-en davantage sur l'apprentissage par renforcement et d'autres types de techniques de LLM fine-tuning.

Bien que les modèles plus grands restent importants pour explorer de nouvelles frontières, la densité d'un système détermine son utilité réelle dans le monde réel. Ce contexte aide à considérer l'intelligence comme un résultat concentré de l'entraînement plutôt que comme un sous-produit de la taille brute.

Pour aller plus loin

La densité d'intelligence est une façon de comparer les LLMs. D'autres dimensions sont couvertes dans des analyses distinctes :

Citez ce benchmark

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Hazal Şimşek (2026) - "Densité d'intelligence des 71 LLMs pour des modèles plus intelligents et plus denses". Publié en ligne sur AIMultiple.com. Consulté le 7 Juillet 2026, à : https://aimultiple.com/intelligence-density [Ressource en ligne]

Şimşek, H. (2026, 7 Juillet). Densité d'intelligence des 71 LLMs pour des modèles plus intelligents et plus denses. AIMultiple. https://aimultiple.com/intelligence-density

@misc{simsek2026,
  author = {Şimşek, Hazal},
  title  = {{Densité d'intelligence des 71 LLMs pour des modèles plus intelligents et plus denses}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/intelligence-density}},
  note   = {AIMultiple. Consulté le 7 Juillet 2026}
}
Télécharger toutes les données

Résultats et horodatages de 91 points de données. Téléchargez les données utilisées dans cet article sous forme de fichier ZIP contenant 3 fichiers CSV et un README.

Dernière mise à jour : 17 Août 2026
Télécharger
Hazal Şimşek
Hazal Şimşek
Analyste sectorielle
Hazal est analyste sectorielle chez AIMultiple, spécialisée dans l'intelligence des processus (y compris le process mining) et l'automatisation d'entreprise (y compris l'automatisation IT et l'automatisation low-code/no-code).
Voir le profil complet

Soyez le premier à commenter

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450