Services
Contactez-nous

Densité d'intelligence de 71 LLMs: Modèles plus intelligents et plus denses

Hazal Şimşek
Hazal Şimşek
mis à jour le 7 juil. 2026

Nous avons suivi 71 LLMs sortis entre février 2023 et mai 2026 et collecté 10 benchmarks publics pour mesurer la densité d'intelligence. Nous avons divisé le score de capacité par la ressource que le modèle consomme (paramètres actifs, calcul d'entraînement et prix d'inférence).

Loading Chart

Aperçu de la densité d'intelligence des LLM

Pour calculer la densité d'intelligence, nous avons suivi les étapes suivantes :

  • Efficacité des ressources : Nous avons divisé la capacité de chaque modèle par deux métriques de ressource :
    • Paramètres actifs : Un proxy pour la mémoire et le coût de service (poids ouverts uniquement).
    • Prix d'inférence : Rapport coût-efficacité du marché basé sur la tarification groupée des API par million de tokens.
    • Note sur le calcul d'entraînement (FLOP) : Nous avons initialement inclus un troisième axe, le calcul d'entraînement (FLOP), mais l'avons retiré car sa pente négative sur les benchmarks Standard saturés a entraîné une baisse contre-intuitive du composite 2023–2024.
  • Regroupement des benchmarks : Pour éviter que la saturation des scores ne masque les gains d'efficacité, nous avons évalué les capacités dans deux ères de benchmarks distinctes :
    • Benchmarks Standard (2023–2024) : MMLU (5-shot), GSM8K (8-shot CoT), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
    • Benchmarks Avancés (2024–2026) : MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
  • Indice en chaîne : Nous avons calculé la croissance d'une année sur l'autre au sein de groupes de benchmarks correspondants et les avons enchaînés multiplicativement à partir d'une base de référence de 100 en 2023 pour tracer la tendance cumulée.

Voir la méthodologie pour l'approche de notation et les ventilations par ressource.

Résultats de la densité d'intelligence des LLM

À la mi-2026, l'écosystème de l'IA a fourni près de 15× plus d'intelligence par unité de ressource (paramètres et dollars) que la base de référence de 2023. Deux choses à noter en lisant la tendance :

  • Le bond de 2024–2025 (+362 %) surévalue le gain réel : Les benchmarks Avancés étaient nouveaux en 2024 et seuls quelques modèles y affichaient des scores, de sorte que la base de référence de 2024 est artificiellement basse. La majeure partie de la « poussée » est due au remplissage du panel, pas à un bond d'efficacité d'un an.
  • Le gain de 2025–2026 (+105 %) est là où se trouve la véritable histoire : Il est mesuré sur un nombre beaucoup plus grand de modèles et est porté par de petites versions à poids ouverts comme Qwen 3.6-35B-A3B et DeepSeek V4 Flash qui égalent la capacité des modèles fermés de pointe à une fraction de la taille et du coût.

Capacité des LLM

Le graphique de densité montre l'efficacité. Pour le mettre en contexte, nous avons également mesuré la capacité brute sur la même période : à quel point ces modèles sont-ils devenus plus intelligents avant tout ajustement des ressources ?

Capacité indexée à 100 en 2023, moyenne sur tous les modèles sortis chaque année.

Les axes et l'info-bulle fonctionnent de la même manière que le graphique de densité, l'axe Y suivant les performances brutes des benchmarks plutôt que la densité.

Un score de capacité de 100 en 2023 a atteint 468 en 2026, soit environ une amélioration de 4,7×. Année par année :

  • 2024 (+88 %) : Progrès rapide sur les benchmarks standard avant leur saturation.
  • 2025 (+105 %) : Même progrès rapide, mesuré sur les benchmarks avancés plus difficiles qui ont remplacé les standard.
  • 2026 (+22 %) : Le ralentissement est un premier signe que les benchmarks avancés commencent aussi à saturer.

En mettant les deux graphiques côte à côte :

  • La capacité a augmenté de 4,7× tandis que la densité d'intelligence a augmenté de 8,9×.
  • Les modèles sont devenus à la fois plus intelligents et plus efficaces. Ils n'ont pas besoin proportionnellement de plus de paramètres, de calcul d'entraînement ou d'argent pour fonctionner.

Notez que : Le chiffre de capacité de 4,7× est un ordre de grandeur crédible. Le chiffre de densité de 8,9× est plus fragile (le groupe Avancé de 2024 a moins de points de données, ce qui amplifie le taux de croissance de cette année-là), considérez-le donc comme un signal directionnel plutôt qu'un multiplicateur précis.

Quel LLM a la plus haute densité d'intelligence ?

La densité d'intelligence dépend de la ressource que nous mesurons et du groupe de benchmarks sur lequel nous évaluons. Le leader change pour chaque combinaison.

Densité par paramètre actif (poids ouverts uniquement)

Cette vue mesure l'efficacité avec laquelle un modèle intègre des capacités dans ses poids. Les paramètres actifs sont importants car les modèles Mixture-of-Experts (MoE) acheminent chaque token à travers une fraction des poids totaux. DeepSeek V3 a 671B paramètres totaux mais 37B actifs par token, et le chiffre de 37B reflète le coût effectif de service.

Leaders des benchmarks Standard

  • LLaMA 3.1 8B (juil. 2024) : 100.0
  • LLaMA 3 8B (avr. 2024) : 85.0
  • LLaMA 4 Maverick (avr. 2025) : 55.9
  • Mixtral 8x7B (déc. 2023) : 47.4
  • Mistral 7B (sept. 2023) : 46.3

Leaders des benchmarks Avancés

  • Qwen 3.6-35B-A3B (avr. 2026) : 100.0 (3B paramètres actifs ; le score repose sur un seul benchmark, SWE-bench Verified à 73.4%, donc à lire en conséquence)
  • GPT-OSS 20B (août 2025) : 85.2 (3,6B paramètres actifs)
  • GPT-OSS 120B (août 2025) : 64.4 (5,1B paramètres actifs)
  • Qwen 3.5 9B (mars 2026) : 35.2 (9B paramètres denses)
  • DeepSeek V4 Flash (avr. 2026) : 26.0

Le classement des benchmarks Standard a cessé de bouger depuis fin 2024 car les benchmarks ont saturé, pas parce que le progrès s'est arrêté. GPT-4 a obtenu 90.2 sur les benchmarks standard début 2023 mais 17.3 sur les benchmarks avancés.

Densité par FLOP d'entraînement (poids ouverts uniquement)

Cette vue récompense la curation des données, les choix d'architecture et les recettes d'entraînement plutôt que les dépenses brutes.

Remarque : la densité par FLOP sur les benchmarks standard semble diminuer avec le temps. C'est un artefact de saturation, pas un déclin de l'efficacité d'entraînement. Les anciens benchmarks ne mesurent plus les gains récents, donc les scores de capacité se compriment tandis que le calcul d'entraînement continue de croître.

Leaders des benchmarks Standard

  • Mistral 7B (sept. 2023) : 100.0 (toujours le point de référence du panel, plus de deux ans après)
  • LLaMA 3 8B (avr. 2024) : 40.8
  • LLaMA 1 (fév. 2023) : 37.0
  • DeepSeek V2 (mai 2024) : 32.6
  • Mixtral 8x7B (déc. 2023) : 27.1

Leaders des benchmarks Avancés

  • Qwen 3.5 9B (mars 2026) : 100.0
  • Qwen 3.6-35B-A3B (avr. 2026) : 28.4
  • DeepSeek V4 Flash (avr. 2026) : 6.4

Le résultat de Qwen 3.5 (9B) est remarquable : un modèle dense de 9B entraîné à environ 1,5 × 10²³ FLOP qui obtient 81.2 sur les benchmarks avancés en capacité. Son calcul d'entraînement est à peu près un ordre de grandeur inférieur à DeepSeek V4 Pro, mais l'écart de capacité est plus petit.

Densité par dollar d'inférence

La densité par dollar est l'axe où les modèles à poids ouverts et les modèles fermés de pointe peuvent être directement comparés, car la tarification des API est vérifiable publiquement. Nous utilisons les prix établis pour le titre de sorte que les baisses post-lancement sont reflétées.

Leaders des benchmarks Standard

  • Mistral Small 3 24B (janv. 2025) : 100.0 à $0.10 / $0.30 par million de tokens via l'API propriétaire de Mistral
  • Gemini 1.5 Flash (mai 2024) : 99.3 (modèle fermé le mieux classé après sa baisse de prix d'août 2024)
  • DeepSeek V2 (mai 2024) : 66.0 à $0.27 / $1.10 par million de tokens
  • DeepSeek V3 (déc. 2024) : 30.9
  • DeepSeek R1 (janv. 2025) : 17.8

Leaders des benchmarks Avancés

  • GPT-OSS 120B (août 2025) : 100.0 (la référence de prix est la médiane multi-fournisseurs de OpenRouter, car OpenAI n'a pas hébergé le modèle sur une API propriétaire)
  • GPT-OSS 20B (août 2025) : 80.0
  • DeepSeek V4 Flash (avr. 2026) : 44.0 à $0.06 / $0.42 par million de tokens via l'API propriétaire de DeepSeek
  • DeepSeek V3.2 (déc. 2025) : 22.5
  • Mistral Small 3 24B (janv. 2025) : 20.9
  • DeepSeek V4 Pro (avr. 2026) : 16.0 à $0.54 groupés, avec 97.8 en capacité benchmarks avancés. Cela place V4 Pro à 2.2 points de capacité de Claude Opus 4.7 pour environ 1/18e du prix groupé ($0.54 contre $10.00).

L'écart avec les modèles fermés de pointe ne s'est pas réduit

Les modèles de raisonnement fermés d'Anthropic, d'OpenAI et de Google se regroupent entre 0 et 6 en densité par dollar sur les benchmarks avancés tout au long de la période du panel. GPT-4 en mars 2023 a obtenu 0.0. Claude Opus 4.7 en avril 2026 a obtenu 0.9.

Les laboratoires fermés ont réduit les prix absolus :

  • Opus de Claude est passé de $30 à $10 par million de tokens entre Opus 4 et Opus 4.5.
  • o3 d'OpenAI est passé de $10/$40 au lancement à $2/$8 établis.
  • Gemini 1.5 Flash a baissé d'environ 78 %.

Mais l'écart relatif par rapport aux leaders de densité à poids ouverts est resté à peu près de 30 à 50× sur la période. DeepSeek a tarifé près de $0,18 par million en 2024 (V2) et près de $0,18 par million en 2026 (V4 Flash). Le plancher de prix des poids ouverts n'a pas bougé, et le plancher des modèles fermés phares n'a pas assez bougé pour combler l'écart. La concurrence par les prix se produit au niveau de la génération précédente, où les anciens modèles fermés sont maintenus comme alternatives bon marché, pas au niveau de la frontière.

La nouvelle direction : les benchmarks agentiques

Les benchmarks avancés utilisés pour mesurer les performances de l'IA commencent à perdre de leur efficacité, comme les anciennes suites de tests qu'ils ont remplacées. Les laboratoires ont commencé à publier des benchmarks agentiques (SWE-Bench Pro, SWE-bench Verified, Terminal-Bench, OSWorld-Verified, Finance Agent) au lieu des anciens tests de raisonnement. Nous avons commencé à construire un panel pour suivre cette transition.

Par exemple, le tout dernier modèle de pointe, Claude Opus 4.8, publie ses résultats presque entièrement sur ces benchmarks agentiques pour LLM, sans aucun score sur les benchmarks de raisonnement que notre panel principal suit.

Taux de résolution SWE-Bench Pro par date de sortie, noté sur l'environnement standardisé SEAL de Scale. Parmi les modèles tracés :

  • Les meilleurs modèles fermés : Claude Fable 5 (80,3 %),Claude Opus 4.5 (45,9 %), Claude Sonnet 4.5 (43.6 %), et Gemini 3 Pro Preview (43.3 %).
  • Les meilleurs modèles ouverts : GLM 5.2 (62,1 %), Qwen3-Coder-480B-A35B (38,7 %), Kimi K2 Instruct (27.7 %), et Qwen3-235B-A22B (21,4 %).

Explorez les benchmarks agentiques en consultant les benchmarks de codage agentique, la recherche agentique et la surveillance agentique.

Défis de la comparaison des performances agentiques

L'évaluation et la comparaison des résultats des benchmarks agentiques présentent plusieurs difficultés clés :

  • Concentration sur les métriques de capacité : Nous pouvons afficher les scores de capacité, car les données de ressources nécessaires pour mesurer la densité (nombre de paramètres, calcul d'entraînement et tarification vérifiée par modèle) restent incomplètes ou non divulguées par les laboratoires fermés.
  • Sensibilité au niveau du système : Les scores des benchmarks mesurent l'ensemble du système, pas seulement le modèle d'IA. Comme les scores dépendent fortement du « scaffolding » (l'infrastructure logicielle environnante), le même modèle peut donner des résultats très différents selon le harnais d'agent utilisé.
  • Protocole de standardisation : Pour garantir une comparaison équitable, ce rapport trace exclusivement les données SWE-Bench Pro provenant d'un environnement standardisé unique (le classement SEAL de Scale). Les scores rapportés par d'autres laboratoires utilisent des harnais différents et ne sont pas directement comparables.
  • Exclusion de Claude Opus 4.8 : Bien qu'Opus 4.8 affiche un score record de 69.2 % sur SWE-Bench Pro, il a été testé sur le harnais interne d'Anthropic et n'a pas encore été évalué par SEAL de Scale. Pour maintenir une stricte cohérence des données, nous mentionnons son score ici plutôt que de le tracer.

SWE-Bench Pro provient de l'environnement standardisé SEAL de Scale. Les autres colonnes sont rapportées par les laboratoires sur des harnais variables et ne sont pas directement comparables entre les lignes. Les tirets signifient qu'aucun score vérifié n'a été trouvé.

Ces trois modèles ont été exécutés sur le harnais mini-swe-agent, ils sont donc exclus du graphique en nuage de points pour maintenir la comparabilité.

Méthodologie de la densité d'intelligence

Couverture du panel

  • Modèles : 71 LLMs sortis entre février 2023 et avril 2026. 37 modèles ont des scores de benchmarks Standard et 54 ont des scores de benchmarks Avancés. Les modèles sans un groupe de benchmarks complet sont exclus des calculs de densité de ce groupe.
  • Benchmarks : 10 benchmarks publics, tous rapportés par les laboratoires et traçables à une source primaire. Nous n'avons réexécuté aucun benchmark.
  • Ressources : Pour chaque modèle, nous avons divisé son score de capacité par trois ressources indépendamment :
    • Paramètres actifs : Un proxy pour la mémoire et le coût de service. Limité aux modèles à poids ouverts, car les laboratoires fermés (OpenAI, Anthropic, Google) ne divulguent pas le nombre de paramètres.
    • Calcul d'entraînement (FLOP) : Un proxy pour l'efficacité de l'entraînement. Également limité aux modèles à poids ouverts. Les chiffres de FLOP sont pour la plupart des estimations d'Epoch IA et doivent être considérés comme directionnels.
    • Prix d'inférence : Le prix qu'un acheteur paie effectivement à l'API. La capacité est divisée par le prix groupé par million de tokens selon un ratio entrée:sortie de 3:1. Les modèles ouverts et fermés participent, car la tarification des API est vérifiable publiquement.

Pourquoi deux groupes de benchmarks ?

Les modèles sortis en 2024 ont saturé les benchmarks standard que les laboratoires d'IA utilisaient depuis 2020. Lorsque les modèles de pointe atteignent 90 % ou plus sur un benchmark, le test ne distingue plus les modèles forts des très forts. Les laboratoires ont réagi en introduisant des benchmarks plus difficiles.

Nous traitons ce changement comme une rupture nette pour deux raisons :

  • Premièrement, mélanger des benchmarks faciles et difficiles dans un score de capacité unique permettrait à un score saturé sur un benchmark facile de masquer un score faible sur un difficile. Un modèle qui obtient 85 sur MMLU-Pro est plus fort qu'un modèle qui obtient 85 sur MMLU. Traiter les deux comme équivalents comprime la plage des scores et favorise les anciens benchmarks.
  • Deuxièmement, les deux suites ont des distributions de scores différentes : les benchmarks standard se regroupent en haut (la plupart des modèles de pointe au-dessus de 85), tandis que les benchmarks avancés ont une plus grande dispersion (les meilleurs modèles autour de 90, le milieu de gamme autour de 50, les modèles plus faibles en dessous de 30). Réduire les deux ensemble par score Z fausserait l'estimation de la variance.

Nous calculons la capacité pour chaque groupe indépendamment :

  • Benchmarks Standard (2023–2024) : MMLU (5-shot), GSM8K (8-shot chain of thought), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
  • Benchmarks Avancés (2024–2026) : MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.

Un score de 90 sur les benchmarks standard n'équivaut pas à 90 sur les benchmarks avancés. Pour tout modèle sorti à partir de fin 2024, les benchmarks avancés sont la référence pertinente.

Formule de capacité

Pour chaque benchmark b et chaque modèle m :

Nous utilisons l'écart-type de la population (division par N, pas par N−1). Cela correspond au calcul pandas d'origine avec ddof=0 et garantit que l'ajout d'un seul nouveau modèle ne modifie pas rétroactivement l'estimation de la variance.

Nous faisons ensuite la moyenne des scores Z disponibles par modèle au sein de chaque groupe de benchmarks et remettons à l'échelle min-max dans une plage relative au panel de 0 à 100.

Formule de densité

Pour chaque vue de densité :

Le dénominateur change selon la vue : paramètres actifs en milliards, FLOP d'entraînement divisé par 10²⁴, ou prix groupé par million de tokens.

Méthodologie de l'indice chaîné

Les deux graphiques d'indice en haut de l'article (Densité d'intelligence et Capacité) montrent une croissance cumulée sur une seule ligne indexée à 100 en 2023, sur le modèle du format de rendement cumulé du S&P 500. Nous enchaînons les taux de croissance d'une année sur l'autre à travers la transition des benchmarks plutôt que de tracer des valeurs absolues.

Étape 1. Calculer la moyenne annuelle de la métrique pour chaque groupe de benchmarks :

Pour l'indice de densité d'intelligence, la métrique est la moyenne par rangée des trois scores de densité par modèle (Densité Combinée A ou B). Pour l'indice de capacité, la métrique est le score de capacité relatif au panel (Capacité_A ou Capacité_B).

Étape 2. Pour chaque transition d'une année à l'autre, calculer la croissance au sein d'un seul groupe de benchmarks. Les deux années doivent provenir du même groupe :

Étape 3. Enchaîner multiplicativement à partir d'une base de référence de 100 en 2023 :

Sélection des groupes par transition :

  • 2023 – 2024 : Benchmarks Standard (les benchmarks Avancés ont 1 modèle en 2023, trop peu pour calculer une moyenne stable)
  • 2024 – 2025 : Benchmarks Avancés (les Standard ont saturé fin 2024 ; les Avancés comptent 16 modèles en 2024 et 27 en 2025)
  • 2025 – 2026 : Benchmarks Avancés (les Standard ne sont pas rapportés pour 2026)

L'indice chaîné suppose que les populations sous-jacentes sont comparables d'une année à l'autre au sein d'un groupe. Notre panel est hétérogène (différents modèles chaque année, avec une couverture de benchmarks différente), les valeurs chaînées sont donc à lire comme un résumé directionnel plutôt qu'un multiplicateur précis.

Principes fondamentaux d'évaluation pour la mesure de la densité d'intelligence

  • Benchmarks standard de l'industrie : Nous n'introduisons aucun benchmark personnalisé.
  • Traçabilité à la source primaire : Chaque score de benchmark est traçable au papier de sortie du modèle, à la fiche technique ou à l'annonce officielle. Lorsque la source primaire n'a pas rapporté un benchmark, la cellule est vide plutôt qu'imputée.
  • Indicateurs de couverture (N) : Pour chaque modèle, nous indiquons le nombre de benchmarks contribuant à son score de capacité dans chaque groupe. Les modèles avec N=1 reçoivent un score plus bruité que ceux avec N=5. Le cas N=1 s'applique à Qwen 3.6 35B A3B (SWE-bench Verified uniquement) et à quelques sorties phares fermées de 2026.

Sources de tarification pour les modèles à poids fermés

La tarification est la partie la plus sensible à la cohorte de l'indice. Nous utilisons la hiérarchie suivante :

  1. Annonce de lancement du laboratoire (préférée) : Prix cité dans l'annonce de lancement du laboratoire, la documentation de l'API ou la couverture de presse contemporaine.
  2. Médiane multi-fournisseurs d'Artificial Analysis (solution de repli pour les modèles à poids uniquement) : Utilisée pour trois lignes Llama 3.1 (8B, 70B, 405B) et les lignes GPT-OSS, car aucune API propriétaire n'existe.
  3. Poids uniquement sans couverture : 22 des 69 lignes n'ont pas de prix par dollar enregistré. Elles apparaissent dans les graphiques de capacité et par paramètre mais sont absentes des graphiques par dollar.

Nous suivons deux pistes de prix : le prix de lancement (prix propriétaire le jour de la sortie) et le prix établi (prix propriétaire actuel, ou le dernier avant dépréciation). Six modèles dans le panel ont été reprixés après le lancement :

  • Gemini 1.5 Pro : $3.50/$10.50 à $1.25/$5.00 (octobre 2024)
  • GPT-4o : $5.00/$15.00 à $2.50/$10.00 (octobre 2024)
  • Gemini 1.5 Flash : $0.35/$1.05 à $0.075/$0.30 (août 2024)
  • Claude 3.5 Haiku : $1.00/$5.00 à $0.80/$4.00 (décembre 2024)
  • o3 : $10.00/$40.00 à $2.00/$8.00 (juin 2025)

La densité par dollar en titre utilise le prix établi. Pour 37 des 43 lignes avec prix, les prix de lancement et établis sont identiques.

Cadence de mise à jour

Nous actualisons l'indice chaque mois. Chaque actualisation ajoute de nouvelles lignes de modèles pour toute sortie de pointe ou notable du mois précédent, met à jour les prix lorsque les laboratoires ont ajusté leurs tarifs, complète les nouveaux benchmarks rapportés pour les lignes existantes, et recalcule les scores Z sur l'ensemble du panel. Les nouvelles entrées de modèles modifient la moyenne et l'écart-type de chaque benchmark, de sorte que les scores existants de 0 à 100 évoluent avec le panel. Les instantanés historiques sont conservés.

Découvrez davantage de nos benchmarks et analyses basées sur les données dans la recherche Google.
GoogleAjouter comme source préférée

Limitations de l'évaluation de la densité d'intelligence

  • Optimisme des rapports de laboratoire : Les scores des benchmarks proviennent des laboratoires eux-mêmes. Les réexécutions indépendantes sont généralement inférieures de 5 à 13 points. Les lignes de tendance sont informatives sur le plan directionnel mais pas précises au point près.
  • Modes de raisonnement et non-raisonnement non séparés : Les modèles sortis en 2025 et 2026 prennent en charge des bascules de réflexion étendue qui peuvent faire varier les scores en mathématiques et en codage de 5 à 15 points. Nous utilisons les scores en mode par défaut lorsqu'ils sont identifiables.
  • Les chiffres de FLOP d'entraînement sont pour la plupart des estimations : Une poignée de lignes ont des FLOP confirmés par le laboratoire. Le reste est extrapolé à partir des paramètres divulgués et des tokens d'entraînement, principalement via Epoch IA.
  • Nombre de paramètres des modèles fermés inconnu : Les densités par paramètre et par FLOP sont vides pour les lignes de modèles fermés de pointe. Les modèles fermés ne participent qu'à la densité par dollar.
  • Scores relatifs au panel : Les scores de densité sont remis à l'échelle min-max à l'intérieur du panel. Un nouveau modèle avec un ratio brut plus élevé modifie le score 0–100 de chaque modèle existant. Pour comparer les versions du panel, utilisez les ratios bruts sous-jacents plutôt que les scores remis à l'échelle.

Qu'est-ce que la densité d'intelligence ?

La densité d'intelligence représente une nouvelle métrique pour évaluer la quantité de connaissances et de capacités de raisonnement qu'un modèle peut intégrer dans une seule unité de mémoire ou de calcul. Elle mesure l'architecture du modèle en évaluant avec quelle efficacité il utilise chaque paramètre pour générer de la valeur.

Dans ce cadre, l'axe des x représente souvent le nombre de paramètres du modèle tandis que l'axe des y suit les performances sur des tâches difficiles. Une haute densité se produit lorsque les modèles démontrent des capacités supérieures sans nécessiter le coût computationnel massif associé aux grands modèles. Ce processus prouve que l'intelligence ne dépend pas uniquement de la quantité de données ou de l'échelle de l'entraînement, mais plutôt de la manière dont le logiciel et les algorithmes organisent ces informations.

Auparavant, la communauté de l'IA s'appuyait sur la mise à l'échelle des paramètres du modèle pour atteindre des performances plus élevées, ce qui aboutissait à des systèmes massifs et gourmands en ressources. Avec ce changement d'orientation, l'optimisation algorithmique est privilégiée par rapport au volume brut pour produire plus d'intelligence à partir de modèles plus petits. 

Pourquoi est-il important de mesurer la densité d'intelligence ?

Les systèmes efficaces doivent optimiser le temps d'inférence et l'utilisation de la mémoire. Identifier le point où plus de tokens ou de calcul supplémentaire n'apportent plus de gains significatifs aide l'industrie à comprendre les limites supérieures des grands modèles de langage actuels. Les principales raisons de mesurer la densité d'intelligence peuvent se résumer comme suit :

  • La communauté de l'IA sous-estime les frais généraux à long terme de la maintenance de modèles surdimensionnés dans les centres de données.
  • La création de valeur dans les applications pratiques dépend du ratio entre la qualité de la sortie et la puissance nécessaire pour la produire.
  • La loi de Moore pour le matériel ne peut pas soutenir la croissance des modèles de langage sans progrès correspondant dans la manière dont nous les optimisons.
  • L'apprentissage par renforcement et une meilleure distribution des données permettent aux outils de nouvelle génération d'atteindre des benchmarks autrefois réservés aux humains. Apprenez-en plus sur l'apprentissage par renforcement et d'autres types de techniques de LLM fine-tuning.

Bien que les grands modèles restent importants pour explorer de nouvelles frontières, la densité d'un système détermine son utilité réelle dans le monde réel. Ce contexte aide à considérer l'intelligence comme un résultat concentré de l'entraînement plutôt qu'un sous-produit de la taille brute.

Pour en savoir plus

La densité d'intelligence est une façon de comparer les LLMs. D'autres dimensions sont couvertes dans des analyses distinctes :

Citez ce benchmark

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Hazal Şimşek (2026) - "Densité d'intelligence de 71 LLMs: Modèles plus intelligents et plus denses". Publié en ligne sur AIMultiple.com. Consulté le 7 Juillet 2026, à : https://aimultiple.com/intelligence-density [Ressource en ligne]

Şimşek, H. (2026, 7 Juillet). Densité d'intelligence de 71 LLMs: Modèles plus intelligents et plus denses. AIMultiple. https://aimultiple.com/intelligence-density

@misc{imek2026,
  author = {Şimşek, Hazal},
  title  = {{Densité d'intelligence de 71 LLMs: Modèles plus intelligents et plus denses}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/intelligence-density}},
  note   = {AIMultiple. Consulté le 7 Juillet 2026}
}
Télécharger toutes les données

Résultats et horodatages de 69 points de données. Téléchargez les données utilisées dans cet article sous forme de fichier ZIP contenant un fichier CSV et un README.

Dernière mise à jour : 3 Juillet 2026
Télécharger
Hazal Şimşek
Hazal Şimşek
Analyste sectorielle
Hazal est analyste sectorielle chez AIMultiple, spécialisée dans le process mining et l'automatisation informatique (IT).
Voir le profil complet

Soyez le premier à commenter

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450