Densité d'intelligence de 71 LLMs: modèles plus intelligents et plus denses
Nous avons suivi 71 LLMs publiés entre février 2023 et mai 2026 et collecté 10 benchmarks publics pour mesurer la densité d'intelligence. Nous avons divisé le score de capacité par la ressource que le modèle consomme (paramètres actifs, calcul d'entraînement et prix d'inférence).
LLM aperçu de la densité d'intelligence
Pour calculer la densité d'intelligence, nous avons suivi les étapes suivantes :
- Efficacité des ressources : Nous avons divisé la capacité de chaque modèle par deux indicateurs de ressources :
- Paramètres actifs : Un proxy pour la mémoire et le coût de service (open-weight uniquement).
- Prix d'inférence : Efficacité-coût du marché basée sur le prix mixte par million de tokens des API.
- Note sur le calcul d'entraînement (FLOP) : Nous avions initialement inclus un troisième axe, le calcul d'entraînement (FLOP), mais nous l'avons retiré car sa pente négative sur les benchmarks standard saturés a entraîné une baisse contre-intuitive du composite 2023–2024.
- Regroupement des benchmarks : Pour éviter que la saturation des scores ne masque les gains d'efficacité, nous avons évalué les capacités sur deux ères de benchmarks distinctes :
- Benchmarks standard (2023–2024) : MMLU (5-shot), GSM8K (8-shot CoT), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- Benchmarks avancés (2024–2026) : MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
- Index chaîné : Nous avons calculé la croissance annuelle au sein de groupes de benchmarks correspondants et les avons chaînés de manière multiplicative à partir d'une base 2023 de 100 pour tracer la tendance cumulative.
Voir la méthodologie pour l'approche de notation et les ventilations par ressource.
LLM résultats de densité d'intelligence
D'ici mi-2026, l'écosystème de l'IA a fourni près de 15× plus d'intelligence par unité de ressource (paramètres et dollars) que la base de 2023. Deux choses à noter en lisant la tendance :
- Le saut 2024–2025 (+362%) surestime le gain réel : Les benchmarks avancés étaient nouveaux en 2024 et un petit nombre de modèles avaient des scores dessus, donc la base 2024 est artificiellement basse. La majeure partie de la « poussée » est due au remplissage du panel, pas à un bond d'efficacité sur un an.
- Le gain 2025–2026 (+105%) est là où se trouve la véritable histoire : Il est mesuré sur bien plus de modèles et il est porté par de petites versions open-weight comme Qwen 3.6-35B-A3B et DeepSeek V4 Flash qui égalent la capacité des modèles fermés de pointe à une fraction de la taille et du coût.
LLM capacité
Le graphique de densité montre l'efficacité. Pour le mettre en contexte, nous avons également mesuré la capacité brute sur la même période : à quel point ces modèles sont-ils devenus plus intelligents avant tout ajustement de ressource ?
Capacité indexée à 100 en 2023, moyennée sur tous les modèles publiés chaque année.
Les axes et l'info-bulle fonctionnent de la même manière que le graphique de densité, l'axe Y suivant la performance brute des benchmarks plutôt que la densité.
Un score de capacité de 100 en 2023 est passé à 468 en 2026, soit une amélioration d'environ 4.7×. Année par année :
- 2024 (+88%) : Progrès rapides sur les benchmarks standard avant leur saturation.
- 2025 (+105%) : Mêmes progrès rapides, mesurés sur les benchmarks avancés plus difficiles qui ont remplacé les standards.
- 2026 (+22%) : Le ralentissement est un signe précoce que les benchmarks avancés commencent eux aussi à saturer.
En mettant les deux graphiques côte à côte :
- La capacité a augmenté de 4.7× tandis que la densité d'intelligence a augmenté de 8.9×.
- Les modèles sont devenus à la fois plus intelligents et plus efficaces. Ils n'ont pas besoin de proportionnellement plus de paramètres, de calcul d'entraînement ou d'argent pour fonctionner.
Notez que : Le chiffre de 4.7× de capacité est un ordre de grandeur crédible. Le chiffre de 8.9× de densité est plus fragile (le groupe avancé de 2024 a moins de points de données, ce qui amplifie le taux de croissance de cette année), donc traitez-le comme un signal directionnel plutôt qu'un multiplicateur précis.
Quel LLM a la plus haute densité d'intelligence ?
La densité d'intelligence dépend de la ressource que nous mesurons et du groupe de benchmarks sur lequel nous notons. Le leader change pour chaque combinaison.
Densité par paramètre actif (open-weight uniquement)
Cette vue mesure l'efficacité avec laquelle un modèle concentre sa capacité dans ses poids. Les paramètres actifs importent car les modèles Mixture-of-Experts (MoE) acheminent chaque token à travers une fraction du total des poids. DeepSeek V3 a 671B paramètres totaux mais 37B actifs par token, et le chiffre de 37B reflète le coût de service effectif.
Leaders des benchmarks standard
- LLaMA 3.1 8B (juil. 2024) : 100.0
- LLaMA 3 8B (avr. 2024) : 85.0
- LLaMA 4 Maverick (avr. 2025) : 55.9
- Mixtral 8x7B (déc. 2023) : 47.4
- Mistral 7B (sept. 2023) : 46.3
Leaders des benchmarks avancés
- Qwen 3.6-35B-A3B (avr. 2026) : 100.0 (3B paramètres actifs ; le score repose sur un seul benchmark, SWE-bench Verified à 73.4%, donc lisez en conséquence)
- GPT-OSS 20B (août 2025) : 85.2 (3.6B paramètres actifs)
- GPT-OSS 120B (août 2025) : 64.4 (5.1B paramètres actifs)
- Qwen 3.5 9B (mars 2026) : 35.2 (9B paramètres denses)
- DeepSeek V4 Flash (avr. 2026) : 26.0
Le classement des benchmarks standard a cessé d'évoluer depuis fin 2024 car les benchmarks ont saturé, pas parce que les progrès se sont arrêtés. GPT-4 a obtenu 90.2 sur les benchmarks standard début 2023 mais 17.3 sur les benchmarks avancés.
Densité par FLOP d'entraînement (open-weight uniquement)
Cette vue récompense la curation des données, les choix d'architecture et les recettes d'entraînement plutôt que les dépenses brutes.
Note : la densité par FLOP sur les benchmarks standard semble diminuer avec le temps. Il s'agit d'un artefact de saturation, pas d'une baisse de l'efficacité d'entraînement. Les anciens benchmarks ne mesurent plus les gains récents, donc les scores de capacité se compressent tandis que le calcul d'entraînement continue de croître.
Leaders des benchmarks standard
- Mistral 7B (sept. 2023) : 100.0 (toujours l'ancre du panel, plus de deux ans après)
- LLaMA 3 8B (avr. 2024) : 40.8
- LLaMA 1 (févr. 2023) : 37.0
- DeepSeek V2 (mai 2024) : 32.6
- Mixtral 8x7B (déc. 2023) : 27.1
Leaders des benchmarks avancés
- Qwen 3.5 9B (mars 2026) : 100.0
- Qwen 3.6-35B-A3B (avr. 2026) : 28.4
- DeepSeek V4 Flash (avr. 2026) : 6.4
Le résultat de Qwen 3.5 (9B) est notable : un modèle dense de 9B entraîné à environ 1.5 × 10²³ FLOP qui obtient un score de 81.2 sur la capacité des benchmarks avancés. Son calcul d'entraînement est environ un ordre de grandeur inférieur à DeepSeek V4 Pro, mais l'écart de capacité est plus faible.
Densité par dollar d'inférence
La densité par dollar est l'axe où les modèles open-weight et fermés de pointe peuvent être comparés directement, car les prix des API sont publiquement vérifiables. Nous utilisons les prix établis pour le titre, donc les baisses post-lancement sont reflétées.
Leaders des benchmarks standard
- Mistral Small 3 24B (janv. 2025) : 100.0 à $0.10 / $0.30 par million de tokens via l'API propriétaire de Mistral
- Gemini 1.5 Flash (mai 2024) : 99.3 (modèle fermé le mieux classé après sa baisse de prix d'août 2024)
- DeepSeek V2 (mai 2024) : 66.0 à $0.27 / $1.10 par million de tokens
- DeepSeek V3 (déc. 2024) : 30.9
- DeepSeek R1 (janv. 2025) : 17.8
Leaders des benchmarks avancés
- GPT-OSS 120B (août 2025) : 100.0 (la référence de prix est la médiane cross-provider d'OpenRouter, car OpenAI n'a pas hébergé le modèle sur une API propriétaire)
- GPT-OSS 20B (août 2025) : 80.0
- DeepSeek V4 Flash (avr. 2026) : 44.0 à $0.06 / $0.42 par million de tokens via l'API propriétaire de DeepSeek
- DeepSeek V3.2 (déc. 2025) : 22.5
- Mistral Small 3 24B (janv. 2025) : 20.9
- DeepSeek V4 Pro (avr. 2026) : 16.0 à $0.54 mixte, avec 97.8 de capacité sur les benchmarks avancés. Cela place V4 Pro à 2.2 points de capacité de Claude Opus 4.7 pour environ 1/18e du prix mixte ($0.54 contre $10.00).
L'écart avec le front fermé ne s'est pas réduit
Les modèles de raisonnement fermés d'Anthropic, OpenAI et Google se regroupent entre 0 et 6 sur la densité par dollar des benchmarks avancés tout au long de la période du panel. GPT-4 en mars 2023 a obtenu 0.0. Claude Opus 4.7 en avril 2026 a obtenu 0.9.
Les laboratoires fermés ont réduit les prix absolus :
- Claude Opus est passé de $30 à $10 par million de tokens entre Opus 4 et Opus 4.5.
- Le o3 d'OpenAI est passé de $10/$40 au lancement à $2/$8 stabilisé.
- Gemini 1.5 Flash a baissé d'environ 78%.
Mais l'écart relatif avec les leaders de densité open-weight est resté d'environ 30 à 50× sur la période. DeepSeek a été tarifé autour de $0.18 par million en 2024 (V2) et autour de $0.18 par million en 2026 (V4 Flash). Le plancher de prix open-weight n'a pas bougé, et le plancher fermé de pointe n'a pas suffisamment bougé pour combler l'écart. La concurrence sur les prix se fait sur le niveau de la génération précédente, où les anciens modèles fermés sont maintenus en vie comme alternatives bon marché, pas au front.
La nouvelle direction : les benchmarks agentiques
Les benchmarks avancés utilisés pour mesurer la performance de l'IA commencent à perdre de leur efficacité, comme les anciennes suites de test qu'ils ont remplacées. Les laboratoires ont commencé à publier des benchmarks agentiques (SWE-Bench Pro, SWE-bench Verified, Terminal-Bench, OSWorld-Verified, Finance Agent) au lieu des anciens tests de raisonnement. Nous avons commencé à construire un panel pour suivre ce changement.
Par exemple, le modèle de pointe le plus récent, Claude Opus 4.8, rapporte ses résultats presque entièrement sur ces benchmarks LLM agentiques, sans scores sur les benchmarks de raisonnement que notre panel principal suit.
Taux de résolution SWE-Bench Pro par date de sortie, évalué sur le harnais standardisé SEAL de Scale. Parmi les modèles tracés :
- Les meilleurs performeurs fermés : Claude Fable 5 (80.3%),Claude Opus 4.5 (45.9%), Claude Sonnet 4.5 (43.6%), et Gemini 3 Pro Preview (43.3%).
- Les meilleurs performeurs ouverts : GLM 5.2 (62.1%), Qwen3-Coder-480B-A35B (38.7%), Kimi K2 Instruct (27.7%), et Qwen3-235B-A22B (21.4%).
Explorez les benchmarks agentiques en consultant les benchmarks de codage agentique, la recherche agentique, et la surveillance agentique.
Défis de la comparaison des performances agentiques
L'évaluation et la comparaison des résultats des benchmarks agentiques présentent plusieurs difficultés clés :
- Focus sur les métriques de capacité : Nous pouvons afficher les scores de capacité, car les données de ressources nécessaires pour mesurer la densité (nombre de paramètres, calcul d'entraînement et prix vérifié par modèle) restent incomplètes ou non divulguées par les laboratoires fermés.
- Sensibilité au niveau système : Les scores de benchmark mesurent l'ensemble du système, pas seulement le modèle d'IA. Comme les scores dépendent fortement du « scaffolding » (le framework logiciel environnant), le même modèle peut donner des résultats très différents selon le harnais agentique spécifique utilisé.
- Protocole de standardisation : Pour assurer une comparaison équitable, ce rapport trace exclusivement les données SWE-Bench Pro provenant d'un environnement standardisé unique (le leaderboard SEAL de Scale). Les autres scores rapportés par les laboratoires utilisent des harnais différents et ne sont pas directement comparables.
- Exclusion de Claude Opus 4.8 : Bien qu'Opus 4.8 auto-déclare un record de 69.2% sur SWE-Bench Pro, il a été testé sur le harnais interne d'Anthropic et n'a pas encore été évalué par le SEAL de Scale. Pour maintenir une stricte cohérence des données, nous notons son score ici plutôt que de le tracer.
SWE-Bench Pro du harnais standardisé SEAL de Scale. Les autres colonnes sont rapportées par les laboratoires sur des harnais variés et ne sont pas directement comparables entre les lignes. Les tirets signifient qu'aucun score vérifié n'a été trouvé.
Ces trois modèles ont été exécutés sur le harnais mini-swe-agent, ils sont donc exclus du graphique en nuage de points pour le garder comparable.
Méthodologie de la densité d'intelligence
Couverture du panel
- Modèles : 71 LLMs publiés de février 2023 à avril 2026. 37 modèles ont des scores sur les benchmarks standard et 54 sur les benchmarks avancés. Les modèles sans un groupe de benchmarks complet sont exclus des calculs de densité de ce groupe.
- Benchmarks : 10 benchmarks publics, tous rapportés par les laboratoires et traçables à une source primaire. Nous n'avons réexécuté aucun benchmark.
- Ressources : Pour chaque modèle, nous avons divisé son score de capacité par trois ressources indépendamment :
- Paramètres actifs : Un proxy pour la mémoire et le coût de service. Limité aux modèles open-weight, car les laboratoires fermés (OpenAI, Anthropic, Google) ne divulguent pas le nombre de paramètres.
- Calcul d'entraînement (FLOP) : Un proxy pour l'efficacité d'entraînement. Également limité aux modèles open-weight. Les chiffres FLOP sont principalement des estimations d'Epoch IA et doivent être lus comme directionnels.
- Prix d'inférence : Le prix qu'un acheteur paie réellement à l'API. La capacité est divisée par le prix mixte par million de tokens à un ratio d'entrée/sortie de 3:1. Les modèles ouverts et fermés participent, car les prix des API sont publiquement vérifiables.
Pourquoi deux groupes de benchmarks ?
Les modèles publiés en 2024 ont saturé les benchmarks standard que les laboratoires d'IA utilisaient depuis 2020. Une fois que les modèles de pointe atteignent 90% ou plus sur un benchmark, le test ne sépare plus les modèles forts des plus forts. Les laboratoires ont répondu en introduisant des benchmarks plus difficiles.
Nous traitons ce changement comme une rupture nette pour deux raisons :
- Premièrement, mélanger des benchmarks faciles et difficiles dans un seul score de capacité permettrait à un score saturé sur un benchmark facile de masquer un score faible sur un difficile. Un modèle qui obtient 85 sur MMLU-Pro est plus fort qu'un qui obtient 85 sur MMLU. Traiter les deux comme équivalents compresse la plage des scores et récompense les anciens benchmarks.
- Deuxièmement, les deux suites ont des distributions de scores différentes : les benchmarks standard se regroupent en haut (la plupart des modèles de pointe au-dessus de 85), tandis que les benchmarks avancés ont une dispersion plus large (les meilleurs modèles autour de 90, le milieu autour de 50, les modèles plus faibles en dessous de 30). Calculer des scores Z sur les deux en même temps fausserait l'estimation de la variance.
Nous calculons la capacité pour chaque groupe indépendamment :
- Benchmarks standard (2023–2024) : MMLU (5-shot), GSM8K (8-shot chaîne de pensée), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- Benchmarks avancés (2024–2026) : MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
Un score de 90 sur les benchmarks standard n'est pas équivalent à 90 sur les benchmarks avancés. Pour tout modèle publié à partir de fin 2024, les benchmarks avancés sont la référence pertinente.
Formule de capacité
Pour chaque benchmark b et chaque modèle m :
Nous utilisons l'écart-type de la population (divise par N, pas N−1). Cela correspond au calcul pandas original avec ddof=0 et garantit que l'ajout d'un seul nouveau modèle ne modifie pas rétroactivement l'estimation de la variance.
Nous moyennons ensuite les scores Z disponibles par modèle dans chaque groupe de benchmarks et remettons à l'échelle min-max sur un score de 0–100 relatif au panel.
Formule de densité
Pour chaque vue de densité :
Le dénominateur change selon la vue : paramètres actifs en milliards, FLOP d'entraînement divisé par 10²⁴, ou prix mixte par million de tokens.
Méthodologie de l'indice chaîné
Les deux graphiques d'indice en haut de l'article (Densité d'intelligence et Capacité) montrent une croissance cumulative en une seule ligne indexée à 100 en 2023, sur le modèle du rendement cumulé du S&P 500. Nous chaînons les taux de croissance annuels à travers la transition des benchmarks plutôt que de tracer des valeurs absolues.
Étape 1. Calculer la moyenne annuelle de la métrique pour chaque groupe de benchmarks :
Pour l'Indice de densité d'intelligence, la métrique est la moyenne par ligne des trois scores de densité par modèle (Densité combinée A ou B). Pour l'Indice de capacité, la métrique est le score de capacité relatif au panel (Capacité_A ou Capacité_B).
Étape 2. Pour chaque transition d'une année à l'autre, calculer la croissance au sein d'un seul groupe de benchmarks. Les deux années doivent provenir du même groupe :
Étape 3. Chaîner de manière multiplicative à partir d'une base 2023 de 100 :
Sélection du groupe par transition :
- 2023 – 2024 : Benchmarks standard (Avancé a 1 modèle en 2023, trop peu pour calculer une moyenne stable)
- 2024 – 2025 : Benchmarks avancés (Standard saturé fin 2024 ; Avancé a 16 modèles en 2024 et 27 en 2025)
- 2025 – 2026 : Benchmarks avancés (Standard non rapporté pour 2026)
L'indice chaîné suppose que les populations sous-jacentes sont comparables d'une année à l'autre au sein d'un groupe. Notre panel est hétérogène (modèles différents chaque année, avec une couverture de benchmarks différente), donc les valeurs chaînées sont à lire comme un résumé directionnel plutôt qu'un multiplicateur précis.
Principes d'évaluation fondamentaux pour la mesure de la densité d'intelligence
- Benchmarks standard de l'industrie : Nous n'introduisons aucun benchmark personnalisé.
- Sourcing de source primaire : Chaque score de benchmark est traçable au papier de sortie du modèle, à la carte de modèle ou à l'annonce officielle. Lorsque la source primaire n'a pas rapporté un benchmark, la cellule est laissée vide plutôt qu'imputée.
- Indicateurs de couverture (N) : Pour chaque modèle, nous indiquons le nombre de benchmarks contribuant à son score de capacité dans chaque groupe. Les modèles avec N=1 reçoivent un score plus bruité que ceux avec N=5. Le cas N=1 s'applique à Qwen 3.6 35B A3B (SWE-bench Verified uniquement) et à quelques versions phares fermées de 2026.
Sources de prix pour les modèles fermés
La tarification est la partie la plus sensible à la cohorte de l'indice. Nous utilisons la hiérarchie suivante :
- Annonce de lancement du laboratoire (préférée) : Prix cité dans le post de lancement du laboratoire, la documentation de l'API, ou la couverture médiatique contemporaine.
- Médiane cross-provider d'Artificial Analysis (solution de repli pour les modèles weights-only) : Utilisée pour trois lignes Llama 3.1 (8B, 70B, 405B) et les lignes GPT-OSS, car aucune API propriétaire n'existe.
- Weights-only sans couverture : 22 lignes sur 69 n'ont pas de prix par dollar enregistré. Elles apparaissent dans les graphiques de capacité et par paramètre mais sont absentes des graphiques par dollar.
Nous suivons deux pistes de prix : le prix de lancement (prix propriétaire le jour de la sortie) et le prix établi (prix propriétaire actuel, ou le dernier avant dépréciation). Six modèles du panel ont été retarifés après le lancement :
- Gemini 1.5 Pro : $3.50/$10.50 à $1.25/$5.00 (octobre 2024)
- GPT-4o : $5.00/$15.00 à $2.50/$10.00 (octobre 2024)
- Gemini 1.5 Flash : $0.35/$1.05 à $0.075/$0.30 (août 2024)
- Claude 3.5 Haiku : $1.00/$5.00 à $0.80/$4.00 (décembre 2024)
- o3 : $10.00/$40.00 à $2.00/$8.00 (juin 2025)
La densité par dollar du titre utilise la tarification établie. Pour 37 des 43 lignes tarifées, les prix de lancement et établis sont identiques.
Cadence de mise à jour
Nous rafraîchissons l'indice mensuellement. Chaque rafraîchissement ajoute de nouvelles lignes de modèles pour toute version phare ou notable du mois précédent, met à jour les prix lorsque les laboratoires ont ajusté leurs tarifs, remplit les nouveaux benchmarks rapportés pour les lignes existantes et recalcule les scores Z sur l'ensemble du panel. Les nouvelles entrées de modèles déplacent la moyenne et l'écart-type de chaque benchmark, donc les scores 0–100 existants évoluent avec le panel. Les instantanés historiques sont préservés.
Limitations de l'évaluation de la densité d'intelligence
- Optimisme rapporté par les laboratoires : Les scores de benchmark proviennent des laboratoires eux-mêmes. Les réexécutions indépendantes sont généralement inférieures de 5 à 13 points. Les lignes de tendance sont informatives sur le plan directionnel mais pas précises au point près.
- Modes de raisonnement et non-raisonnement non séparés : Les modèles publiés en 2025 et 2026 prennent en charge des bascules de pensée étendue qui peuvent modifier les scores en mathématiques et en codage de 5 à 15 points. Nous utilisons les scores en mode par défaut lorsqu'ils sont identifiables.
- Les chiffres de FLOP d'entraînement sont principalement des estimations : Une poignée de lignes ont des FLOP confirmés par le laboratoire. Le reste est extrapolé à partir des paramètres divulgués et des tokens d'entraînement, principalement via Epoch IA.
- Nombre de paramètres des modèles fermés inconnu : La densité par paramètre et par FLOP est vide pour les lignes fermées de pointe. Les modèles fermés ne participent qu'à la densité par dollar.
- Scores relatifs au panel : Les scores de densité sont remis à l'échelle min-max à l'intérieur du panel. Un nouveau modèle avec un ratio brut plus élevé déplace le score 0–100 de chaque modèle existant. Pour comparer les versions du panel, utilisez les ratios bruts sous-jacents plutôt que les scores remis à l'échelle.
Qu'est-ce que la densité d'intelligence ?
La densité d'intelligence représente une nouvelle métrique pour évaluer la quantité de connaissances et de capacité de raisonnement qu'un modèle peut concentrer dans une seule unité de mémoire ou de calcul. Elle mesure l'architecture du modèle en évaluant l'efficacité avec laquelle il utilise chaque paramètre pour générer de la valeur.
Dans ce cadre, l'axe des x représente souvent le nombre de paramètres du modèle tandis que l'axe des y suit les performances sur des tâches difficiles. Une densité élevée se produit lorsque les modèles démontrent des capacités supérieures sans nécessiter le coût computationnel massif associé à des modèles plus grands. Ce processus prouve que l'intelligence ne dépend pas uniquement de la quantité de données ou de l'échelle de l'entraînement, mais plutôt de la manière dont les logiciels et les algorithmes organisent ces informations.
Auparavant, la communauté de l'IA s'était appuyée sur la mise à l'échelle des paramètres du modèle pour atteindre des performances plus élevées, ce qui a abouti à des systèmes massifs et gourmands en ressources. Avec ce changement d'orientation, l'optimisation algorithmique est prioritaire sur le volume brut pour produire plus d'intelligence à partir de modèles plus petits.
Pourquoi est-il important de mesurer la densité d'intelligence ?
Les systèmes efficaces doivent optimiser le temps d'inférence et l'utilisation de la mémoire. Identifier le point où des tokens supplémentaires ou du calcul supplémentaire n'apportent plus de gains significatifs aide l'industrie à comprendre les limites supérieures des grands modèles de langage actuels. Les principales raisons de mesurer la densité d'intelligence peuvent se résumer ainsi :
- La communauté de l'IA sous-estime les frais généraux à long terme de la maintenance de modèles surdimensionnés dans les centres de données.
- La création de valeur dans les applications pratiques dépend du ratio entre la qualité de sortie et la puissance nécessaire pour la produire.
- La loi de Moore pour le matériel ne peut pas soutenir la croissance des modèles de langage sans progrès correspondants dans la manière de les optimiser.
- L'apprentissage par renforcement et une meilleure distribution des données permettent aux outils de nouvelle génération d'atteindre des benchmarks autrefois réservés aux humains. En savoir plus sur l'apprentissage par renforcement et d'autres techniques de fine-tuning de LLM.
Bien que les modèles plus grands comptent encore pour explorer de nouvelles frontières, la densité d'un système détermine son utilité réelle dans le monde réel. Ce contexte aide à considérer l'intelligence comme un résultat concentré de l'entraînement plutôt que comme un sous-produit de la taille brute.
Pour aller plus loin
La densité d'intelligence est une façon de comparer les LLMs. D'autres dimensions sont couvertes dans des analyses séparées :
- Benchmarks de latence : Pour le temps jusqu'au premier token et les tokens par seconde, voir notre benchmark de latence LLM.
- Benchmarks par tâche : Pour le raisonnement financier, voir notre benchmark LLM financier. Pour le codage, voir notre benchmark de codage IA.
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{simsek2026,
author = {Şimşek, Hazal},
title = {{Densité d'intelligence de 71 LLMs: modèles plus intelligents et plus denses}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/intelligence-density}},
note = {AIMultiple. Consulté le 7 Juillet 2026}
}Résultats et horodatages de 69 points de données. Téléchargez les données utilisées dans cet article sous forme de fichier ZIP contenant un fichier CSV et un README.
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.