Certains LLMs, comme la gamme OpenAI GPT-5, existent en différentes versions (par exemple, GPT-5, GPT-5-mini et GPT-5-nano) et avec divers réglages de paramètres, notamment haut, moyen, bas et minimal.
Ci-dessous, nous explorons les différences entre ces versions de model en rassemblant leurs performances benchmark et les coûts d’exécution des benchmarks.
Prix vs. réussite : points clés à retenir
Nous avons utilisé la famille GPT-5 dans notre analyse. Nous avons utilisé six benchmarks couvrant divers domaines, notamment le raisonnement, le codage, le suivi d’instructions et les mathématiques.
Notre analyse a révélé :
- En moyenne sur l’ensemble des benchmarks, GPT-5 (high) et GPT-5 (medium) obtiennent des taux de réussite presque identiques (65 % vs. 64 %), alors que GPT-5 (high) coûte presque deux fois plus cher ($511 vs. $280). Ils sont suivis par GPT-5-mini (high), GPT-5 (low) et GPT-5-mini (medium), avec des taux de réussite respectifs de 62 %, 61 % et 60 %, à des prix bien inférieurs de $105, $90 et $28. Cela montre qu’en acceptant une baisse d’environ ~5 % du taux de réussite seulement, les tâches peuvent être accomplies à un coût jusqu’à 18 fois inférieur en passant de GPT-5 (high) à GPT-5-mini (medium).
- GPT-5-mini (high) surpasse GPT-5 (low) dans presque tous les benchmarks, et ce au même coût ou à un coût inférieur. Dans IFBench, les taux de réussite sont de 75 % vs. 67 % ; dans AIME 2025, de 97 % vs. 83 % ; dans Humanity’s Last Exam, de 20 % vs. 18 % ; et dans GPQA Diamond, de 83 % vs. 81 %. Ils sont à égalité sur SciCode à 39 %, mais GPT-5-mini (high) reste tout de même moins coûteux.
- Le model le plus cher, GPT-5 (high), ne surpasse le deuxième meilleur que sur trois benchmarks, et même dans ce cas, l’écart ne dépasse pas 3 %. Dans tous les autres benchmarks, il est surpassé par des alternatives moins chères.
Paramètres haut-moyen-bas-minimal
Bien que les paramètres LLM soient souvent décrits en termes d’ajustements numériques, ils peuvent aussi être exprimés sous forme de plages qualitatives telles que haut, moyen et bas. Ces plages ne sont pas des normes fixes ; ce sont plutôt des catégories conceptuelles qui décrivent l’influence qu’un paramètre exerce sur la sortie du model.
Utiliser ces trois niveaux aide à sélectionner rapidement des réglages pour différentes tâches, selon le niveau souhaité de créativité, de déterminisme ou de longueur. Ces niveaux sont utiles lors de l’ajustement des paramètres top-P, max tokens et de pénalité.
Le paramètre moyen fait référence à la version standard (non paramétrée) d’un model.
Réglage minimal :
- Top-p / Top-k : Très bas (top-p ≈ 0.1–0.2, top-k = 1–5)
- Max tokens : Limite courte
- Pénalités : Très faibles ou nulles
- Effets :
- Hautement déterministe, sorties presque identiques à chaque fois.
- Très concis, factuel et rigide.
- Idéal pour le code, les mathématiques, les requêtes de base de données ou les réponses de conformité strictes.
- Très contraint, avec une faible part d’aléatoire, favorisant la prévisibilité et la précision.
Réglage bas :
- Top-p / Top-k : Bas (top-p ≈ 0.3–0.5, top-k = 5–10)
- Max tokens : Court à moyen
- Pénalités : Faibles à modérées
- Effets :
- Essentiellement déterministe mais autorise de légères variations.
- Réduit la répétition robotique par rapport au réglage minimal.
- Convient aux résumés, aux explications structurées ou à la rédaction professionnelle au style cohérent.
Réglage moyen :
- Top-p / Top-k : Modéré (top-p ≈ 0.7–0.9, top-k = 20–50)
- Max tokens : Longueur moyenne
- Pénalités : Modérées, pour éviter la répétition tout en autorisant une certaine créativité
- Effets :
- Équilibré entre précision et créativité.
- Produit des réponses naturelles qui varient légèrement d’une exécution à l’autre.
- Convient aux questions-réponses générales, à la rédaction et au brainstorming.
Réglage haut :
- Top-p / Top-k : Haut (top-p ≈ 0.95–1.0, top-k = 50–100)
- Max tokens : Limite élevée pour des sorties plus longues
- Pénalités : Moyennes à élevées, favorisant la variété et la nouveauté
- Effets :
- Sorties hautement créatives et diversifiées.
- Moins prévisible, avec un risque plus élevé d’hallucinations.
- Idéal pour la narration, l’idéation, les jeux de rôle et l’écriture créative.
Pour décider quel niveau utiliser, tenez compte des éléments suivants :
- Type/objet de la tâche : Si vous avez besoin de précision, choisissez minimal ou moyen. Si vous avez besoin de créativité, de voix, de nouveauté, le réglage haut peut être préférable.
- Tolérance aux erreurs : Les bizarreries ou erreurs occasionnelles sont-elles graves ? Si la tolérance est faible, évitez un niveau d’aléatoire élevé.
- Contraintes de calcul : Des sorties longues et un aléatoire élevé exigent souvent plus de calcul et de mémoire.
- Taille du model : Les models plus grands gèrent généralement mieux un aléatoire élevé, tandis que les models plus petits peuvent se dégrader fortement avec des réglages hauts.
- Longueur de sortie souhaitée : Un texte généré plus long peut dériver, donc un aléatoire élevé associé à une sortie longue est plus risqué.
GPT-5
GPT-5 équilibre une capacité de raisonnement plus élevée avec une vitesse moyenne, ce qui le rend adapté aux tâches complexes en plusieurs étapes où la précision et l’adaptabilité sont cruciales.
- Fenêtre de contexte : 400 000
- Max tokens en sortie : 128 000
- Date limite des connaissances : 30 septembre 2024
- Raisonnement : Plus élevé, avec prise en charge des tokens de raisonnement
Tarification (par 1M tokens)
- Entrée : $1,25
- Entrée en cache : $0,125
- Sortie : $10,00
Modalités
- Texte : entrée et sortie
- Image : entrée uniquement
- Audio : non pris en charge
GPT-5 mini
GPT-5 mini est une version plus petite, plus rapide et plus abordable de GPT-5. Il conserve une forte capacité de raisonnement tout en étant mieux adapté aux tâches bien définies.
- Fenêtre de contexte : 400 000
- Max tokens en sortie : 128 000
- Date limite des connaissances : 31 mai 2024
- Fonctionnalités : Prend en charge la recherche web, la recherche de fichiers et l’interpréteur de code.
Tarification par 1M tokens :
- Entrée : $0,25
- Entrée en cache : $0,025
- Sortie : $2,00
GPT-5 nano
GPT-5 nano est l’option la plus rapide et la moins chère, conçue pour des tâches légères telles que la classification et la synthèse.
- Fenêtre de contexte : 400 000
- Max tokens en sortie : 128 000
- Date limite des connaissances : 31 mai 2024
- Fonctionnalités : Prend en charge la recherche de fichiers, la génération d’images et l’interpréteur de code (mais pas la recherche web).
Tarification par 1M tokens :
- Entrée : $0,05
- Entrée en cache : $0,005
- Sortie : $0,40
Fonctionnalités de la série GPT-5
La série GPT-5 introduit plusieurs capacités qui améliorent le contrôle, le formatage et l’efficacité. Ces fonctionnalités s’appliquent à GPT-5, GPT-5 Mini et GPT-5 Nano.
Paramètre de verbosité
Le paramètre de verbosité permet aux développeurs d’influencer le niveau de détail des sorties du model sans modifier le prompt.
Il accepte trois valeurs :
- Bas : résultats courts et concis
- Moyen : résultats équilibrés (par défaut)
- Haut : sorties détaillées adaptées à l’explication, à la documentation ou à la révision
Une verbosité plus élevée entraîne des réponses plus longues et une plus grande consommation de tokens de sortie.
Appel de fonction libre
La série GPT-5 prend en charge des appels d’outils personnalisés qui acceptent une sortie en texte brut au lieu de JSON structuré. Cela permet de générer du code, des requêtes SQL ou du texte de configuration transmis directement à des environnements d’exécution externes tels que :
- Bacs à sable de code
- SQL moteurs
- Environnements shell
- Systèmes de configuration
Le type d’outil personnalisé ne prend pas en charge les appels d’outils parallèles. Il est destiné aux situations où le texte naturel est préférable à un schéma JSON strict.
Prise en charge de la grammaire gratuit de contexte (CFG)
Les models peuvent produire du texte contraint par une grammaire définie avec la syntaxe Lark ou regex. Cela garantit que le texte généré respecte des règles structurelles strictes. Les cas d’usage courants incluent :
- Appliquer des dialectes SQL spécifiques
- Restreindre les horodatages ou les identifiants
- Valider les formats de configuration
Lors de l’utilisation des CFG, les développeurs définissent des terminaux et des règles qui décrivent l’ensemble des chaînes acceptables. Le model ne produit que des sorties conformes à ces règles.
Mode de raisonnement minimal
Le mode de raisonnement minimal réduit ou supprime les tokens de raisonnement. Cela réduit la latence et améliore le délai avant le premier token.
Il convient aux tâches telles que :
- Classification
- Réécritures courtes
- Extraction structurée
- Opérations de formatage de base
Lorsqu’aucun réglage de raisonnement n’est fourni, le niveau d’effort par défaut est moyen.
Différences clés
Les trois models diffèrent principalement par la profondeur de raisonnement, la vitesse et le coût. Les nouvelles fonctionnalités peuvent être utilisées avec tous les models, mais leur impact varie selon le model.
Raisonnement
- GPT-5 offre la capacité de raisonnement la plus forte. Il est adapté aux problèmes complexes en plusieurs étapes dans le codage, l’analyse scientifique ou l’aide à la décision.
- GPT-5 mini offre un raisonnement solide pour des prompts structurés avec des limites de tâches prévisibles.
- GPT-5 nano a des performances de raisonnement modérées et fonctionne mieux sur les tâches qui ne nécessitent pas d’analyse approfondie.
- Le mode de raisonnement minimal peut être utilisé avec tous les models et offre le plus grand avantage pour GPT-5 nano et GPT-5 mini, compte tenu de leur avantage en vitesse.
Vitesse
- GPT-5 nano est l’option la plus rapide et est efficace pour les charges de travail en temps réel ou à grande échelle.
- GPT-5 mini équilibre vitesse et raisonnement, ce qui le rend adapté aux charges de travail de production courantes.
- GPT-5 est plus lent car il effectue davantage de raisonnement interne, mais cela se traduit par une sortie plus précise.
- Le mode de raisonnement minimal peut réduire encore la latence, en particulier pour nano.
Coût
- GPT-5 nano a le coût par token le plus bas. Il est privilégié pour les tâches à volume élevé telles que la classification par lots ou la synthèse.
- GPT-5 mini se situe dans le milieu de gamme, offrant un équilibre entre capacité et coût.
- GPT-5 est le model le plus cher et est généralement utilisé lorsque la précision et la cohérence sont prioritaires.
- Les réglages de verbosité influencent le coût car une verbosité plus élevée produit davantage de tokens de sortie.
Que sont les paramètres LLM ?
Les paramètres LLM sont des réglages qui influencent la façon dont les large language models (LLMs) génèrent du texte pendant l’inference. Ces commandes de paramètres ne modifient pas les poids appris d’un model pré-entraîné. Au lieu de cela, elles déterminent comment le language model échantillonne à partir d’une distribution de probabilité sur les tokens probables lors de la génération des réponses.
Les large language models sont des systèmes de réseaux de neurones, généralement construits sur l’architecture du model transformer. Pendant l’entraînement, le model apprend des valeurs numériques appelées poids et biais. Les poids représentent l’importance attribuée aux différentes entrées, ce qui permet au model de capturer les relations entre les mots, les concepts et le contexte. Les biais sont des valeurs constantes ajoutées dans les couches qui aident à activer les neurones dans certaines conditions. Together, ces valeurs définissent la capacité du model à reconnaître des motifs complexes dans le langage.
Les paramètres d’inference, en revanche, opèrent après l’entraînement. Ils déterminent comment les connaissances apprises du model sont utilisées, sans modifier les poids sous-jacents. Ajuster les paramètres LLM permet aux utilisateurs d’influencer la diversité, la prévisibilité, la répétition et la longueur des sorties, ce qui est essentiel pour optimiser les performances des models dans des tâches spécifiques telles que l’écriture créative, la génération structurée ou les explications techniques.
Les paramètres clés incluent l’échantillonnage par noyau top-p, max tokens, la pénalité de fréquence, la pénalité de présence et les séquences d’arrêt. Together, ces paramètres d’échantillonnage contrôlent la sortie générée tout en équilibrant la qualité de la sortie, le coût de calcul et l’efficacité de l’inference.
Taille du model, paramètres et fondamentaux de l’entraînement
Le nombre de paramètres dans les large language models peut atteindre des milliards. Les models plus grands ont généralement une plus grande capacité à gérer un langage nuancé, les dépendances à longue portée et un raisonnement complexe. Cette amélioration des performances des models a un coût : des besoins en puissance de calcul plus élevés pendant l’entraînement et l’inference.
Les models plus petits nécessitent moins de ressources de calcul et offrent une meilleure efficacité de calcul, mais ils peuvent avoir du mal avec des motifs plus complexes ou des fenêtres de contexte plus longues. Choisir entre des models plus grands et des models plus petits dépend de la tâche, de la latence acceptable et de l’infrastructure disponible.
Plusieurs paramètres d’entraînement déterminent la façon dont un model apprend avant l’inference :
- Taille de lot fait référence au nombre d’échantillons d’entraînement traités avant que le model ne mette à jour ses poids. Des tailles de lot plus grandes améliorent l’efficacité de l’entraînement mais augmentent l’utilisation de la mémoire.
- Taux d’apprentissage contrôle la rapidité avec laquelle le model ajuste ses poids et biais. Des valeurs plus élevées accélèrent l’apprentissage mais risquent l’instabilité, tandis que des valeurs plus faibles favorisent une convergence régulière.
- Hyperparamètres définissent des réglages externes tels que la taille du model, la taille de lot et le taux d’apprentissage, façonnant ainsi le processus global d’entraînement.
Après le pré-entraînement, le fine-tuning et l’alignement sont essentiels. Le fine-tuning adapte un model pré-entraîné à des données ou des tâches spécifiques à un domaine, tandis que l’alignement garantit que le texte généré reflète l’intention humaine.
Le fine-tuning efficace en paramètres (PEFT) améliore l’efficacité de calcul en gelant la plupart des paramètres et en ne mettant à jour qu’un petit sous-ensemble de paramètres pertinents pour la tâche.
Échantillonnage top-p
L’échantillonnage top-p, également appelé échantillonnage par noyau, limite la sélection des tokens au plus petit groupe dont la probabilité cumulée dépasse un seuil donné p. Au lieu de sélectionner parmi un nombre fixe de tokens, le model choisit dynamiquement parmi les tokens probables qui représentent ensemble la masse de probabilité spécifiée.
- Valeurs plus basses (par exemple, p = 0.5) restreignent l’échantillonnage à un ensemble étroit de tokens de probabilité élevée, ce qui produit un texte cohérent mais moins varié.
- Valeurs plus élevées (par exemple, p = 0.9) permettent d’échantillonner à partir d’un ensemble plus large, augmentant la diversité des sorties mais aussi le risque de dérive hors sujet.
Échantillonnage top k
L’échantillonnage top k limite le choix du model aux k tokens de probabilité les plus élevés pour l’étape suivante de la génération de texte. En réduisant l’ensemble de candidats, ce paramètre affecte directement la prévisibilité et la variété.
- Valeurs top-k plus basses limitent la sélection à un petit ensemble de tokens très probables, produisant des sorties plus prévisibles et ciblées.
- Valeurs plus élevées élargissent le bassin de candidats, augmentant la variabilité et favorisant un langage plus diversifié.
Alors que l’échantillonnage top-p s’adapte dynamiquement en fonction de la masse de probabilité, l’échantillonnage top-k utilise un seuil fixe. Les deux sont souvent comparés lors de l’évaluation des models pour déterminer les réglages optimaux pour des tâches spécifiques.
Max tokens (le nombre de tokens)
Le paramètre max_tokens définit le nombre maximal de tokens que le model peut générer en une seule réponse. Il détermine directement la longueur de la sortie et influence le coût de calcul.
- Des valeurs maximales plus basses imposent des réponses concises mais peuvent couper des détails importants.
- Des valeurs plus élevées permettent des explications plus détaillées mais nécessitent davantage de ressources de calcul et augmentent le temps d’inference.
Le nombre maximal de tokens est limité par la fenêtre de contexte, qui inclut à la fois les données d’entrée et la sortie générée. Si le nombre total de tokens dépasse la limite de tokens du model, la génération s’arrêtera quel que soit le réglage de max tokens.
Paramètre de pénalité de fréquence
La pénalité de fréquence ajuste la probabilité des tokens en fonction de leur fréquence d’apparition dans le texte déjà généré.
- Valeurs positives réduisent la répétition, améliorant la qualité des sorties dans les réponses plus longues.
- Valeurs négatives encouragent la réutilisation, ce qui peut être utile pour les documents nécessitant une terminologie cohérente.
Des pénalités excessivement élevées peuvent nuire à la cohérence, car la répétition naturelle est souvent nécessaire pour un texte semblable à celui d’un humain. Ce paramètre est le plus efficace lors de l’optimisation des performances des models pour la génération de textes longs.
Pénalité de présence
La pénalité de présence réduit la probabilité des tokens qui sont déjà apparus au moins une fois, quelle que soit leur fréquence. Cela encourage le model à introduire de nouvelles idées.
- Valeurs positives favorisent la nouveauté et l’exploration, ce qui est utile pour le brainstorming et l’écriture créative.
- Valeurs négatives renforcent les termes existants, ce qui peut aider dans les sorties structurées ou contraintes.
La pénalité de présence est un outil précieux pour guider la diversité des idées, mais elle doit être appliquée avec soin pour éviter un évitement artificiel des termes clés.
Séquences d’arrêt
Les séquences d’arrêt définissent des tokens ou des chaînes spécifiques qui indiquent au model d’arrêter la génération. Elles sont couramment utilisées dans les applications structurées.
- Utiles pour imposer des modèles dans les systèmes de dialogue ou la génération de code.
- Aident à contrôler la longueur de la sortie et à prévenir les continuations non pertinentes.
Les séquences d’arrêt améliorent la prévisibilité des sorties de texte généré sans dépendre uniquement des limites de tokens.
Graine et déterminisme
Certains systèmes permettent aux utilisateurs de spécifier une graine aléatoire, garantissant que les mêmes données d’entrée et les mêmes réglages de paramètres produisent la même sortie générée.
- Utile pour l’évaluation et le test des models.
- Aide à comparer différentes configurations de paramètres sans que la variation aléatoire n’affecte les résultats.
La génération déterministe favorise la reproductibilité, bien que les sorties exactes puissent encore varier selon les différents models d’IA ou environnements de déploiement.
Différences entre les paramètres clés
Comprendre en quoi les paramètres clés diffèrent aide à ajuster les paramètres LLM pour des résultats optimaux.
- Pénalité de fréquence vs pénalité de présence : La pénalité de fréquence dépend de la fréquence d’apparition d’un token, tandis que la pénalité de présence s’applique une fois après la première apparition d’un token.
- Échantillonnage top k vs top p : Top k limite la sélection à un nombre fixe de tokens, tandis que top p sélectionne dynamiquement les tokens en fonction de la probabilité cumulée.
- Max tokens vs fenêtre de contexte : Max tokens plafonne la longueur de sortie, tandis que la fenêtre de contexte est une limite supérieure fixe couvrant à la fois les tokens d’entrée et de sortie.
Un réglage minutieux de ces paramètres permet aux praticiens d’équilibrer la qualité de la sortie, l’efficacité de calcul et les performances LLM dans des applications telles que la génération augmentée de récupération, les tâches analytiques et la génération de texte ouverte.
Citer cette recherche
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{ermut2026,
author = {Ermut, Sıla and Alper, Şevval},
title = {{LLM Paramètres: GPT-5 High, Moyen, Bas et Minimal}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/llm-parameters}},
note = {AIMultiple. Consulté le 21 août 2026}
}Résultats et horodatages de 3 points de données. Téléchargez les données de synthèse présentées dans les graphiques et les tableaux de cet article sous forme de fichier ZIP contenant un fichier CSV.
Vous voulez les données détaillées derrière ? Rejoindre Premium
Journal des modifications
2 mises à jourLa section "Que sont les paramètres LLM ?" a été étendue avec des détails sur la taille du modèle, les fondamentaux de l'entraînement et l'échantillonnage top k.
Suppression du paramètre de température de la liste des paramètres clés.
Elle a précédemment travaillé comme recruteuse dans des cabinets de gestion de projet et de conseil. Sıla est titulaire d’un master en psychologie sociale et d’une licence en relations internationales.
Şevval se concentre sur les outils de codage IA, les agents IA et les technologies quantiques.
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.