J'ai passé les 20 dernières années à me concentrer sur l'optimisation des performances de calcul au niveau système. Nous avons évalué les derniers NVIDIA GPUs, y compris les NVIDIA H100, H200 et B200, et l'AMD MI300X, pour une analyse de mise à l'échelle de la concurrence. En utilisant le framework vLLM avec le gpt-oss-20b model, nous avons testé la manière dont ces GPUs gèrent les requêtes simultanées, de 1 à 512. En mesurant le débit de sortie du système, la vitesse de sortie par requête et la latence de bout en bout, nous partageons des résultats pour aider à comprendre les performances des GPU pour les charges de travail d'IA.
Résultats du benchmark de concurrence
Débit de sortie du système vs concurrence
Ce graphique montre le nombre total de tokens de sortie générés par seconde par le système à chaque niveau de concurrence.
Vitesse de sortie par requête vs concurrence
Cette métrique illustre la vitesse à laquelle une requête individuelle est traitée (en tokens par seconde) à mesure que le système devient plus chargé. Elle est calculée sur la base de la latence de bout en bout pour une sortie de 1 000 tokens.
Latence de bout en bout vs concurrence
Ce graphique affiche le temps moyen (en millisecondes) nécessaire pour traiter une requête du début à la fin à différents niveaux de concurrence.
Tokens par seconde par dollar vs concurrence
Ce graphique évalue l'efficacité des coûts de chaque GPU en mesurant combien de tokens sont générés par seconde pour chaque dollar dépensé en location horaire. Cette métrique est cruciale pour comprendre le retour sur investissement de chaque option matérielle, en particulier pour les déploiements soucieux de leur budget.
Remarque : Les prix sont basés sur les tarifs horaires à la demande de la plateforme cloud Runpod en date de mars 2026. Les prix sont susceptibles de changer et peuvent varier en fonction de la disponibilité et du type d'instance.
Vous pouvez en savoir plus sur notre méthodologie de benchmark de concurrence.
Qu'est-ce que la concurrence ?
La concurrence fait référence à la capacité d'un GPU à traiter plusieurs requêtes simultanément, un facteur clé pour les charges de travail d'IA telles que l'inference de large language model. Dans notre évaluation des performances, les niveaux de concurrence représentent le nombre de requêtes simultanées (de 1 à 512) envoyées au GPU pendant les tests. Une concurrence plus élevée teste la capacité du GPU à gérer des tâches parallèles sans dégrader les performances, en équilibrant débit et latence.
Comprendre la concurrence aide les utilisateurs à déterminer le bon GPU pour les charges de travail dont la demande varie ou pour les besoins de traitement par lots. Lors de l'exécution de tests graphiques ou de suites de benchmarks GPU, les performances de concurrence peuvent varier considérablement d'un GPU à l'autre, ce qui rend essentiel pour les consommateurs et les acheteurs de comparer les résultats des tests entre différentes configurations système et à différents niveaux de prix.
Qu'est-ce que vLLM ?
vLLM est une bibliothèque open source rapide et facile à utiliser pour l'inference et le serving de large language model (LLM), soutenue par une communauté de contributeurs. Il gère à la fois les déploiements cloud et auto-hébergés LLM en gérant la mémoire, en traitant les requêtes simultanées et en servant des models comme gpt-oss-20b efficacement. Pour les LLMs auto-hébergés, vLLM simplifie le déploiement avec des fonctionnalités telles que PagedAttention1 pour la gestion de la mémoire, le batching continu et la prise en charge des NVIDIA et des AMD GPUs, permettant plusieurs requêtes simultanées sur le matériel local.
Méthodologie du benchmark de concurrence
Nous avons testé les dernières architectures GPU haute performance de NVIDIA et d'AMD pour évaluer leurs capacités de mise à l'échelle de la concurrence pour les charges de travail d'inference IA. Notre benchmark a testé les NVIDIA H100, H200 et B200 GPUs aux côtés de l'AMD MI300X, en exécutant le OpenAI gpt-oss-20b model via vLLM dans des conditions de charge simultanée variables. Grâce à la mesure des métriques de débit, des distributions de latence et des modèles d'utilisation des ressources, cette analyse vise à fournir des informations pour les déploiements d'inference IA.
Infrastructure de test
Nous avons déployé nos tests sur l'infrastructure cloud de Runpod, en utilisant les architectures GPU les plus avancées de NVIDIA et le framework vLLM.
- Plateforme GPU : Infrastructure cloud Runpod (H100, H200, B200 et MI300X)
- Model : OpenAI GPT-OSS-20B via le framework vLLM
Environnement logiciel
Les NVIDIA GPUs (H100, H200, B200) :
- Template RunPod :
runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404 - Installation de vLLM :
vllm[flashinfer]==0.11.0
Le AMD GPU (MI300X) :
- Image Docker :
rocm/vllm-dev:open-mi300-08052025
Configuration du serveur vLLM
Différents paramètres vLLM ont été utilisés pour optimiser les performances de chaque architecture matérielle.
- Pour les NVIDIA H100, H200 et B200 GPUs, le serveur a été lancé avec la commande suivante :
- Pour le AMD MI300X GPU, une build vLLM optimisée pour ROCm a été utilisée avec des paramètres spécifiques à l'architecture :
Remarque : Ce benchmark a été réalisé avec vLLM v0.11.0. vLLM v1.0, publié début 2025, introduit des changements architecturaux susceptibles de produire des résultats de débit différents.
Configuration du benchmark
Chaque GPU a été testé sur 9 niveaux de concurrence différents avec des paramètres standardisés pour garantir des résultats cohérents.
- Niveaux de concurrence : 1, 4, 8, 16, 32, 64, 128, 256, 512 requêtes simultanées
- Durée du test : phase de mesure de 180 secondes avec 30s de montée en charge/refroidissement
- Taille de la requête : 1 000 tokens d'entrée/sortie par requête
Remarque sur la validation des résultats : Avant d'enregistrer les métriques finales, nous avons exécuté de nombreux tests pour déterminer la configuration optimale de chaque GPU. Une fois identifiée, le benchmark a été exécuté trois fois consécutives pour vérifier la stabilité. Les résultats de débit ont été cohérents entre ces exécutions, avec une variance inférieure à 0.1 %. Les chiffres rapportés dans cette analyse sont basés sur la dernière de ces trois exécutions consécutives.
Métriques clés
Nous avons suivi les performances sur plusieurs dimensions pour fournir une vue complète des capacités du GPU en charge.
- Débit : tokens de sortie du système par seconde, requêtes réussies par seconde et vitesse de génération de tokens par requête individuelle
- Latence : Time to First Token (TTFT), latence de bout en bout avec percentiles P50/P95/P99, latence moyenne par requête
- Fiabilité : pourcentage de taux de réussite, timeouts vs autres classifications d'erreurs
Considérations sur la pile logicielle
La performance n'est pas uniquement fonction du matériel. Les frameworks comme vLLM ont un support plus mature et hautement optimisé pour l'écosystème CUDA de NVIDIA comparé au ROCm d'AMD. Les différences de performance observées dans les résultats du MI300X peuvent refléter en partie l'état actuel de l'optimisation logicielle plutôt que le potentiel théorique du matériel.
Feuille de route du matériel de nouvelle génération
Les GPUs testés dans ce benchmark, le B200, le H200, le H100 et le MI300X, représentent la génération actuelle de matériel d'inference IA. Tant NVIDIA qu'AMD ont annoncé leurs successeurs, ce qui constitue un contexte pertinent pour les équipes qui planifient des investissements d'infrastructure pour 2026 et au-delà.
Du côté de NVIDIA, Jensen Huang a annoncé au CES 2026 que la plateforme Vera Rubin NVL72 est entrée en production complète, les premiers systèmes devant être livrés au second semestre 2026.2 Selon NVIDIA, le Rubin GPU offre environ 50 PFLOPs de performances d'inference FP4, soit environ cinq fois celui des systèmes basés sur Blackwell comme le B200 benchmarké ici.2
Du côté d'AMD, l'Instinct MI400, basé sur l'architecture CDNA 5, est prévu pour 2026 et devrait à peu près doubler les performances de calcul du MI350 tout en introduisant 432 Go de mémoire HBM4.3 AMD a également annoncé que Meta déploiera des serveurs Instinct personnalisés basés sur MI450 à une capacité allant jusqu'à 6 gigawatts, avec des livraisons commençant au second semestre 2026.4 Oracle proposera en outre un supercluster d'IA accessible au public alimenté par environ 50 000 GPUs de la série MI450 à partir du troisième trimestre 2026.5
Pour les équipes qui évaluent les GPUs de ce benchmark pour des déploiements à court terme, le B200 et le MI300X restent les options les plus performantes actuellement disponibles. Pour des horizons de planification plus longs, la feuille de route 2026 suggère un changement d'échelle significatif à la fois en débit et en efficacité des coûts de la part des deux fournisseurs.
Conclusion
Le B200 est en tête en matière de débit et évolue bien pour l'inference par lots. Le MI300X offre les temps de réponse les plus rapides à faible concurrence, ce qui le rend plus adapté aux applications en temps réel comme les chatbots. Le H100 et le H200 se situent entre les deux, couvrant les charges de travail généralistes sans exceller dans l'une ou l'autre dimension.
Le compromis fondamental est le même sur tout le matériel : une concurrence plus élevée augmente le débit du système mais augmente la latence par requête. Choisissez en fonction de ce que votre charge de travail privilégie : le volume ou le temps de réponse.
Pour aller plus loin
Explorez d'autres recherches sur le matériel d'IA, telles que :
- Top 20 fabricants de puces d'IA : NVIDIA et ses concurrents
- Les GPUs cloud pour le deep learning : disponibilité et prix/performance
- Les 10 meilleurs clouds GPU serverless et les 14 GPUs rentables
- Multi-GPU Benchmark
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{dogan2026,
author = {Dogan, Sedat and Sarı, Ekrem},
title = {{GPU Benchmark de concurrence: H100 vs H200 vs B200 vs MI300X}},
year = {2026},
month = mar,
howpublished = {\url{https://aimultiple.com/gpu-benchmark}},
note = {AIMultiple. Consulté le 12 Mars 2026}
}Journal des modifications
4 mises à jour- 2026
La section « Défis et limites des tests de concurrence » a été supprimée.
- 2025
La section de conclusion a été remplacée.
Ajout de l'AMD MI300X à la liste des GPU benchmarkés.
La section de la méthodologie de référence de concurrence a été étendue pour inclure le GPU MI300X d'AMD.
Liens de référence
- A 20 ans d’expérience en tant que hacker white-hat et gourou du développement, avec une expertise approfondie des langages de programmation et des architectures de serveurs.
- Est conseiller d’administration auprès d’un VC qui investit dans des entreprises technologiques en phase de démarrage et chez Ödeal, une plateforme de paiement numérique régionale servant 125 000 commerçants.
- A dirigé l’infrastructure technologique et la cybersécurité de sept élections nationales, et a été reconnu au Hall of Fame de la cybersécurité par des leaders technologiques mondiaux dont Twitter.
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.