J'ai passé les 20 dernières années à me concentrer sur l'optimisation des performances informatiques au niveau système. Nous avons évalué les derniers NVIDIA GPUs, y compris les NVIDIA H100, H200 et B200, et le AMD MI300X, pour une analyse de la scalabilité concurrentielle. En utilisant le framework vLLM avec le gpt-oss-20b model, nous avons testé comment ces GPUs gèrent les requêtes concurrentes, de 1 à 512. En mesurant le débit de sortie du système, la vitesse de sortie par requête et la latence de bout en bout, nous partageons les résultats pour aider à comprendre les performances des GPUs pour les charges de travail d'IA.
Résultats du benchmark de concurrence
Débit de sortie système vs concurrence
Ce graphique montre le nombre total de tokens de sortie générés par seconde par le système à chaque niveau de concurrence.
Vitesse de sortie par requête vs concurrence
Cette métrique illustre la vitesse à laquelle une requête individuelle est traitée (en tokens par seconde) à mesure que le système devient plus chargé. Elle est calculée sur la base de la latence de bout en bout pour une sortie de 1 000 tokens.
Latence de bout en bout vs concurrence
Ce graphique affiche le temps moyen (en millisecondes) nécessaire pour terminer une requête du début à la fin à différents niveaux de concurrence.
Tokens par seconde par dollar vs. Concurrence
Ce graphique évalue l'efficacité-coût de chaque GPU en mesurant le nombre de tokens générés par seconde pour chaque dollar dépensé en location horaire. Cette métrique est cruciale pour comprendre le retour sur investissement de chaque option matérielle, en particulier pour les déploiements soucieux des coûts.
Note : La tarification est basée sur les tarifs horaires à la demande de la plateforme cloud Runpod en date de mars 2026. Les prix sont sujets à modification et peuvent varier en fonction de la disponibilité et du type d'instance.
Vous pouvez en savoir plus sur notre méthodologie de benchmark de concurrence.
Qu'est-ce que la concurrence ?
La concurrence fait référence à la capacité d'un GPU à traiter plusieurs requêtes simultanément, un facteur clé pour les charges de travail d'IA telles que l'inférence de grands modèles de langage. Dans notre évaluation des performances, les niveaux de concurrence représentent le nombre de requêtes simultanées (de 1 à 512) envoyées au GPU pendant les sessions de test. Une concurrence plus élevée met à l'épreuve la capacité du GPU à gérer des tâches parallèles sans dégrader les performances, en équilibrant le débit et la latence.
Comprendre la concurrence aide les utilisateurs à déterminer le GPU approprié pour des charges de travail avec une demande variable ou des besoins de traitement par lots. Lors de l'exécution de tests graphiques ou de suites de benchmarks GPU, les performances de concurrence peuvent différer considérablement entre les GPUs, ce qui rend essentiel pour les consommateurs et les acheteurs de comparer les résultats des tests à travers différentes configurations système et points de prix.
Qu'est-ce que vLLM ?
vLLM est une bibliothèque open source rapide et facile à utiliser pour l'inférence et le service de grands modèles de langage (LLM), soutenue par une communauté de contributeurs. Elle gère à la fois les déploiements cloud et auto-hébergés de LLM en gérant la mémoire, en traitant les requêtes concurrentes et en servant efficacement des modèles comme gpt-oss-20b. Pour les LLMs auto-hébergés, vLLM simplifie le déploiement avec des fonctionnalités telles que PagedAttention1 pour la gestion de la mémoire, le traitement par lots continu et la prise en charge des GPUs NVIDIA et AMD, permettant de traiter plusieurs requêtes simultanées sur du matériel local.
Méthodologie du benchmark de concurrence
Nous avons testé les dernières architectures de GPU haute performance de NVIDIA et AMD pour évaluer leurs capacités de mise à l'échelle de la concurrence pour les charges de travail d'inférence d'IA. Notre benchmark a testé les GPUs NVIDIA H100, H200 et B200 ainsi que le MI300X de AMD, en exécutant le OpenAI gpt-oss-20b model via vLLM dans des conditions de charge concurrente variables. En mesurant les métriques de débit, les distributions de latence et les schémas d'utilisation des ressources, cette analyse vise à fournir des informations pour les déploiements d'inférence d'IA.
Infrastructure de test
Nous avons déployé nos tests sur l'infrastructure cloud de Runpod, en utilisant les architectures de GPU les plus avancées de NVIDIA et le framework vLLM.
- Plateforme GPU : infrastructure cloud Runpod (H100, H200, B200 et MI300X)
- Modèle : OpenAI GPT-OSS-20B via le framework vLLM
Environnement logiciel
NVIDIA GPUs (H100, H200, B200):
- RunPod template:
runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404 - vLLM installation:
vllm[flashinfer]==0.11.0
AMD GPU (MI300X):
- Docker image:
rocm/vllm-dev:open-mi300-08052025
Configuration du serveur vLLM
Différents paramètres vLLM ont été utilisés pour optimiser les performances de chaque architecture matérielle.
- Pour les NVIDIA H100, H200 et B200 GPUs, le serveur a été lancé avec la commande suivante :
- Pour le AMD MI300X GPU, une version vLLM optimisée pour ROCm a été utilisée avec des paramètres spécifiques pour l'architecture :
Note : Ce benchmark a été réalisé en utilisant vLLM v0.11.0. vLLM v1.0, publié début 2025, introduit des changements architecturaux qui peuvent produire des résultats de débit différents.
Configuration du benchmark
Chaque GPU a été testé sur 9 niveaux de concurrence différents avec des paramètres standardisés pour garantir des résultats cohérents.
- Niveaux de concurrence : 1, 4, 8, 16, 32, 64, 128, 256, 512 requêtes concurrentes
- Durée du test : phase de mesure de 180 secondes avec 30s de montée en charge/refroidissement
- Taille de la requête : 1 000 tokens d'entrée/sortie par requête
Note sur la validation des résultats : Avant d'enregistrer les métriques finales, nous avons effectué de nombreux tests pour déterminer la configuration optimale pour chaque GPU. Une fois identifiée, le benchmark a été exécuté trois fois consécutives pour vérifier la stabilité. Les résultats de débit étaient cohérents sur ces exécutions, avec une variance inférieure à 0,1 %. Les chiffres rapportés dans cette analyse sont basés sur la dernière de ces trois exécutions consécutives.
Métriques clés
Nous avons suivi les performances selon plusieurs dimensions pour fournir une vue complète des capacités des GPUs sous charge.
- Débit : tokens de sortie système par seconde, requêtes réussies par seconde et vitesse de génération de tokens par requête individuelle
- Latence : temps jusqu'au premier token (TTFT), latence de bout en bout avec les percentiles P50/P95/P99, latence moyenne par requête
- Fiabilité : pourcentage de taux de réussite, délai d'attente vs autre classification d'erreurs
Considérations de la pile logicielle
Les performances ne dépendent pas uniquement du matériel. Des frameworks comme vLLM bénéficient d'un support plus mature et hautement optimisé pour l'écosystème CUDA de NVIDIA par rapport à ROCm de AMD. Les différences de performances observées dans les résultats du MI300X peuvent refléter en partie l'état actuel de l'optimisation logicielle plutôt que le potentiel théorique du matériel.
Feuille de route du matériel de nouvelle génération
Les GPUs testés dans ce benchmark, le B200, le H200, le H100 et le MI300X, représentent la génération actuelle de matériel d'inférence d'IA. NVIDIA et AMD ont tous deux annoncé leurs successeurs, ce qui constitue un contexte pertinent pour les équipes qui planifient des investissements d'infrastructure pour 2026 et au-delà.
Du côté de NVIDIA, Jensen Huang a annoncé au CES 2026 que la plateforme Vera Rubin NVL72 est entrée en production complète, les premiers systèmes devant être livrés au second semestre 2026.2 Selon NVIDIA, le GPU Rubin délivre environ 50 PFLOPs de performance d'inférence FP4, soit environ cinq fois celle des systèmes basés sur Blackwell comme le B200 testé ici.2
Du côté de AMD, l'Instinct MI400, basé sur l'architecture CDNA 5, est prévu pour 2026 et devrait à peu près doubler les performances de calcul du MI350 tout en introduisant 432 Go de mémoire HBM4.3 AMD a également annoncé que Meta déploiera des serveurs Instinct personnalisés basés sur MI450 avec une capacité allant jusqu'à 6 gigawatts, les livraisons commençant au second semestre 2026.4 Oracle proposera en plus un supercluster d'IA accessible au public, alimenté par environ 50 000 GPUs de la série MI450, à partir du troisième trimestre 2026.5
Pour les équipes qui évaluent les GPUs de ce benchmark pour des déploiements à court terme, le B200 et le MI300X restent les options les plus performantes actuellement disponibles. Pour des horizons de planification plus longs, la feuille de route 2026 suggère un changement de palier significatif en termes de débit et d'efficacité économique de la part des deux fournisseurs.
Conclusion
Le B200 domine en termes de débit et s'adapte bien à l'inférence par lots. Le MI300X offre les temps de réponse les plus rapides à faible concurrence, ce qui en fait un meilleur choix pour les applications en temps réel comme les chatbots. Les H100 et H200 se situent entre les deux, couvrant des charges de travail polyvalentes sans exceller dans aucune des deux dimensions.
Le compromis fondamental reste le même pour tout le matériel : une concurrence plus élevée augmente le débit du système mais augmente la latence par requête. Choisissez en fonction de si votre charge de travail privilégie le volume ou le temps de réponse.
Pour en savoir plus
Explorez d'autres recherches sur le matériel d'IA, telles que :
- Top 20 fabricants de puces d'IA : NVIDIA & ses concurrents
- Cloud GPUs pour le Deep Learning : Disponibilité & Prix / Performance
- Meilleurs 10 clouds Serverless GPU & 14 GPUs rentables
- Multi-GPU Benchmark
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{dogan2026,
author = {Dogan, Sedat and Sarı, Ekrem},
title = {{GPU Benchmark de concurrence: H100 vs H200 vs B200 vs MI300X}},
year = {2026},
month = mar,
howpublished = {\url{https://aimultiple.com/gpu-benchmark}},
note = {AIMultiple. Consulté le 12 Mars 2026}
}
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.