Servizi
Contattaci

GPU Benchmark di concorrenza: H100 vs H200 vs B200 vs MI300X

Sedat Dogan
Sedat Dogan
aggiornato il 12 mar. 2026

Ho trascorso gli ultimi 20 anni concentrandomi sull'ottimizzazione delle prestazioni computazionali a livello di sistema. Abbiamo sottoposto a benchmark le più recenti NVIDIA GPU, tra cui la NVIDIA H100, H200 e B200, e la AMD MI300X, per l'analisi della scalabilità della concorrenza. Utilizzando il framework vLLM con il gpt-oss-20b model, abbiamo testato come queste GPU gestiscono richieste concorrenti, da 1 a 512. Misurando il throughput dell'output di sistema, la velocità di output per query e la latenza end-to-end, condividiamo i risultati per aiutare a comprendere le prestazioni delle GPU per i carichi di lavoro IA.

Risultati del benchmark di concorrenza

Throughput di output di sistema vs concorrenza

Loading Chart

Questo grafico mostra il numero totale di token di output generati al secondo dal sistema a ogni livello di concorrenza.

Velocità di output per query vs concorrenza

Questa metrica illustra quanto velocemente viene elaborata una singola query (in token al secondo) man mano che il sistema diventa più carico. Viene calcolata in base alla latenza end-to-end per un output di 1.000 token.

Latenza end-to-end vs concorrenza

Questo grafico mostra il tempo medio (in millisecondi) necessario per completare una richiesta dall'inizio alla fine a diversi livelli di concorrenza.

Tokens per second per dollar vs. Concorrenza

Questo grafico valuta l'efficienza in termini di costo di ciascuna GPU misurando quanti token vengono generati al secondo per ogni dollaro speso per il noleggio orario. Questa metrica è fondamentale per comprendere il ritorno sull'investimento per ogni opzione hardware, specialmente per implementazioni attente al budget.

Nota: i prezzi si basano sulle tariffe orarie on-demand della piattaforma cloud Runpod a partire da marzo 2026. I prezzi sono soggetti a variazioni e possono variare in base alla disponibilità e al tipo di istanza.

Puoi leggere di più sulla nostra metodologia del benchmark di concorrenza.

Che cos'è la concorrenza?

La concorrenza si riferisce alla capacità di una GPU di elaborare più richieste contemporaneamente, un fattore chiave per i carichi di lavoro IA come l'inferenza di large language model. Nella nostra valutazione delle prestazioni, i livelli di concorrenza rappresentano il numero di richieste simultanee (da 1 a 512) inviate alla GPU durante le esecuzioni di test. Una concorrenza più elevata mette alla prova la capacità della GPU di gestire attività parallele senza degradare le prestazioni, bilanciando throughput e latenza.

Comprendere la concorrenza aiuta gli utenti a determinare la GPU giusta per carichi di lavoro con domanda variabile o esigenze di elaborazione batch. Quando si eseguono test grafici o suite di benchmark per GPU, le prestazioni in termini di concorrenza possono differire significativamente tra le GPU, rendendo essenziale per consumatori e acquirenti confrontare i risultati dei test tra diverse configurazioni di sistema e fasce di prezzo.

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Che cos'è vLLM?

vLLM è una libreria open-source veloce e facile da usare per l'inferenza e il serving di large language model (LLM), supportata da una comunità di contributori. Gestisce implementazioni sia cloud sia self-hosted LLM gestendo la memoria, elaborando richieste concorrenti e servendo model come gpt-oss-20b in modo efficiente. Per i self-hosted LLM, vLLM semplifica l'implementazione con funzionalità come PagedAttention1 per la gestione della memoria, il batching continuo e il supporto sia per le NVIDIA sia per le AMD GPU, consentendo più richieste concorrenti su hardware locale.

Metodologia del benchmark di concorrenza

Abbiamo testato le più recenti architetture GPU ad alte prestazioni sia di NVIDIA sia di AMD per valutarne le capacità di scalabilità della concorrenza per carichi di lavoro di inferenza IA. Il nostro benchmark ha testato la NVIDIA H100, H200 e B200 GPU insieme alla AMD MI300X, eseguendo il OpenAI gpt-oss-20b model tramite vLLM in condizioni di carico concorrente variabili. Attraverso la misurazione delle metriche di throughput, delle distribuzioni di latenza e dei modelli di utilizzo delle risorse, questa analisi mira a fornire indicazioni per implementazioni di inferenza IA.

Infrastruttura di test

Abbiamo distribuito i nostri test sull'infrastruttura cloud di Runpod, utilizzando le più avanzate architetture NVIDIA GPU e il framework vLLM.

  • Piattaforma GPU: infrastruttura cloud Runpod (H100, H200, B200 e MI300X)
  • Model: OpenAI GPT-OSS-20B tramite il framework vLLM

Ambiente software

NVIDIA GPU (H100, H200, B200):

  • Modello RunPod: runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404
  • Installazione di vLLM: vllm[flashinfer]==0.11.0

AMD GPU (MI300X):

  • Immagine Docker: rocm/vllm-dev:open-mi300-08052025

Configurazione del server vLLM

Sono state utilizzate diverse impostazioni di vLLM per ottimizzare le prestazioni per ciascuna architettura hardware.

  • Per le NVIDIA H100, H200 e B200 GPU, il server è stato avviato con il seguente comando:
  • Per la AMD MI300X GPU, è stata utilizzata una build di vLLM ottimizzata per ROCm con impostazioni specifiche per l'architettura:

Nota: questo benchmark è stato condotto utilizzando vLLM v0.11.0. vLLM v1.0, rilasciato all'inizio del 2025, introduce modifiche architetturali che potrebbero produrre risultati di throughput diversi.

Configurazione del benchmark

Ogni GPU è stata testata su 9 diversi livelli di concorrenza con parametri standardizzati per garantire risultati coerenti.

  • Livelli di concorrenza: 1, 4, 8, 16, 32, 64, 128, 256, 512 richieste concorrenti
  • Durata del test: 180 secondi di fase di misurazione con 30s di ramp-up/cool-down
  • Dimensione della richiesta: 1.000 token di input/output per richiesta

Nota sulla validazione dei risultati: Prima di registrare le metriche finali, abbiamo eseguito numerosi test per determinare la configurazione ottimale per ciascuna GPU. Una volta identificata, il benchmark è stato eseguito tre volte consecutive per verificarne la stabilità. I risultati di throughput sono stati coerenti tra queste esecuzioni, con una varianza inferiore allo 0.1%. I dati riportati in questa analisi si basano sull'ultima di queste tre esecuzioni consecutive.

Metriche chiave

Abbiamo monitorato le prestazioni su più dimensioni per fornire una visione completa delle capacità delle GPU sotto carico.

  • Throughput: token di output di sistema al secondo, richieste andate a buon fine al secondo e velocità di generazione dei token per singola richiesta
  • Latenza: Time to First Token (TTFT), latenza end-to-end con percentili P50/P95/P99, latenza media per richiesta
  • Affidabilità: percentuale di tasso di successo, timeout rispetto ad altre classificazioni di errore

Considerazioni sullo stack software

Le prestazioni non dipendono esclusivamente dall'hardware. Framework come vLLM hanno un supporto più maturo e altamente ottimizzato per l'ecosistema CUDA di NVIDIA rispetto al ROCm di AMD. Le differenze di prestazioni osservate nei risultati della MI300X potrebbero riflettere in parte lo stato attuale dell'ottimizzazione software piuttosto che il potenziale teorico dell'hardware.

Non perderti i nostri benchmark e approfondimenti basati sui dati. Il pulsante apre Google; selezionare AIMultiple conferma che desideri vedere AIMultiple più spesso nei risultati di ricerca di Google.
GoogleAggiungi come fonte preferita

Roadmap hardware di prossima generazione

Le GPU testate in questo benchmark, la B200, H200, H100 e MI300X, rappresentano l'attuale generazione di hardware per l'inferenza IA. Sia NVIDIA sia AMD hanno annunciato i loro successori, un contesto rilevante per i team che pianificano investimenti in infrastrutture per il 2026 e oltre.

Dal lato NVIDIA, Jensen Huang ha annunciato al CES 2026 che la piattaforma Vera Rubin NVL72 è entrata in piena produzione, con i primi sistemi che dovrebbero essere spediti nella seconda metà del 2026.2 Secondo NVIDIA, la GPU Rubin offre circa 50 PFLOP di prestazioni di inferenza FP4, circa cinque volte quelle dei sistemi basati su Blackwell come la B200 qui testata.2

Dal lato AMD, l'Instinct MI400, basato sull'architettura CDNA 5, è previsto per il 2026 e dovrebbe circa raddoppiare le prestazioni di calcolo della MI350, introducendo 432 GB di memoria HBM4.3 AMD ha inoltre annunciato che Meta distribuirà server Instinct personalizzati basati su MI450 con una capacità fino a 6 gigawatt, con spedizioni che inizieranno nella seconda metà del 2026.4 Oracle offrirà inoltre un supercluster IA pubblicamente disponibile alimentato da circa 50.000 GPU della serie MI450 a partire dal terzo trimestre del 2026.5

Per i team che valutano le GPU di questo benchmark per implementazioni a breve termine, la B200 e la MI300X rimangono le opzioni più performanti attualmente disponibili. Per orizzonti di pianificazione più lunghi, la roadmap del 2026 suggerisce un significativo salto di qualità sia in termini di throughput sia di efficienza dei costi da parte di entrambi i fornitori.

Conclusione

La B200 è leader in termini di throughput e scala bene per l'inferenza batch. La MI300X offre i tempi di risposta più rapidi a bassa concorrenza, rendendola più adatta per applicazioni in tempo reale come i chatbot. La H100 e la H200 si collocano nel mezzo, coprendo carichi di lavoro generici senza eccellere in nessuna delle due dimensioni.

Il compromesso fondamentale vale per tutto l'hardware: una concorrenza più elevata aumenta il throughput di sistema ma aumenta la latenza per singola richiesta. Scegli in base a se il tuo carico di lavoro privilegia il volume o il tempo di risposta.

Ulteriori letture

Esplora altre ricerche sull'hardware IA, come ad esempio:

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Sedat Dogan and Ekrem Sarı (2026) - "GPU Benchmark di concorrenza: H100 vs H200 vs B200 vs MI300X". Pubblicato online su AIMultiple.com. Consultato il 12 Marzo 2026, da: https://aimultiple.com/gpu-benchmark [Risorsa online]

Dogan, S., & Sarı, E. (2026, 12 Marzo). GPU Benchmark di concorrenza: H100 vs H200 vs B200 vs MI300X. AIMultiple. https://aimultiple.com/gpu-benchmark

@misc{dogan2026,
  author = {Dogan, Sedat and Sarı, Ekrem},
  title  = {{GPU Benchmark di concorrenza: H100 vs H200 vs B200 vs MI300X}},
  year   = {2026},
  month  = mar,
  howpublished    = {\url{https://aimultiple.com/gpu-benchmark}},
  note   = {AIMultiple. Consultato il 12 Marzo 2026}
}

Registro delle modifiche

4 aggiornamenti
  1. 2026

    Rimossa la sezione 'Sfide e limitazioni nei test di concorrenza'.

  2. 2025

    Sostituita la sezione delle conclusioni.

  3. Aggiunto AMD MI300X all'elenco delle GPU benchmarkate.

  4. Espansa la sezione della metodologia di benchmark di concorrenza per includere la GPU MI300X di AMD.

Sedat Dogan
Sedat Dogan
CTO
Sedat è un leader tecnologico e della sicurezza informatica con 20 anni di esperienza nello sviluppo software, nelle infrastrutture di rete e nella cybersecurity. Sedat:
- Ha 20 anni di esperienza come hacker white-hat e guru dello sviluppo, con una vasta competenza nei linguaggi di programmazione e nelle architetture dei server.
- È consulente del consiglio di amministrazione presso una società di venture capital che investe in aziende tecnologiche in fase iniziale e presso Ödeal, una piattaforma di pagamento digitale regionale che serve 125.000 commercianti.
- Ha guidato l'infrastruttura tecnologica e la cybersecurity di sette elezioni nazionali ed è stato riconosciuto nella Hall of Fame della cybersecurity da leader tecnologici globali tra cui Twitter.
Visualizza il profilo completo
Ricercato da
Ekrem Sarı
Ekrem Sarı
Ricercatore IA
Ekrem è un Ricercatore IA e Data Scientist presso AIMultiple. Progetta ed esegue benchmark pratici per sistemi di IA e LLM.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450