Servizi
Contattaci

GPU Benchmark di concorrenza: H100 vs H200 vs B200 vs MI300X

Sedat Dogan
Sedat Dogan
aggiornato il 12 mar. 2026

Ho trascorso gli ultimi 20 anni concentrandomi sull'ottimizzazione computazionale delle prestazioni a livello di sistema. Abbiamo testato le più recenti NVIDIA GPU, tra cui NVIDIA’s H100, H200 e B200, e AMD’s MI300X, per un'analisi della scalabilità della concorrenza. Utilizzando il framework vLLM con il gpt-oss-20b modello, abbiamo testato come queste GPU gestiscono richieste concorrenti, da 1 a 512. Misurando il throughput di output del sistema, la velocità di output per richiesta e la latenza end-to-end, condividiamo i risultati per aiutare a comprendere le prestazioni delle GPU per i carichi di lavoro IA.

Risultati del benchmark di concorrenza

Throughput di output del sistema vs concorrenza

Loading Chart

Questo grafico mostra il numero totale di token di output generati al secondo dal sistema a ciascun livello di concorrenza.

Velocità di output per richiesta vs concorrenza

Questa metrica illustra quanto velocemente viene elaborata una singola richiesta (in token al secondo) man mano che il sistema diventa più carico. Viene calcolata in base alla latenza end-to-end per un output di 1.000 token.

Latenza end-to-end vs concorrenza

Questo grafico mostra il tempo medio (in millisecondi) necessario per completare una richiesta dall'inizio alla fine a diversi livelli di concorrenza.

Token al secondo per dollaro vs. concorrenza

Questo grafico valuta l'efficienza dei costi di ciascuna GPU misurando quanti token vengono generati al secondo per ogni dollaro speso per il noleggio orario. Questa metrica è fondamentale per comprendere il ritorno sull'investimento per ciascuna opzione hardware, soprattutto per implementazioni attente al budget.

Nota: I prezzi si basano sulle tariffe orarie on-demand della piattaforma cloud Runpod a partire da marzo 2026. I prezzi sono soggetti a modifiche e possono variare in base alla disponibilità e al tipo di istanza.

Puoi leggere di più sulla nostra metodologia di benchmark della concorrenza.

Che cos'è la concorrenza?

La concorrenza si riferisce alla capacità di una GPU di elaborare più richieste simultaneamente, un fattore chiave per i carichi di lavoro IA come l'inferenza di modelli linguistici di grandi dimensioni. Nella nostra valutazione delle prestazioni, i livelli di concorrenza rappresentano il numero di richieste simultanee (da 1 a 512) inviate alla GPU durante le esecuzioni di test. Livelli più alti di concorrenza mettono alla prova la capacità della GPU di gestire compiti paralleli senza degradare le prestazioni, bilanciando throughput e latenza.

Comprendere la concorrenza aiuta gli utenti a determinare la GPU giusta per carichi di lavoro con domanda variabile o esigenze di elaborazione batch. Quando si eseguono test grafici o suite di benchmark GPU, le prestazioni di concorrenza possono differire notevolmente tra le GPU, rendendo essenziale per i consumatori e gli acquirenti confrontare i risultati dei test tra diverse configurazioni di sistema e fasce di prezzo.

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Che cos'è vLLM?

vLLM è una libreria open-source veloce e facile da usare per l'inferenza e il serving di modelli linguistici di grandi dimensioni (LLM), supportata da una comunità di contributori. Gestisce sia implementazioni cloud che LLM self-hosted gestendo la memoria, elaborando richieste concorrenti e servendo modelli come gpt-oss-20b in modo efficiente. Per LLM self-hosted, vLLM semplifica il deployment con funzionalità come PagedAttention1 per la gestione della memoria, il batching continuo e il supporto per NVIDIA e AMD GPU, consentendo molteplici richieste concorrenti su hardware locale.

Metodologia di benchmark della concorrenza

Abbiamo testato le più recenti architetture GPU ad alte prestazioni sia di NVIDIA che di AMD per valutare le loro capacità di scalabilità della concorrenza per carichi di lavoro di inferenza IA. Il nostro benchmark ha testato le NVIDIA H100, H200 e B200 GPU insieme a AMD’s MI300X, eseguendo il OpenAI gpt-oss-20b modello tramite vLLM in condizioni di carico concorrente variabile. Attraverso la misurazione delle metriche di throughput, le distribuzioni di latenza e i modelli di utilizzo delle risorse, questa analisi mira a fornire approfondimenti per le implementazioni di inferenza IA.

Infrastruttura di test

Abbiamo distribuito i nostri test sull'infrastruttura cloud di Runpod, utilizzando le architetture NVIDIA GPU più avanzate e il framework vLLM.

  • Piattaforma GPU: infrastruttura cloud Runpod (H100, H200, B200 e MI300X)
  • Modello: OpenAI GPT-OSS-20B tramite framework vLLM

Ambiente software

NVIDIA GPU (H100, H200, B200):

  • RunPod template: runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404
  • vLLM installation: vllm[flashinfer]==0.11.0

AMD GPU (MI300X):

  • Immagine Docker: rocm/vllm-dev:open-mi300-08052025

Configurazione del server vLLM

Sono state utilizzate diverse impostazioni vLLM per ottimizzare le prestazioni per ciascuna architettura hardware.

  • Per le GPU NVIDIA H100, H200 e B200 GPU, il server è stato avviato con il seguente comando:
  • Per la AMD MI300X GPU, è stata utilizzata una build vLLM ottimizzata per ROCm con impostazioni specifiche per l'architettura:

Nota: Questo benchmark è stato condotto utilizzando vLLM v0.11.0. vLLM v1.0, rilasciato all'inizio del 2025, introduce modifiche architetturali che potrebbero produrre risultati di throughput diversi.

Configurazione del benchmark

Ogni GPU è stata testata su 9 diversi livelli di concorrenza con parametri standardizzati per garantire risultati coerenti.

  • Livelli di concorrenza: 1, 4, 8, 16, 32, 64, 128, 256, 512 richieste concorrenti
  • Durata del test: fase di misurazione di 180 secondi con 30s di riscaldamento/raffreddamento
  • Dimensione della richiesta: 1.000 token di input/output per richiesta

Nota sulla convalida dei risultati: Prima di registrare le metriche finali, abbiamo eseguito numerosi test per determinare la configurazione ottimale per ciascuna GPU. Una volta identificata, il benchmark è stato eseguito tre volte consecutive per verificarne la stabilità. I risultati di throughput sono stati coerenti tra queste esecuzioni, con una varianza inferiore a 0.1%. I valori riportati in questa analisi si basano sull'ultima di queste tre esecuzioni consecutive.

Metriche chiave

Abbiamo monitorato le prestazioni su più dimensioni per fornire una visione completa delle capacità della GPU sotto carico.

  • Throughput: token di output del sistema al secondo, richieste riuscite al secondo e velocità di generazione dei token per richiesta individuale
  • Latenza: tempo al primo token (TTFT), latenza end-to-end con percentili P50/P95/P99, latenza media per richiesta
  • Affidabilità: percentuale di successo, timeout vs. altra classificazione degli errori

Considerazioni sullo stack software

Le prestazioni non sono solo una funzione dell'hardware. Framework come vLLM hanno un supporto più maturo e altamente ottimizzato per l'ecosistema CUDA di NVIDIA rispetto a ROCm di AMD. Le differenze di prestazioni osservate nei risultati MI300X potrebbero in parte riflettere lo stato attuale dell'ottimizzazione software piuttosto che il potenziale teorico dell'hardware.

Non perderti i nostri benchmark e approfondimenti basati sui dati. Il pulsante apre Google; selezionare AIMultiple conferma che desideri vedere AIMultiple più spesso nei risultati di ricerca di Google.
GoogleAggiungi come fonte preferita

Roadmap hardware di prossima generazione

Le GPU testate in questo benchmark, B200, H200, H100 e MI300X, rappresentano l'attuale generazione di hardware per l'inferenza IA. Sia NVIDIA che AMD hanno annunciato i loro successori, il che è un contesto rilevante per i team che pianificano investimenti in infrastrutture per il 2026 e oltre.

Sul versante NVIDIA, Jensen Huang ha annunciato al CES 2026 che la piattaforma Vera Rubin NVL72 è entrata in piena produzione, con i primi sistemi previsti per la spedizione nella seconda metà del 2026.2 Secondo NVIDIA, la GPU Rubin offre circa 50 PFLOP di prestazioni di inferenza FP4, circa cinque volte quelle dei sistemi basati su Blackwell come il B200 testato qui.2

Sul versante AMD, la Instinct MI400, basata sull'architettura CDNA 5, è prevista per il 2026 e si prevede che raddoppi circa le prestazioni di calcolo MI350 introducendo al contempo 432 GB di memoria HBM4.3 AMD ha anche annunciato che Meta distribuirà server Instinct personalizzati basati su MI450 con una capacità fino a 6 gigawatt, con spedizioni a partire dalla seconda metà del 2026.4 Oracle offrirà inoltre un supercluster IA pubblicamente disponibile alimentato da circa 50.000 GPU della serie MI450 a partire dal Q3 2026.5

Per i team che valutano le GPU di questo benchmark per implementazioni a breve termine, B200 e MI300X rimangono le opzioni con le prestazioni più elevate attualmente disponibili. Per orizzonti di pianificazione più lunghi, la roadmap del 2026 suggerisce un significativo cambiamento di passo sia nel throughput che nell'efficienza dei costi da entrambi i fornitori.

Conclusione

Il B200 guida nel throughput e scala bene per l'inferenza batch. Il MI300X offre i tempi di risposta più rapidi a bassa concorrenza, rendendolo più adatto per applicazioni in tempo reale come i chatbot. L'H100 e l'H200 si collocano nel mezzo, coprendo carichi di lavoro generici senza eccellere in nessuna delle due dimensioni.

Il compromesso fondamentale vale per tutto l'hardware: una maggiore concorrenza aumenta il throughput del sistema ma aumenta la latenza per richiesta. Scegli in base a se il tuo carico di lavoro dà priorità al volume o al tempo di risposta.

Ulteriori letture

Esplora altre ricerche sull'hardware IA, come:

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Sedat Dogan and Ekrem Sarı (2026) - "GPU Benchmark di concorrenza: H100 vs H200 vs B200 vs MI300X". Pubblicato online su AIMultiple.com. Consultato il 12 Marzo 2026, da: https://aimultiple.com/gpu-benchmark [Risorsa online]

Dogan, S., & Sarı, E. (2026, 12 Marzo). GPU Benchmark di concorrenza: H100 vs H200 vs B200 vs MI300X. AIMultiple. https://aimultiple.com/gpu-benchmark

@misc{dogan2026,
  author = {Dogan, Sedat and Sarı, Ekrem},
  title  = {{GPU Benchmark di concorrenza: H100 vs H200 vs B200 vs MI300X}},
  year   = {2026},
  month  = mar,
  howpublished    = {\url{https://aimultiple.com/gpu-benchmark}},
  note   = {AIMultiple. Consultato il 12 Marzo 2026}
}
Sedat Dogan
Sedat Dogan
CTO
Sedat è un leader nel settore della tecnologia e della sicurezza informatica, con esperienza nello sviluppo software, nella raccolta di dati web e nella sicurezza informatica. Sedat: - Ha 20 anni di esperienza come hacker etico e guru dello sviluppo, con una vasta competenza nei linguaggi di programmazione e nelle architetture server. - È consulente di dirigenti di alto livello e membri del consiglio di amministrazione di aziende con operazioni tecnologiche ad alto traffico e di importanza critica, come le infrastrutture di pagamento. - Possiede una solida competenza commerciale oltre alla sua competenza tecnica.
Visualizza il profilo completo
Ricercato da
Ekrem Sarı
Ekrem Sarı
Ricercatore AI
Ekrem è Ricercatore AI e analista di dati presso AIMultiple. Progetta ed esegue benchmark pratici per sistemi di AI e LLM.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450