Ho trascorso gli ultimi 20 anni concentrandomi sull'ottimizzazione delle prestazioni computazionali a livello di sistema. Abbiamo testato le più recenti NVIDIA GPU, incluse le NVIDIA H100, H200 e B200 e la AMD MI300X, per l'analisi del ridimensionamento della concorrenza. Utilizzando il framework vLLM con il gpt-oss-20b modello, abbiamo verificato come queste GPU gestiscono le richieste concorrenti, da 1 a 512. Misurando il throughput di output del sistema, la velocità di output per query e la latenza end-to-end, condividiamo i risultati per aiutare a comprendere le prestazioni delle GPU per i carichi di lavoro IA.
Risultati del benchmark di concorrenza
Throughput di output del sistema vs concorrenza
Questo grafico mostra il numero totale di token di output generati al secondo dal sistema a ciascun livello di concorrenza.
Velocità di output per query vs concorrenza
Questa metrica illustra quanto velocemente una singola query viene elaborata (in token al secondo) man mano che il sistema diventa più carico. Viene calcolata in base alla latenza end-to-end per un output di 1,000 token.
Latenza end-to-end vs concorrenza
Questo grafico mostra il tempo medio (in millisecondi) necessario per completare una richiesta dall'inizio alla fine a diversi livelli di concorrenza.
Token al secondo per dollaro vs. Concorrenza
Questo grafico valuta l'efficienza in termini di costo di ciascuna GPU misurando quanti token vengono generati al secondo per ogni dollaro speso per il noleggio orario. Questa metrica è fondamentale per comprendere il ritorno sull'investimento per ciascuna opzione hardware, specialmente per implementazioni attente al budget.
Nota: i prezzi si basano sulle tariffe orarie on-demand della piattaforma cloud Runpod a marzo 2026. I prezzi sono soggetti a variazioni e possono variare in base alla disponibilità e al tipo di istanza.
Puoi leggere di più sulla nostra metodologia di benchmark di concorrenza.
Che cos'è la concorrenza?
La concorrenza si riferisce alla capacità di una GPU di elaborare più richieste simultaneamente, un fattore chiave per i carichi di lavoro IA come l'inferenza di modelli linguistici di grandi dimensioni. Nella nostra valutazione delle prestazioni, i livelli di concorrenza rappresentano il numero di richieste simultanee (da 1 a 512) inviate alla GPU durante i test. Una concorrenza più elevata testa la capacità della GPU di gestire attività parallele senza degradare le prestazioni, bilanciando throughput e latenza.
Comprendere la concorrenza aiuta gli utenti a determinare la GPU giusta per carichi di lavoro con domanda variabile o esigenze di elaborazione batch. Quando si eseguono test grafici o suite di benchmark GPU, le prestazioni di concorrenza possono differire significativamente tra le GPU, rendendo essenziale per consumatori e acquirenti confrontare i risultati dei test tra diverse configurazioni di sistema e fasce di prezzo.
Che cos'è vLLM?
vLLM è una libreria open-source veloce e facile da usare per l'inferenza e il serving di modelli linguistici di grandi dimensioni (LLM), supportata da una comunità di contributori. Gestisce sia implementazioni cloud che self-hosted LLM, gestendo la memoria, elaborando richieste concorrenti e servendo modelli come gpt-oss-20b in modo efficiente. Per LLM self-hosted, vLLM semplifica l'implementazione con funzionalità come PagedAttention1 per la gestione della memoria, il batching continuo e il supporto per GPU sia NVIDIA che AMD, consentendo richieste concorrenti multiple su hardware locale.
Metodologia del benchmark di concorrenza
Abbiamo testato le più recenti architetture GPU ad alte prestazioni sia di NVIDIA che di AMD per valutare le loro capacità di ridimensionamento della concorrenza per carichi di lavoro di inferenza IA. Il nostro benchmark ha testato le GPU NVIDIA H100, H200 e B200 insieme alla AMD MI300X, eseguendo il OpenAI gpt-oss-20b modello tramite vLLM in condizioni di carico concorrente variabili. Attraverso la misurazione delle metriche di throughput, delle distribuzioni di latenza e dei modelli di utilizzo delle risorse, questa analisi mira a fornire approfondimenti per implementazioni di inferenza IA.
Infrastruttura di test
Abbiamo distribuito i nostri test sull'infrastruttura cloud di Runpod, utilizzando le più avanzate architetture GPU di NVIDIA e il framework vLLM.
- GPU platform: infrastruttura cloud Runpod (H100, H200, B200 e MI300X)
- Modello: OpenAI GPT-OSS-20B tramite framework vLLM
Ambiente software
NVIDIA GPU (H100, H200, B200):
- RunPod template:
runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404 - vLLM installation:
vllm[flashinfer]==0.11.0
AMD GPU (MI300X):
- Docker image:
rocm/vllm-dev:open-mi300-08052025
Configurazione del server vLLM
Sono state utilizzate diverse impostazioni di vLLM per ottimizzare le prestazioni per ciascuna architettura hardware.
- Per le NVIDIA H100, H200 e B200 GPU, il server è stato avviato con il seguente comando:
- Per la AMD MI300X GPU, è stata utilizzata una build vLLM ottimizzata per ROCm con impostazioni specifiche per l'architettura:
Nota: questo benchmark è stato condotto utilizzando vLLM v0.11.0. vLLM v1.0, rilasciata all'inizio del 2025, introduce modifiche architetturali che potrebbero produrre risultati di throughput diversi.
Configurazione del benchmark
Ogni GPU è stata testata su 9 diversi livelli di concorrenza con parametri standardizzati per garantire risultati coerenti.
- Livelli di concorrenza: 1, 4, 8, 16, 32, 64, 128, 256, 512 richieste concorrenti
- Durata del test: 180 secondi di fase di misurazione con 30s di ramp-up/cool-down
- Dimensione della richiesta: 1,000 token di input/output per richiesta
Nota sulla validazione dei risultati: Prima di registrare le metriche finali, abbiamo eseguito numerosi test per determinare la configurazione ottimale per ciascuna GPU. Una volta identificata, il benchmark è stato eseguito tre volte consecutive per verificarne la stabilità. I risultati di throughput sono stati coerenti in queste esecuzioni, con una varianza inferiore allo 0.1%. I valori riportati in questa analisi si basano sull'ultima di queste tre esecuzioni consecutive.
Metriche chiave
Abbiamo monitorato le prestazioni su più dimensioni per fornire una visione completa delle capacità della GPU sotto carico.
- Throughput: token di output del sistema al secondo, richieste riuscite al secondo e velocità di generazione token per richiesta individuale
- Latenza: tempo al primo token (TTFT), latenza end-to-end con percentili P50/P95/P99, latenza media per richiesta
- Affidabilità: percentuale di successo, timeout rispetto ad altre classificazioni di errore
Considerazioni sullo stack software
Le prestazioni non sono solo una funzione dell'hardware. Framework come vLLM hanno un supporto più maturo e altamente ottimizzato per l'ecosistema CUDA di NVIDIA rispetto a ROCm di AMD. Le differenze di prestazioni osservate nei risultati MI300X possono in parte riflettere lo stato attuale dell'ottimizzazione software piuttosto che il potenziale teorico dell'hardware.
Roadmap hardware di prossima generazione
Le GPU testate in questo benchmark, B200, H200, H100 e MI300X, rappresentano l'attuale generazione di hardware per inferenza IA. Sia NVIDIA che AMD hanno annunciato i loro successori, un contesto rilevante per i team che pianificano investimenti in infrastrutture per il 2026 e oltre.
Sul fronte NVIDIA, Jensen Huang ha annunciato al CES 2026 che la piattaforma Vera Rubin NVL72 è entrata in piena produzione, con i primi sistemi previsti per la spedizione nella seconda metà del 2026.2 Secondo NVIDIA, la GPU Rubin offre circa 50 PFLOP di prestazioni di inferenza FP4, circa cinque volte quelle dei sistemi basati su Blackwell come il B200 testato qui.3
Sul fronte AMD, l'Instinct MI400, basato sull'architettura CDNA 5, è pianificato per il 2026 e si prevede che raddoppi approssimativamente le prestazioni di calcolo dell'MI350, introducendo 432 GB di memoria HBM4.4 AMD ha anche annunciato che Meta distribuirà server Instinct personalizzati basati su MI450 con capacità fino a 6 gigawatt, con spedizioni a partire dalla seconda metà del 2026.5 Oracle offrirà inoltre un supercluster IA pubblicamente disponibile alimentato da circa 50,000 GPU della serie MI450 a partire dal Q3 2026.6
Per i team che valutano le GPU in questo benchmark per implementazioni a breve termine, B200 e MI300X rimangono le opzioni con le prestazioni più elevate attualmente disponibili. Per orizzonti di pianificazione più lunghi, la roadmap del 2026 suggerisce un significativo cambiamento di passo sia nel throughput che nell'efficienza dei costi da entrambi i fornitori.
Conclusione
Il B200 è leader nel throughput e scala bene per l'inferenza batch. Il MI300X offre i tempi di risposta più rapidi a bassa concorrenza, rendendolo più adatto per applicazioni in tempo reale come i chatbot. L'H100 e l'H200 si collocano nel mezzo, coprendo carichi di lavoro generici senza eccellere in nessuna delle due dimensioni.
Il compromesso fondamentale vale per tutto l'hardware: una maggiore concorrenza aumenta il throughput del sistema ma aumenta la latenza per richiesta. Scegli in base a se il tuo carico di lavoro dà priorità al volume o al tempo di risposta.
Ulteriori letture
Esplora altre ricerche sull'hardware IA, come:
- Top 20 produttori di chip IA: NVIDIA & i suoi concorrenti
- Cloud GPU per Deep Learning: Disponibilità & Prezzo / Prestazioni
- Migliori 10 cloud GPU serverless & 14 GPU convenienti
- Multi-GPU Benchmark
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dogan2026,
author = {Dogan, Sedat and Sarı, Ekrem},
title = {{GPU Benchmark di concorrenza: H100 vs H200 vs B200 vs MI300X}},
year = {2026},
month = mar,
howpublished = {\url{https://aimultiple.com/gpu-benchmark}},
note = {AIMultiple. Consultato il 12 Marzo 2026}
}
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.