I prezzi di listino delle cloud GPU per lo stesso modello possono differire anche di diverse volte da un provider all’altro. Abbiamo raccolto la tariffa più bassa, il provider, l’intervallo di mercato e la mediana per oltre 40 configurazioni di GPU in tutti e tre i livelli di prezzo, più un benchmark di throughput per dollaro su 10 modelli.
Prezzo per throughput delle cloud GPU
Scopri la GPU più conveniente per il tuo carico di lavoro tra 13 provider hyperscaler e neocloud, classificata per throughput per dollaro:
Throughput e prezzi delle GPU cloud
Aggiornato il 27 Luglio 2026
Vast IA
Vast IA
IONOS
Vast IA
Verda
Verda
Verda
Verda
Vast IA
Vast IA
Vast IA
Vast IA
Consulta la metodologia di benchmark delle cloud GPU per i dettagli.
Il modello on-demand è il più semplice: paghi la capacità di calcolo a ore o a secondi, in base all’utilizzo, senza impegni a lungo termine né pagamenti anticipati.
Queste istanze sono consigliate per chi preferisce la flessibilità di una piattaforma cloud GPU senza alcun pagamento anticipato o impegno a lungo termine. Le istanze on-demand sono di solito più costose delle istanze spot, ma garantiscono capacità ininterrotta.
Prezzi on-demand delle cloud GPU
Classifica: Gli sponsor sono in evidenza e collegati in cima alla tabella. Le righe restanti sono ordinate in modo crescente per il prezzo on-demand più basso. L’intervallo mostra la differenza tra il prezzo di listino più basso e quello più alto per lo stesso SKU tra tutti i provider. La mediana è il punto centrale della distribuzione dei prezzi tra tutte le inserzioni per quello SKU e funge da riferimento di mercato equo. I prezzi riflettono l’aggiornamento più recente del catalogo settimanale.
L’on-demand è il modello di noleggio predefinito, paghi a ore, senza impegno, capacità garantita finché mantieni l’istanza in esecuzione. È il livello più costoso ma l’unico senza compromessi.
Prezzi spot delle cloud GPU
Classifica: Le righe sono ordinate per il prezzo spot più basso in ordine crescente. La capacità spot è interrompibile. La mediana è il punto centrale della distribuzione dei prezzi spot per quello SKU.
La capacità spot è interrompibile; il provider può reclamare l’istanza con poco o nessun preavviso, di solito quando la domanda on-demand aumenta. Le tariffe spot sono tipicamente inferiori del 40-64% rispetto all’on-demand dello stesso provider. Utilizza le istanze spot per addestramento con checkpoint, inferenza batch e lavori di valutazione che tollerano riavvii. Evitale per inferenza sensibile alla latenza o servizi a replica singola senza failover.
Prezzi riservati delle cloud GPU (1 anno)
Classifica: Le righe sono ordinate per il prezzo riservato a 1 anno più basso in ordine crescente. Le prenotazioni bloccano la capacità per l’intero periodo. La mediana è il punto centrale della distribuzione dei prezzi riservati per quello SKU.
Le prenotazioni bloccano la capacità per un periodo fisso in cambio di uno sconto rispetto all’on-demand. I contratti annuali di solito costano dal 19 al 57% in meno rispetto al listino on-demand dello stesso provider. In alcuni casi, le tariffe di prenotazione scendono al di sotto di quelle spot, perché il provider che offre la prenotazione isola completamente l’inventario dal mercato spot.
Confronto delle prestazioni tra provider cloud
Lo stesso modello di GPU può offrire prestazioni leggermente diverse a seconda del provider, a causa della scelta della CPU host, del tessuto di rete, della configurazione dei driver e dell’overhead di virtualizzazione. Per quantificare ciò, abbiamo eseguito carichi di lavoro identici di generazione di testo e immagini su AMD MI300X 192GB presso DigitalOcean e Runpod:
Osservazioni chiave:
- Per la generazione di testo, Digital Ocean ha dimostrato un throughput leggermente superiore, elaborando circa lo 0,4% di token al secondo in più.
- Al contrario, per la generazione di immagini, Runpod ha mostrato un vantaggio marginale, elaborando circa lo 0,4% di immagini al secondo in più.
Il divario è abbastanza piccolo da non essere rilevante per la maggior parte dei carichi di lavoro. Per l’inferenza sensibile alla latenza o l’addestramento su larga scala, dove ogni punto percentuale si accumula su milioni di inferenze, esegui un benchmark della configurazione specifica del provider prima di impegnarti in una prenotazione lunga.
Acquistare on-prem o noleggiare nel cloud
Possedere ha senso quando il carico di lavoro è prevedibile, il team ha le competenze operative necessarie e l’utilizzo dell’hardware si mantiene al di sopra del ~70% durante la vita utile della GPU. Per una domanda variabile, picchi di addestramento o esperimenti sui prodotti, il noleggio cloud vince per efficienza del capitale e flessibilità di scalabilità. Il punto di pareggio si colloca all’incirca a 12 mesi di utilizzo: oltre il 70%, la capacità prenotata o di proprietà batte quasi sempre l’on-demand; al di sotto del 50%, lo spot o l’on-demand vincono per flessibilità; la fascia intermedia dipende da quanta interruzione della capacità il tuo carico di lavoro tollera.
Un modello pratico su larga scala: possedere un cluster di base dimensionato per la domanda stazionaria, noleggiare nel cloud per i picchi e il lavoro esplorativo. Meta ha annunciato una partnership pluriennale nel febbraio 2026 per distribuire fino a 6 gigawatt di AMD Instinct GPU, segnalando che anche gli operatori a livello hyperscaler continuano ad espandere la capacità di proprietà pur continuando a consumare GPU cloud per carichi di lavoro variabili.
Le GPU consumer (RTX 4090, RTX 5090) offrono il miglior prezzo per FLOP sulla carta, ma l’EULA di NVIDIA ne vieta l’uso nei data center commerciali. Rimangono utili per workstation individuali e lavori di proof-of-concept, non per la distribuzione in produzione.
Metodologia di benchmark delle cloud GPU
I benchmark di throughput utilizzano la quantizzazione FP a 4 bit in tutti i test. La pipeline esegue:
- Fine-tuning testo: Llama 3.2 sulle prime 5.000 conversazioni di FineTome, 5 epoche, 1M token totali, framework Unsloth. Throughput = (token × epoche) / tempo totale.
- Inferenza testo: 1M token generati con llama-cpp-python.
- Fine-tuning immagini: YOLOv9 su 100 immagini da SkyFusion, 4 epoche, Unsloth.
- Inferenza immagini: YOLOv9 con fine-tuning su ~500 immagini a 640×640.
La metrica throughput per dollaro divide l’output del carico di lavoro per il costo orario dell’istanza. I valori di throughput sono specifici del carico di lavoro e fungono da linee guida relative; lo stesso hardware fornirà un throughput materialmente diverso sul tuo modello.
FAQ
Un singolo nome di modello GPU spesso copre più SKU fisici. H100 viene distribuito in varianti PCIe, SXM, SXM5 e NVL con prezzi e larghezze di banda di interconnessione differenti. A100 viene distribuito con 40GB e 80GB di VRAM; V100 con 16GB e 32GB. All’interno di un provider, la tariffa elencata varia anche in base alla classe di CPU host, alla RAM e allo storage in bundle e alla regione. Le tabelle dei prezzi sopra suddividono gli SKU per interconnessione e VRAM laddove i dati di origine lo consentono, in modo che ogni riga sia una singola scheda fisica anziché un aggregato per nome del modello.
Il componente esegue un carico di lavoro fisso (generazione di testo o immagini, fine-tuning o inferenza) su ogni istanza GPU e divide l’output totale per il costo orario dell’istanza. Un numero più alto è più economico per output per quel carico di lavoro. La classifica cambia in base al carico di lavoro: una scheda ottimizzata per l’inferenza FP8 può superare una scheda con più VRAM nella generazione di testo, ma perdere su un fine-tuning di un modello di immagini di grandi dimensioni. Scegli la scheda del carico di lavoro che corrisponde al tuo compito prima di leggere la classifica.
Le tabelle dei prezzi vengono aggiornate con una scansione mensile del catalogo.
Letture aggiuntive
- Benchmark Multi-GPU: B200 vs H200 vs H100 vs MI300X
- I migliori 30 provider di GPU cloud e le loro GPU
- Benchmark di concorrenza GPU
- I migliori 25+ produttori di chip IA: NVIDIA e i suoi concorrenti
- Indice dei prezzi di noleggio delle GPU cloud
- DGX Spark vs Mac Studio & Halo: Benchmark e alternative
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sarı, Ekrem},
title = {{Cloud GPU Prezzi, Prestazioni & Confronto tra Provider}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/cloud-gpu-pricing}},
note = {AIMultiple. Consultato il 17 Giugno 2026}
}
Commenti 2
Condividi i tuoi pensieri
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.
Cem - great article, I'd love to pick your brain on private networking or direct connects to these GPU instances.
Hi Ashley, thank you! Sure, happy to chat.
Hi there, fantastic article and very well-researched. Would you mind checking out Dataoorts at https://dataoorts.com
Sure, we'll review to see if we can include Dataoorts in the next edit.