I prezzi di listino delle GPU cloud per lo stesso modello possono differire di diverse volte da un provider all'altro. Abbiamo selezionato la tariffa più bassa, il fornitore, l'intervallo di mercato e la mediana per oltre 40 configurazioni di GPU su tutti e tre i livelli di prezzo, oltre a un benchmark di throughput per dollaro su 10 modelli.
Prezzo per throughput delle GPU cloud
Scopri la GPU più conveniente per il tuo carico di lavoro tra 13 provider hyperscaler e neocloud, classificati per throughput per dollaro:
Prezzi e prestazioni delle GPU cloud
1.246 offerte da 25 provider
IONOS
AbbonatoVast IA
Miglior prezzoVast IA
Vast IA
Verda
Verda
Verda
Verda
Vast IA
Runpod
Consulta la metodologia di benchmark delle GPU cloud per i dettagli.
L'on-demand è il modello di prezzo più semplice in cui paghi la capacità di calcolo a ore o al secondo, a seconda di ciò che usi, senza impegni a lungo termine né pagamenti anticipati.
Queste istanze sono consigliate agli utenti che preferiscono la flessibilità di una piattaforma GPU cloud senza pagamenti anticipati né impegni a lungo termine. Le istanze on-demand sono generalmente più costose delle istanze spot, ma offrono capacità garantita e ininterrotta.
Prezzi on-demand delle GPU cloud
Classifica: Gli abbonati sono collegati ed evidenziati in cima alla tabella. Le righe rimanenti sono ordinate in ordine crescente per il prezzo on-demand più basso. L'intervallo mostra la differenza tra il prezzo di listino più basso e quello più alto per lo stesso SKU tra tutti i provider. La mediana è il valore centrale della distribuzione dei prezzi in tutte le inserzioni per quello SKU e funge da ancoraggio al prezzo di mercato. I prezzi riflettono l'aggiornamento settimanale più recente del catalogo.
L'on-demand è il modello di noleggio predefinito: paghi a ore, senza impegno, con capacità garantita per tutto il tempo in cui mantieni l'istanza attiva. È il livello più costoso, ma l'unico privo di compromessi.
Prezzi spot delle GPU cloud
Classifica: Le righe sono ordinate in base al prezzo spot più basso in ordine crescente. La capacità spot è interrompibile. La mediana è il valore centrale della distribuzione dei prezzi spot per quello SKU.
La capacità spot è interrompibile; il fornitore può riprendersi l'istanza con poco o nessun preavviso, di solito quando la domanda on-demand aumenta. Le tariffe spot sono in genere inferiori del 35-70% rispetto all'on-demand presso lo stesso fornitore. Usa lo spot per l'addestramento con checkpoint, l'inferenza batch e i lavori di valutazione che tollerano i riavvii. Evitalo per l'inferenza sensibile alla latenza o per servizi a replica singola senza failover.
Prezzi riservati delle GPU cloud (1 anno)
Classifica: Le righe sono ordinate in base al prezzo riservato a 1 anno più basso in ordine crescente. Le prenotazioni bloccano la capacità per il periodo. La mediana è il valore centrale della distribuzione dei prezzi riservati per quello SKU.
Le prenotazioni bloccano la capacità per un periodo prestabilito in cambio di uno sconto rispetto all'on-demand. I contratti annuali sono in genere inferiori del 19-57% rispetto al listino on-demand dello stesso provider. In alcuni casi, le tariffe riservate scendono sotto lo spot perché il provider che riserva isola completamente l'inventario dal mercato spot.
Confronto delle prestazioni tra provider cloud
Lo stesso modello di GPU può offrire prestazioni leggermente diverse tra i provider a causa della scelta della CPU host, del tessuto di rete, della configurazione dei driver e dell'overhead di virtualizzazione. Per quantificarlo, abbiamo eseguito carichi di lavoro identici di generazione di testo e immagini su AMD MI300X 192GB su DigitalOcean e Runpod:
Osservazioni principali:
- Per la generazione di testo, Digital Ocean ha mostrato un throughput leggermente superiore, elaborando circa lo 0.4% di token in più al secondo.
- Al contrario, per la generazione di immagini, Runpod ha mostrato un vantaggio marginale, elaborando circa lo 0.4% di immagini in più al secondo.
Il divario è abbastanza piccolo da non incidere per la maggior parte dei carichi di lavoro. Per l'inferenza sensibile alla latenza o l'addestramento su larga scala, dove ogni punto percentuale si accumula su milioni di inferenze, esegui benchmark sulla configurazione specifica del provider prima di impegnarti in una prenotazione lunga.
Acquistare on-premise o noleggiare nel cloud
Possedere ha senso quando il carico di lavoro è prevedibile, il team ha il know-how operativo e l'utilizzo dell'hardware rimane sopra circa il 70% per tutta la vita utile della GPU. Per domanda variabile, picchi di addestramento o esperimenti di prodotto, il noleggio cloud vince in efficienza del capitale e flessibilità di scalabilità. Il punto di pareggio si colloca all'incirca a 12 mesi di utilizzo: oltre il 70%, la capacità riservata o di proprietà batte quasi sempre l'on-demand; sotto il 50%, lo spot o l'on-demand vincono in flessibilità; la fascia intermedia dipende da quanta interruzione di capacità il tuo carico di lavoro tollera.
Un modello pratico su larga scala: possedere un cluster di base dimensionato per la domanda a regime e noleggiare nel cloud per i picchi e il lavoro esplorativo. Meta ha annunciato a febbraio 2026 una partnership pluriennale per implementare fino a 6 gigawatt di AMD Instinct GPU, segnalando che anche gli operatori su scala hyperscaler continuano a espandere la capacità di proprietà pur continuando a consumare GPU cloud per carichi di lavoro variabili.
Le GPU consumer (RTX 4090, RTX 5090) offrono il miglior prezzo per FLOP sulla carta, ma l'EULA di NVIDIA ne limita l'uso nei data center commerciali. Rimangono utili per workstation individuali e lavori di proof-of-concept, non per la distribuzione in produzione.
Metodologia di benchmark delle GPU cloud
I benchmark di throughput utilizzano la quantizzazione FP a 4 bit in tutti i test. La pipeline esegue:
- Fine-tuning di testo: Llama 3.2 sulle prime 5.000 conversazioni di FineTome, 5 epoche, 1M token totali, framework Unsloth. Throughput = (token × epoche) / tempo totale.
- Inferenza di testo: 1M token generati con llama-cpp-python.
- Fine-tuning di immagini: YOLOv9 su 100 immagini da SkyFusion, 4 epoche, Unsloth.
- Inferenza di immagini: YOLOv9 sottoposto a fine-tuning su circa 500 immagini a 640×640.
La metrica di throughput per dollaro divide l'output del carico di lavoro per il costo orario dell'istanza. I valori di throughput sono specifici del carico di lavoro e fungono da linee guida relative; lo stesso hardware fornirà un throughput sensibilmente diverso sul proprio modello.
FAQ
Un singolo nome di modello GPU spesso copre più SKU fisici. H100 è disponibile nelle varianti PCIe, SXM, SXM5 e NVL a prezzi e larghezze di banda di interconnessione diversi. A100 è disponibile con 40GB e 80GB di VRAM; V100 con 16GB e 32GB. All'interno di un provider, la tariffa elencata varia anche in base alla classe di CPU host, alla RAM e allo storage inclusi e alla regione. Le tabelle dei prezzi sopra suddividono gli SKU per interconnessione e VRAM quando i dati di origine lo consentono, quindi ogni riga è una singola scheda fisica piuttosto che un'aggregazione per nome di modello.
Il componente esegue un carico di lavoro fisso (generazione di immagini o testo, fine-tuning o inferenza) su ogni istanza GPU e divide l'output totale per il costo orario dell'istanza. Un numero più alto indica un costo per output inferiore per quel carico di lavoro. La classifica cambia con il carico di lavoro: una scheda ottimizzata per l'inferenza FP8 può superare una scheda con più VRAM nella generazione di testo, ma perdere nel fine-tuning di un modello di immagini di grandi dimensioni. Scegli la scheda del carico di lavoro che corrisponde al tuo compito prima di leggere la classifica.
Le tabelle dei prezzi si aggiornano con una scansione mensile del catalogo.
Ulteriori letture
- Benchmark multi-GPU: B200 vs H200 vs H100 vs MI300X
- I migliori 30 provider di GPU cloud e le loro GPU
- Benchmark di concorrenza delle GPU
- I migliori 25+ produttori di chip IA: NVIDIA e i suoi concorrenti
- Indice dei prezzi di noleggio delle GPU cloud
- DGX Spark vs Mac Studio e Halo: benchmark e alternative
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sarı, Ekrem},
title = {{Prezzi, prestazioni e confronto tra i provider di GPU cloud}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/cloud-gpu-pricing}},
note = {AIMultiple. Consultato il 17 Giugno 2026}
}Risultati e timestamp di 117 punti dati. Scarica i dati utilizzati in questo articolo come file ZIP contenente 3 file CSV.
Registro delle modifiche
15 aggiornamenti- 2026
Aggiunte tabelle dei prezzi delle GPU cloud spot e riservate a 1 anno accanto alla tabella on-demand.
Rimossa la sezione "Prezzi più bassi per le GPU più popolari".
- 2025
Espansa la sezione "Metodologia di benchmark GPU Cloud".
Aggiunto un confronto delle prestazioni dei fornitori di cloud all'introduzione.
Aggiornata la sezione Prezzi con i dettagli di configurazione e framework.
Metodologia espansa per operazioni di testo e immagine.
- 2024
Aggiunta una sezione sulla metodologia di benchmark delle GPU cloud.
Aggiornata la sezione "Prezzi più bassi per i modelli GPU più popolari".
Aggiunti i marketplace di GPU cloud all'introduzione.
Aggiunti i 10 modelli più economici e popolari all'introduzione.
- 2023
Aggiunte le GPU On-demand dai grandi fornitori di cloud tecnologici alla sezione dei modelli di prezzo.
Aggiunti CoreWeave e NVIDIA DGX Cloud all'elenco dei principali fornitori di GPU cloud.
Aggiunta una sezione sui fornitori di GPU cloud e le loro offerte.
Espansa la sezione "Quali marchi di GPU sono disponibili nel cloud?".
Espansa la sezione "Disclaimer" con considerazioni aggiuntive sulle GPU cloud e una discussione sull'acquisto rispetto al noleggio di GPU.
Il lavoro di Cem presso AIMultiple è stato citato da importanti testate internazionali tra cui Business Insider, Forbes, Morning Brew e Washington Post, da aziende globali come Deloitte e HPE, da ONG come il World Economic Forum e da organizzazioni sovranazionali come la Commissione europea. [1], [2], [3], [4], [5]
Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente tecnologico e imprenditore tecnologico. Ha consigliato le aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per più di un decennio. Ha inoltre pubblicato un report McKinsey sulla digitalizzazione.
Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha inoltre guidato la crescita commerciale dell'azienda deep tech Hypatos, che ha raggiunto ricavi ricorrenti annuali a 7 cifre e una valutazione a 9 cifre partendo da zero in 2 anni. Il lavoro di Cem in Hypatos è stato ripreso da importanti testate tecnologiche come TechCrunch e Business Insider.
Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato come ingegnere informatico presso l'Università di Bogazici e possiede un MBA della Columbia Business School.
Commenti 2
Condividi i tuoi pensieri
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.
Cem - great article, I'd love to pick your brain on private networking or direct connects to these GPU instances.
Hi Ashley, thank you! Sure, happy to chat.
Hi there, fantastic article and very well-researched. Would you mind checking out Dataoorts at https://dataoorts.com
Sure, we'll review to see if we can include Dataoorts in the next edit.