Cloud-GPU-Listenpreise für dasselbe Model können sich von Anbieter zu Anbieter um ein Vielfaches unterscheiden. Wir haben den niedrigsten Preis, den Anbieter, die Marktspanne und den Median für 40+ GPU-Konfigurationen über alle drei Preisstufen hinweg zusammengestellt, plus einen Durchsatz-pro-Dollar-Benchmark bei 10 Models.
Cloud-GPU-Preis pro Durchsatz
Hier sehen Sie die kosteneffizienteste GPU für Ihre Workload über 13 Hyperscaler- und Neocloud-Anbieter hinweg, sortiert nach Durchsatz pro Dollar:
Cloud-GPU-Preise & Leistung
1.246 Angebote von 25 Anbietern
IONOS
AbonnentVast KI
Bester PreisVast KI
Vast KI
Verda
Verda
Verda
Verda
Vast KI
Runpod
Siehe Cloud-GPU-Benchmark-Methodik für Details.
On-Demand ist das einfachste Preiskonzept, bei dem Sie die Rechenkapazität stunden- oder sekundenweise bezahlen, je nach Nutzung, ohne langfristige Verpflichtungen oder Vorauszahlungen.
Diese Instanzen werden Nutzern empfohlen, die Flexibilität einer Cloud-GPU-Plattform ohne Vorauszahlung oder langfristige Bindung bevorzugen. On-Demand-Instanzen sind in der Regel teurer als Spot-Instanzen, bieten aber garantierte, unterbrechungsfreie Kapazität.
On-Demand-Cloud-GPU-Preise
Ranking: Abonnenten sind verlinkt und werden oben in der Tabelle hervorgehoben. Die übrigen Zeilen sind aufsteigend nach dem niedrigsten On-Demand-Preis sortiert. Die Spanne zeigt die Streuung zwischen dem niedrigsten und höchsten Listenpreis für dieselbe SKU über alle Anbieter hinweg. Der Median ist der mittlere Wert der Preisverteilung über alle Angebote für diese SKU und dient als fairer Marktanker. Die Preise spiegeln die jüngste wöchentliche Katalogaktualisierung wider.
On-Demand ist das Standard-Mietkonzept: Bezahlung pro Stunde, keine Bindung, Kapazität garantiert, solange Sie die Instanz ausführen. Es ist die teuerste Preisstufe, aber die einzige ohne Kompromisse.
Spot-Cloud-GPU-Preise
Ranking: Die Zeilen werden aufsteigend nach dem niedrigsten Spot-Preis sortiert. Spot-Kapazität kann unterbrochen werden. Der Median ist der mittlere Wert der Spotpreisverteilung für diese SKU.
Spot-Kapazität kann unterbrochen werden; der Anbieter kann die Instanz mit wenig oder gar keiner Vorwarnung zurückfordern, in der Regel wenn die On-Demand-Nachfrage ansteigt. Spot-Preise liegen in der Regel 35-70 % unter den On-Demand-Preisen desselben Anbieters. Nutzen Sie Spot für checkpointbares Training, Batch-Inference und Evaluierungsjobs, die Neustarts vertragen. Vermeiden Sie es für latenzsensible Inference oder Dienste mit nur einer Replik ohne Failover.
Reservierte Cloud-GPU-Preise (1 Jahr)
Ranking: Die Zeilen werden aufsteigend nach dem niedrigsten 1-Jahres-Reservierungspreis sortiert. Reservierungen sichern die Kapazität für die Laufzeit. Der Median ist der mittlere Wert der Preisverteilung für reservierte Kapazität für diese SKU.
Reservierungen sichern Kapazität für eine feste Laufzeit im Austausch für einen Rabatt gegenüber On-Demand. Einjahresverträge liegen in der Regel 19-57 % unter dem On-Demand-Listenpreis desselben Anbieters. In einigen Fällen fallen die Reservierungspreise unter den Spot-Preis, da der Anbieter, der die Reservierung anbietet, den Bestand vollständig vom Spotmarkt isoliert.
Leistungsvergleich der Cloud-Anbieter
Dasselbe GPU-Model kann je nach Anbieter leicht unterschiedlich abschneiden, abhängig von der Wahl der Host-CPU, der Netzwerkstruktur, der Treiberkonfiguration und dem Virtualisierungs-Overhead. Um dies zu quantifizieren, haben wir identische Text- und Bildgenerierungs-Workloads auf AMD MI300X 192GB bei DigitalOcean und Runpod ausgeführt:
Wichtige Beobachtungen:
- Für die Textgenerierung zeigte Digital Ocean einen etwas höheren Durchsatz und verarbeitete etwa 0.4 % mehr Tokens pro Sekunde.
- Für die Bildgenerierung zeigte Runpod einen leichten Vorteil und verarbeitete etwa 0.4 % mehr Bilder pro Sekunde.
Der Unterschied ist klein genug, um für die meisten Workloads keine Rolle zu spielen. Für latenzkritische Inference oder groß angelegtes Training, bei dem sich jeder Prozentpunkt über Millionen von Inferences summiert, sollten Sie die jeweilige Anbieterkonfiguration benchmarken, bevor Sie sich auf eine lange Reservierung festlegen.
On-Prem kaufen oder in der Cloud mieten
Eigentum lohnt sich, wenn die Workload vorhersehbar ist, das Team über das nötige betriebliche Know-how verfügt und die Hardware-Auslastung während der gesamten Nutzungsdauer der GPU über ~70 % bleibt. Bei variabler Nachfrage, Trainingsspitzen oder Produktexperimenten ist die Cloud-Miete bei Kapitaleffizienz und Skalierungsflexibilität überlegen. Der Break-even liegt ungefähr bei einer Auslastung über 12 Monate: Bleibt die Auslastung über 70 %, schlagen Reservierungen oder eigene Kapazität On-Demand fast immer; liegt sie unter 50 %, gewinnen Spot oder On-Demand bei der Flexibilität; das mittlere Band hängt davon ab, wie viel Kapazitätsunterbrechung Ihre Workload verträgt.
Ein praktisches Muster im großen Maßstab: Besitzen Sie einen Basis-Cluster, der auf den stetigen Bedarf ausgelegt ist, und mieten Sie in der Cloud bei Spitzen und explorativer Arbeit zusätzliche Kapazität. Meta kündigte im Februar 2026 eine mehrjährige Partnerschaft an, um bis zu 6 Gigawatt AMD Instinct GPUs bereitzustellen, was zeigt, dass selbst Betreiber in Hyperscaler-Größe ihre eigene Kapazität weiter ausbauen, während sie für variable Workloads weiterhin Cloud-GPU nutzen.
Consumer-GPUs (RTX 4090, RTX 5090) liefern auf dem Papier den besten Preis pro FLOP, aber die EULA von NVIDIA verbietet ihren Einsatz in kommerziellen Rechenzentren. Sie bleiben nützlich für einzelne Workstations und Proof-of-Concept-Arbeiten, nicht für den Produktiveinsatz.
Cloud-GPU-Benchmark-Methodik
Für die Durchsatz-Benchmarks wird durchgehend 4-Bit-FP-Quantisierung verwendet. Die Pipeline umfasst:
- Text-Fine-Tuning: Llama 3.2 mit den ersten 5.000 Konversationen von FineTome, 5 Epochen, 1M Gesamt-Tokens, Unsloth-Framework. Durchsatz = (Tokens × Epochen) / Gesamtzeit.
- Text-Inference: 1M Tokens generiert mit llama-cpp-python.
- Bild-Fine-Tuning: YOLOv9 mit 100 Bildern aus SkyFusion, 4 Epochen, Unsloth.
- Bild-Inference: Feingetuntes YOLOv9 mit ~500 Bildern bei 640×640.
Die Durchsatz-pro-Dollar-Metrik teilt den Workload-Output durch die stündlichen Kosten der Instanz. Durchsatzwerte sind workloadspezifisch und dienen als relative Richtwerte; dieselbe Hardware liefert bei Ihrem eigenen Model möglicherweise einen deutlich anderen Durchsatz.
FAQs
Ein einzelner GPU-Model-Name deckt oft mehrere physische SKUs ab. H100 wird in den Varianten PCIe, SXM, SXM5 und NVL zu unterschiedlichen Preisen und Interconnect-Bandbreiten angeboten. A100 gibt es mit 40GB und 80GB VRAM; V100 mit 16GB und 32GB. Innerhalb eines Anbieters variiert der aufgeführte Preis auch je nach Host-CPU-Klasse, gebündeltem RAM und Speicher sowie Region. Die obigen Preistabellen teilen SKUs nach Interconnect und VRAM auf, sofern die Quelldaten dies zulassen, sodass jede Zeile eine einzelne physische Karte ist und kein nach Model-Name aggregierter Eintrag.
Die Komponente führt eine feste Workload (Bild- oder Textgenerierung, Fine-Tuning oder Inference) auf jeder GPU-Instanz aus und teilt den Gesamt-Output durch die stündlichen Kosten der Instanz. Eine höhere Zahl bedeutet für diese Workload einen geringeren Preis pro Output. Das Ranking verschiebt sich mit der Workload: Eine Karte, die für FP8-Inference optimiert ist, kann bei der Textgenerierung eine Karte mit mehr VRAM übertreffen, bei einem großen Bildmodel-Fine-Tuning jedoch verlieren. Wählen Sie den Workload-Tab aus, der zu Ihrem Job passt, bevor Sie die Bestenliste lesen.
Die Preistabellen werden monatlich durch einen Katalog-Crawl aktualisiert.
Weiterführende Literatur
- Multi-GPU-Benchmark: B200 vs. H200 vs. H100 vs. MI300X
- Top 30 Cloud-GPU-Anbieter und ihre GPUs
- GPU-Parallelitäts-Benchmark
- Top 25+ KI-Chip-Hersteller: NVIDIA und ihre Wettbewerber
- Cloud-GPU-Mietpreisindex
- DGX Spark vs. Mac Studio & Halo: Benchmarks & Alternativen
Zitieren Sie diesen Benchmark
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sarı, Ekrem},
title = {{Cloud-GPU-Preise, Leistung & Anbietervergleich}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/cloud-gpu-pricing}},
note = {AIMultiple. Abgerufen am 17. Juni 2026}
}Ergebnisse und Zeitstempel von 117 Datenpunkten. Laden Sie die in diesem Artikel verwendeten Daten als ZIP-Datei herunter, die 3 CSV-Dateien enthält.
Änderungsprotokoll
15 Aktualisierungen- 2026
Tabellen mit Spot- und 1-Jahres-Reservierungspreisen für Cloud-GPUs neben der On-Demand-Tabelle hinzugefügt.
Der Abschnitt „Niedrigste Preise für die beliebtesten GPUs“ wurde entfernt.
- 2025
Erweitert den Abschnitt „Cloud-GPU-Benchmark-Methodik“.
Ein Cloud-Anbieter-Leistungsvergleich wurde zur Einleitung hinzugefügt.
Der Abschnitt Preise wurde mit Konfigurations- und Framework-Details aktualisiert.
Methodik für Text- und Bildoperationen erweitert.
- 2024
Ein Abschnitt zur Cloud-GPU-Benchmark-Methodik wurde hinzugefügt.
Der Abschnitt „Niedrigste Preise für die beliebtesten GPU-Modelle“ wurde aktualisiert.
Cloud-GPU-Marktplätze wurden der Einleitung hinzugefügt.
Die 10 günstigsten und beliebtesten Modelle wurden der Einleitung hinzugefügt.
- 2023
On-Demand-GPUs von großen Tech-Cloud-Anbietern zum Abschnitt Preismodelle hinzugefügt.
CoreWeave und NVIDIA DGX Cloud wurden zur Liste der Top-Cloud-GPU-Anbieter hinzugefügt.
Ein Abschnitt über Cloud-GPU-Anbieter und deren Angebote wurde hinzugefügt.
Erweiterter Abschnitt „Welche GPU-Marken sind in der Cloud verfügbar?“.
Erweitert den Abschnitt „Haftungsausschluss“ um zusätzliche Überlegungen zu Cloud-GPUs und eine Diskussion über den Kauf im Vergleich zur Miete von GPUs.
Cems Arbeit bei AIMultiple wurde von führenden globalen Publikationen wie Business Insider, Forbes, Morning Brew und Washington Post, von globalen Unternehmen wie Deloitte und HPE, von NGOs wie dem World Economic Forum und von supranationalen Organisationen wie der European Commission zitiert. [1], [2], [3], [4], [5]
Im Laufe seiner Karriere war Cem als Tech-Berater, Tech-Einkäufer und Tech-Unternehmer tätig. Er beriet Unternehmen bei ihren Technologieentscheidungen bei McKinsey & Company und Altman Solon über mehr als ein Jahrzehnt. Er veröffentlichte außerdem einen McKinsey-Bericht zur Digitalisierung.
Er leitete Technologiestrategie und -beschaffung eines Telekommunikationsunternehmens und berichtete dabei direkt an den CEO. Außerdem verantwortete er das kommerzielle Wachstum des Deep-Tech-Unternehmens Hypatos, das innerhalb von zwei Jahren von 0 einen siebenstelligen jährlich wiederkehrenden Umsatz und eine neunstellige Bewertung erreichte. Cems Arbeit bei Hypatos wurde von führenden Technologiepublikationen wie TechCrunch und Business Insider aufgegriffen.
Cem spricht regelmäßig auf internationalen Technologiekonferenzen. Er absolvierte die Bogazici University als Computeringenieur und hat einen MBA von der Columbia Business School.
Kommentare 2
Teilen Sie Ihre Gedanken
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.
Cem - great article, I'd love to pick your brain on private networking or direct connects to these GPU instances.
Hi Ashley, thank you! Sure, happy to chat.
Hi there, fantastic article and very well-researched. Would you mind checking out Dataoorts at https://dataoorts.com
Sure, we'll review to see if we can include Dataoorts in the next edit.