Cloud GPU Listenpreise für dasselbe Modell können sich von Anbieter zu Anbieter um ein Vielfaches unterscheiden. Wir haben den niedrigsten Preis, den Anbieter, die Marktspanne und den Median für 40+ GPU-Konfigurationen in allen drei Preismodellen sowie einen Durchsatz-pro-Dollar-Benchmark für 10 Modelle zusammengestellt.
Cloud GPU Preis pro Durchsatz
Sehen Sie die kosteneffektivste GPU für Ihre Workload über 13 Hyperscaler- und Neocloud-Anbieter, sortiert nach Durchsatz pro Dollar:
Cloud GPU Durchsatz & Preise
Aktualisiert am 26. Juli 2026
Vast KI
Vast KI
IONOS
Vast KI
Verda
Verda
Verda
Verda
Vast KI
Vast KI
Vast KI
Vast KI
Siehe Cloud-GPU-Benchmark-Methodik für Details.
On-Demand ist das einfachste Preismodell, bei dem Sie stunden- oder sekundengenau für die genutzte Rechenkapazität bezahlen, ohne langfristige Verpflichtungen oder Vorauszahlungen.
Diese Instanzen werden für Nutzer empfohlen, die Flexibilität einer Cloud-GPU-Plattform ohne Vorauszahlung oder langfristige Bindung bevorzugen. On-Demand-Instanzen sind in der Regel teurer als Spot-Instanzen, bieten aber garantierte unterbrechungsfreie Kapazität.
On-Demand-Cloud-GPU-Preise
Rangfolge: Sponsoren sind verlinkt und oben in der Tabelle hervorgehoben. Die übrigen Zeilen sind aufsteigend nach dem niedrigsten On-Demand-Preis sortiert. Die Spanne zeigt die Streuung zwischen dem niedrigsten und höchsten Listenpreis für dieselbe SKU über alle Anbieter hinweg. Der Median ist die Mitte der Preisverteilung über alle Listings dieser SKU und dient als fairer Marktanker. Die Preise spiegeln die letzte wöchentliche Katalogaktualisierung wider.
On-Demand ist das Standard-Mietmodell: stundenweise Bezahlung, keine Bindung, Kapazität garantiert, solange die Instanz läuft. Es ist die teuerste Stufe, aber die einzige ohne Kompromisse.
Spot-Cloud-GPU-Preise
Rangfolge: Zeilen sind aufsteigend nach dem niedrigsten Spot-Preis sortiert. Spot-Kapazität ist unterbrechbar. Der Median ist die Mitte der Spot-Preisverteilung für diese SKU.
Spot-Kapazität ist unterbrechbar; der Anbieter kann die Instanz mit kurzer oder ohne Vorwarnung zurückfordern, meist wenn die On-Demand-Nachfrage ansteigt. Spot-Preise liegen in der Regel 40-64% unter den On-Demand-Preisen desselben Anbieters. Nutzen Sie Spot für trainings mit Checkpoints, Batch-Inferenz und Evaluierungsjobs, die Neustarts vertragen. Vermeiden Sie es für latenzempfindliche Inferenz oder Einzelreplikadienste ohne Failover.
Reservierte Cloud-GPU-Preise (1 Jahr)
Rangfolge: Zeilen sind aufsteigend nach dem niedrigsten reservierten 1-Jahres-Preis sortiert. Reservierungen sichern die Kapazität für die Laufzeit. Der Median ist die Mitte der reservierten Preisverteilung für diese SKU.
Reservierungen sichern Kapazität für eine feste Laufzeit im Austausch für einen Rabatt gegenüber On-Demand. Einjahresverträge liegen in der Regel 19-57% unter der On-Demand-Liste desselben Anbieters. In einigen Fällen sinken Reservierungspreise unter Spot, da der reservierende Anbieter das Inventar vollständig vom Spot-Markt trennt.
Cloud-Anbieter Leistungsvergleich
Dasselbe GPU-Modell kann je nach Anbieter aufgrund der Auswahl der Host-CPU, der Netzwerkstruktur, der Treiberkonfiguration und des Virtualisierungs-Overheads leicht unterschiedliche Leistung zeigen. Um dies zu quantifizieren, haben wir identische Text- und Bildgenerierungs-Workloads auf AMD MI300X 192GB bei DigitalOcean und Runpod ausgeführt:
Wichtige Erkenntnisse:
- Bei Textgenerierung zeigte Digital Ocean einen etwas höheren Durchsatz und verarbeitete etwa 0,4% mehr Tokens pro Sekunde.
- Umgekehrt zeigte Runpod bei der Bildgenerierung einen leichten Vorteil und verarbeitete etwa 0,4% mehr Bilder pro Sekunde.
Der Unterschied ist für die meisten Workloads unerheblich. Bei latenzkritischer Inferenz oder großangelegtem Training, wo jeder Prozentpunkt sich über Millionen von Inferenzen aufsummiert, sollten Sie die spezifische Anbieterkonfiguration benchmarken, bevor Sie sich auf eine lange Reservierung festlegen.
On-Premise kaufen oder in der Cloud mieten
Eigentum lohnt sich, wenn die Arbeitslast vorhersehbar ist, das Team über das operative Know-how verfügt und die Hardware-Auslastung über die Nutzungsdauer der GPU bei über ~70% liegt. Bei schwankender Nachfrage, Trainingsspitzen oder Produktexperimenten punktet die Cloud-Miete mit Kapitaleffizienz und Skalierungsflexibilität. Die Gewinnschwelle liegt etwa bei einer 12-monatigen Auslastung: über 70%, Reservierung oder eigene Kapazität schlägt fast immer On-Demand; unter 50% gewinnt Spot oder On-Demand bei der Flexibilität; das Mittelfeld hängt davon ab, wie viel Kapazitätsunterbrechung Ihre Workload verträgt.
Ein praktisches Muster im großen Maßstab: ein Basiscluster in der Größe des stetigen Bedarfs besitzen, für Spitzen und Erkundungsarbeiten in der Cloud mieten. Meta kündigte im Februar 2026 eine mehrjährige Partnerschaft an, um bis zu 6 Gigawatt AMD Instinct GPUs bereitzustellen – ein Zeichen, dass selbst Hyperscaler-große Betreiber ihre eigene Kapazität weiter ausbauen und gleichzeitig Cloud-GPUs für variable Workloads nutzen.
Consumer-GPUs (RTX 4090, RTX 5090) bieten auf dem Papier den besten Preis pro FLOP, aber NVIDIAs EULA schränkt deren Nutzung in kommerziellen Rechenzentren ein. Sie bleiben nützlich für einzelne Workstations und Proof-of-Concept-Arbeiten, nicht für den Produktionseinsatz.
Cloud-GPU-Benchmark-Methodik
Durchsatz-Benchmarks verwenden 4-Bit FP-Quantisierung über alle Tests. Die Pipeline umfasst:
- Text-Feintuning: Llama 3.2 mit den ersten 5,000 Gesprächen aus FineTome, 5 Epochen, 1M Tokens insgesamt, Unsloth-Framework. Durchsatz = (Tokens × Epochen) / Gesamtzeit.
- Text-Inferenz: 1M Tokens generiert mit llama-cpp-python.
- Bild-Feintuning: YOLOv9 mit 100 Bildern aus SkyFusion, 4 Epochen, Unsloth.
- Bild-Inferenz: Feinabgestimmtes YOLOv9 mit ~500 Bildern bei 640×640.
Die Durchsatz-pro-Dollar-Metrik teilt den Workload-Output durch die stündlichen Kosten der Instanz. Die Durchsatzwerte sind workloadspezifisch und dienen als relative Richtwerte; dieselbe Hardware wird bei Ihrem eigenen Modell einen wesentlich anderen Durchsatz liefern.
FAQs
Ein einzelner GPU-Modellname deckt oft mehrere physische SKUs ab. H100 wird in PCIe-, SXM-, SXM5- und NVL-Varianten zu unterschiedlichen Preisen und Interconnect-Bandbreiten angeboten. A100 gibt es mit 40GB und 80GB VRAM; V100 mit 16GB und 32GB. Innerhalb eines Anbieters variiert der Listenpreis auch je nach Host-CPU-Klasse, gebündeltem RAM und Speicher sowie Region. Die obigen Preistabellen teilen die SKUs nach Interconnect und VRAM auf, wo es die Quelldaten erlauben, sodass jede Zeile eine einzelne physische Karte und keine Modellnamen-Aggregation darstellt.
Die Komponente führt einen festen Workload (Bild- oder Textgenerierung, Feintuning oder Inferenz) auf jeder GPU-Instanz aus und teilt die Gesamtleistung durch die stündlichen Kosten der Instanz. Ein höherer Wert bedeutet günstiger pro Output für diesen Workload. Die Rangfolge ändert sich mit dem Workload: Eine für FP8-Inferenz optimierte Karte kann bei der Textgenerierung vor einer Karte mit mehr VRAM liegen, verliert aber bei einem umfangreichen Bildmodell-Feintuning. Wählen Sie den Workload-Tab, der zu Ihrer Aufgabe passt, bevor Sie die Bestenliste lesen.
Die Preistabellen werden monatlich durch einen Katalog-Crawl aktualisiert.
Weiterführende Literatur
- Multi-GPU Benchmark: B200 vs H200 vs H100 vs MI300X
- Top 30 Cloud-GPU-Anbieter & ihre GPUs
- GPU Parallelitäts-Benchmark
- Top 25+ KI-Chip-Hersteller: NVIDIA & seine Wettbewerber
- Cloud GPU Mietpreisindex
- DGX Spark vs Mac Studio & Halo: Benchmarks & Alternativen
Diese Forschung zitieren
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sarı, Ekrem},
title = {{Cloud GPU Preise, Leistung & Anbietervergleich}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/cloud-gpu-pricing}},
note = {AIMultiple. Abgerufen am 17. Juni 2026}
}
Kommentare 2
Teilen Sie Ihre Gedanken
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.
Cem - great article, I'd love to pick your brain on private networking or direct connects to these GPU instances.
Hi Ashley, thank you! Sure, happy to chat.
Hi there, fantastic article and very well-researched. Would you mind checking out Dataoorts at https://dataoorts.com
Sure, we'll review to see if we can include Dataoorts in the next edit.