Dienstleistungen
Kontaktieren

Cloud-GPU-Preise, Leistung & Anbietervergleich

Cem Dilmegani
Cem Dilmegani
aktualisiert am 17. Juni 2026

Cloud-GPU-Listenpreise für dasselbe Model können sich von Anbieter zu Anbieter um ein Vielfaches unterscheiden. Wir haben den niedrigsten Preis, den Anbieter, die Marktspanne und den Median für 40+ GPU-Konfigurationen über alle drei Preisstufen hinweg zusammengestellt, plus einen Durchsatz-pro-Dollar-Benchmark bei 10 Models.

Cloud-GPU-Preis pro Durchsatz

Hier sehen Sie die kosteneffizienteste GPU für Ihre Workload über 13 Hyperscaler- und Neocloud-Anbieter hinweg, sortiert nach Durchsatz pro Dollar:

Cloud-GPU-Preise & Leistung

1.246 Angebote von 25 Anbietern

Aktualisiert am 5. September 2026
Die günstigsten 10 von 260 werden angezeigt
IONOS
Abonnent
AP1-10 GPU T4
$1,07
pro GPU / Stunde
Website besuchen
GPU
1 x NVIDIA T4 16 GB
Gesamter VRAM
16 GB
Monatlich geschätzt
$778
16 vCPU · 128 GB RAM
Text
1.072 Tok/s3.6M Tokens pro 1 $
Bild
24.4 Bilder/s80.7k Bilder pro 1 $
Vast KI
Bester Preis
2x-nvidia-t4-32gb
$0,15
pro GPU / Stunde
GPU
2 x NVIDIA T4 32 GB
Gesamter VRAM
64 GB
Monatlich geschätzt
$216
19 vCPU · 63 GB RAMFP16FP32INT4INT8
Text
2.143 Tok/s25.7M Tokens pro 1 $
Bild
48.8 Bilder/s588k Bilder pro 1 $
Vast KI
4x-nvidia-t4-64gb
$0,15
pro GPU / Stunde
GPU
4 x NVIDIA T4 64 GB
Gesamter VRAM
256 GB
Monatlich geschätzt
$434
56 vCPU · 504 GB RAMFP16FP32INT4INT8
Text
4.286 Tok/s26.2M Tokens pro 1 $
Bild
97.6 Bilder/s598k Bilder pro 1 $
Vast KI
8x-nvidia-v100-256gb
$0,16
pro GPU / Stunde
GPU
8 x NVIDIA V100 256 GB
Gesamter VRAM
2.048 GB
Monatlich geschätzt
$936
FP16FP32FP64INT8
Text
26.976 Tok/s75.9M Tokens pro 1 $
Bild
180.8 Bilder/s509k Bilder pro 1 $
Verda
2x-nvidia-v100-32gb
$0,17
pro GPU / Stunde
GPU
2 x NVIDIA V100 32 GB
Gesamter VRAM
64 GB
Monatlich geschätzt
$248
10 vCPU · 45 GB RAMFP16FP32FP64INT8
Text
6.744 Tok/s71.4M Tokens pro 1 $
Bild
45.2 Bilder/s476k Bilder pro 1 $
Verda
8x-nvidia-v100-128gb
$0,17
pro GPU / Stunde
GPU
8 x NVIDIA V100 128 GB
Gesamter VRAM
1.024 GB
Monatlich geschätzt
$993
48 vCPU · 180 GB RAMFP16FP32FP64INT8
Text
26.976 Tok/s71.4M Tokens pro 1 $
Bild
180.8 Bilder/s479k Bilder pro 1 $
Verda
4x-nvidia-v100-64gb
$0,17
pro GPU / Stunde
GPU
4 x NVIDIA V100 64 GB
Gesamter VRAM
256 GB
Monatlich geschätzt
$496
20 vCPU · 90 GB RAMFP16FP32FP64INT8
Text
13.488 Tok/s71.4M Tokens pro 1 $
Bild
90.4 Bilder/s476k Bilder pro 1 $
Verda
1x-nvidia-v100-16gb
$0,17
pro GPU / Stunde
GPU
1 x NVIDIA V100 16 GB
Gesamter VRAM
16 GB
Monatlich geschätzt
$124
6 vCPU · 23 GB RAMFP16FP32FP64INT8
Text
3.372 Tok/s71.4M Tokens pro 1 $
Bild
22.6 Bilder/s487k Bilder pro 1 $
Vast KI
1x-nvidia-v100-32gb
$0,18
pro GPU / Stunde
GPU
1 x NVIDIA V100 32 GB
Gesamter VRAM
32 GB
Monatlich geschätzt
$132
72 vCPU · 48 GB RAMFP16FP32FP64INT8
Text
3.372 Tok/s67.4M Tokens pro 1 $
Bild
22.6 Bilder/s460k Bilder pro 1 $
Runpod
1x-nvidia-v100-16gb
$0,23
pro GPU / Stunde
GPU
1 x NVIDIA V100 16 GB
Gesamter VRAM
16 GB
Monatlich geschätzt
$168
6 vCPU · 30 GB RAMFP16FP32FP64INT8
Text
3.372 Tok/s52.8M Tokens pro 1 $
Bild
22.6 Bilder/s360k Bilder pro 1 $
Filter
Alle GPU-Modelle
Beliebige GPU-Anzahl
Alle Anbieter
Beliebiger Interconnect

Siehe Cloud-GPU-Benchmark-Methodik für Details.

On-Demand ist das einfachste Preiskonzept, bei dem Sie die Rechenkapazität stunden- oder sekundenweise bezahlen, je nach Nutzung, ohne langfristige Verpflichtungen oder Vorauszahlungen.

Diese Instanzen werden Nutzern empfohlen, die Flexibilität einer Cloud-GPU-Plattform ohne Vorauszahlung oder langfristige Bindung bevorzugen. On-Demand-Instanzen sind in der Regel teurer als Spot-Instanzen, bieten aber garantierte, unterbrechungsfreie Kapazität.

On-Demand-Cloud-GPU-Preise

Ranking: Abonnenten sind verlinkt und werden oben in der Tabelle hervorgehoben. Die übrigen Zeilen sind aufsteigend nach dem niedrigsten On-Demand-Preis sortiert. Die Spanne zeigt die Streuung zwischen dem niedrigsten und höchsten Listenpreis für dieselbe SKU über alle Anbieter hinweg. Der Median ist der mittlere Wert der Preisverteilung über alle Angebote für diese SKU und dient als fairer Marktanker. Die Preise spiegeln die jüngste wöchentliche Katalogaktualisierung wider.

On-Demand ist das Standard-Mietkonzept: Bezahlung pro Stunde, keine Bindung, Kapazität garantiert, solange Sie die Instanz ausführen. Es ist die teuerste Preisstufe, aber die einzige ohne Kompromisse.

Spot-Cloud-GPU-Preise

Ranking: Die Zeilen werden aufsteigend nach dem niedrigsten Spot-Preis sortiert. Spot-Kapazität kann unterbrochen werden. Der Median ist der mittlere Wert der Spotpreisverteilung für diese SKU.

Spot-Kapazität kann unterbrochen werden; der Anbieter kann die Instanz mit wenig oder gar keiner Vorwarnung zurückfordern, in der Regel wenn die On-Demand-Nachfrage ansteigt. Spot-Preise liegen in der Regel 35-70 % unter den On-Demand-Preisen desselben Anbieters. Nutzen Sie Spot für checkpointbares Training, Batch-Inference und Evaluierungsjobs, die Neustarts vertragen. Vermeiden Sie es für latenzsensible Inference oder Dienste mit nur einer Replik ohne Failover.

Reservierte Cloud-GPU-Preise (1 Jahr)

Ranking: Die Zeilen werden aufsteigend nach dem niedrigsten 1-Jahres-Reservierungspreis sortiert. Reservierungen sichern die Kapazität für die Laufzeit. Der Median ist der mittlere Wert der Preisverteilung für reservierte Kapazität für diese SKU.

Reservierungen sichern Kapazität für eine feste Laufzeit im Austausch für einen Rabatt gegenüber On-Demand. Einjahresverträge liegen in der Regel 19-57 % unter dem On-Demand-Listenpreis desselben Anbieters. In einigen Fällen fallen die Reservierungspreise unter den Spot-Preis, da der Anbieter, der die Reservierung anbietet, den Bestand vollständig vom Spotmarkt isoliert.

Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

Leistungsvergleich der Cloud-Anbieter

Dasselbe GPU-Model kann je nach Anbieter leicht unterschiedlich abschneiden, abhängig von der Wahl der Host-CPU, der Netzwerkstruktur, der Treiberkonfiguration und dem Virtualisierungs-Overhead. Um dies zu quantifizieren, haben wir identische Text- und Bildgenerierungs-Workloads auf AMD MI300X 192GB bei DigitalOcean und Runpod ausgeführt:

Wichtige Beobachtungen:

  • Für die Textgenerierung zeigte Digital Ocean einen etwas höheren Durchsatz und verarbeitete etwa 0.4 % mehr Tokens pro Sekunde.
  • Für die Bildgenerierung zeigte Runpod einen leichten Vorteil und verarbeitete etwa 0.4 % mehr Bilder pro Sekunde.

Der Unterschied ist klein genug, um für die meisten Workloads keine Rolle zu spielen. Für latenzkritische Inference oder groß angelegtes Training, bei dem sich jeder Prozentpunkt über Millionen von Inferences summiert, sollten Sie die jeweilige Anbieterkonfiguration benchmarken, bevor Sie sich auf eine lange Reservierung festlegen.

On-Prem kaufen oder in der Cloud mieten

Eigentum lohnt sich, wenn die Workload vorhersehbar ist, das Team über das nötige betriebliche Know-how verfügt und die Hardware-Auslastung während der gesamten Nutzungsdauer der GPU über ~70 % bleibt. Bei variabler Nachfrage, Trainingsspitzen oder Produktexperimenten ist die Cloud-Miete bei Kapitaleffizienz und Skalierungsflexibilität überlegen. Der Break-even liegt ungefähr bei einer Auslastung über 12 Monate: Bleibt die Auslastung über 70 %, schlagen Reservierungen oder eigene Kapazität On-Demand fast immer; liegt sie unter 50 %, gewinnen Spot oder On-Demand bei der Flexibilität; das mittlere Band hängt davon ab, wie viel Kapazitätsunterbrechung Ihre Workload verträgt.

Ein praktisches Muster im großen Maßstab: Besitzen Sie einen Basis-Cluster, der auf den stetigen Bedarf ausgelegt ist, und mieten Sie in der Cloud bei Spitzen und explorativer Arbeit zusätzliche Kapazität. Meta kündigte im Februar 2026 eine mehrjährige Partnerschaft an, um bis zu 6 Gigawatt AMD Instinct GPUs bereitzustellen, was zeigt, dass selbst Betreiber in Hyperscaler-Größe ihre eigene Kapazität weiter ausbauen, während sie für variable Workloads weiterhin Cloud-GPU nutzen.

Consumer-GPUs (RTX 4090, RTX 5090) liefern auf dem Papier den besten Preis pro FLOP, aber die EULA von NVIDIA verbietet ihren Einsatz in kommerziellen Rechenzentren. Sie bleiben nützlich für einzelne Workstations und Proof-of-Concept-Arbeiten, nicht für den Produktiveinsatz.

Verpassen Sie nicht unsere Benchmarks und datengestützten Erkenntnisse. Die Schaltfläche öffnet Google; die Auswahl von AIMultiple bestätigt, dass Sie AIMultiple häufiger in den Google-Suchergebnissen sehen möchten.
GoogleAls bevorzugte Quelle hinzufügen

Cloud-GPU-Benchmark-Methodik

Für die Durchsatz-Benchmarks wird durchgehend 4-Bit-FP-Quantisierung verwendet. Die Pipeline umfasst:

  • Text-Fine-Tuning: Llama 3.2 mit den ersten 5.000 Konversationen von FineTome, 5 Epochen, 1M Gesamt-Tokens, Unsloth-Framework. Durchsatz = (Tokens × Epochen) / Gesamtzeit.
  • Text-Inference: 1M Tokens generiert mit llama-cpp-python.
  • Bild-Fine-Tuning: YOLOv9 mit 100 Bildern aus SkyFusion, 4 Epochen, Unsloth.
  • Bild-Inference: Feingetuntes YOLOv9 mit ~500 Bildern bei 640×640.

Die Durchsatz-pro-Dollar-Metrik teilt den Workload-Output durch die stündlichen Kosten der Instanz. Durchsatzwerte sind workloadspezifisch und dienen als relative Richtwerte; dieselbe Hardware liefert bei Ihrem eigenen Model möglicherweise einen deutlich anderen Durchsatz.

FAQs

Ein einzelner GPU-Model-Name deckt oft mehrere physische SKUs ab. H100 wird in den Varianten PCIe, SXM, SXM5 und NVL zu unterschiedlichen Preisen und Interconnect-Bandbreiten angeboten. A100 gibt es mit 40GB und 80GB VRAM; V100 mit 16GB und 32GB. Innerhalb eines Anbieters variiert der aufgeführte Preis auch je nach Host-CPU-Klasse, gebündeltem RAM und Speicher sowie Region. Die obigen Preistabellen teilen SKUs nach Interconnect und VRAM auf, sofern die Quelldaten dies zulassen, sodass jede Zeile eine einzelne physische Karte ist und kein nach Model-Name aggregierter Eintrag.

Die Komponente führt eine feste Workload (Bild- oder Textgenerierung, Fine-Tuning oder Inference) auf jeder GPU-Instanz aus und teilt den Gesamt-Output durch die stündlichen Kosten der Instanz. Eine höhere Zahl bedeutet für diese Workload einen geringeren Preis pro Output. Das Ranking verschiebt sich mit der Workload: Eine Karte, die für FP8-Inference optimiert ist, kann bei der Textgenerierung eine Karte mit mehr VRAM übertreffen, bei einem großen Bildmodel-Fine-Tuning jedoch verlieren. Wählen Sie den Workload-Tab aus, der zu Ihrem Job passt, bevor Sie die Bestenliste lesen.

Die Preistabellen werden monatlich durch einen Katalog-Crawl aktualisiert.

Weiterführende Literatur

Zitieren Sie diesen Benchmark

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Cem Dilmegani and Ekrem Sarı (2026) - "Cloud-GPU-Preise, Leistung & Anbietervergleich". Online veröffentlicht auf AIMultiple.com. Abgerufen am 17. Juni 2026, von: https://aimultiple.com/cloud-gpu-pricing [Online-Ressource]

Dilmegani, C., & Sarı, E. (2026, 17. Juni). Cloud-GPU-Preise, Leistung & Anbietervergleich. AIMultiple. https://aimultiple.com/cloud-gpu-pricing

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Sarı, Ekrem},
  title  = {{Cloud-GPU-Preise, Leistung & Anbietervergleich}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/cloud-gpu-pricing}},
  note   = {AIMultiple. Abgerufen am 17. Juni 2026}
}
Alle Daten herunterladen

Ergebnisse und Zeitstempel von 117 Datenpunkten. Laden Sie die in diesem Artikel verwendeten Daten als ZIP-Datei herunter, die 3 CSV-Dateien enthält.

Zuletzt aktualisiert: 17. August 2026
Herunterladen

Änderungsprotokoll

15 Aktualisierungen
  1. 2026

    Tabellen mit Spot- und 1-Jahres-Reservierungspreisen für Cloud-GPUs neben der On-Demand-Tabelle hinzugefügt.

  2. Der Abschnitt „Niedrigste Preise für die beliebtesten GPUs“ wurde entfernt.

  3. 2025

    Erweitert den Abschnitt „Cloud-GPU-Benchmark-Methodik“.

  4. Ein Cloud-Anbieter-Leistungsvergleich wurde zur Einleitung hinzugefügt.

  5. Der Abschnitt Preise wurde mit Konfigurations- und Framework-Details aktualisiert.

  6. Methodik für Text- und Bildoperationen erweitert.

  7. 2024

    Ein Abschnitt zur Cloud-GPU-Benchmark-Methodik wurde hinzugefügt.

  8. Der Abschnitt „Niedrigste Preise für die beliebtesten GPU-Modelle“ wurde aktualisiert.

  9. Cloud-GPU-Marktplätze wurden der Einleitung hinzugefügt.

  10. Die 10 günstigsten und beliebtesten Modelle wurden der Einleitung hinzugefügt.

  11. 2023

    On-Demand-GPUs von großen Tech-Cloud-Anbietern zum Abschnitt Preismodelle hinzugefügt.

  12. CoreWeave und NVIDIA DGX Cloud wurden zur Liste der Top-Cloud-GPU-Anbieter hinzugefügt.

  13. Ein Abschnitt über Cloud-GPU-Anbieter und deren Angebote wurde hinzugefügt.

  14. Erweiterter Abschnitt „Welche GPU-Marken sind in der Cloud verfügbar?“.

  15. Erweitert den Abschnitt „Haftungsausschluss“ um zusätzliche Überlegungen zu Cloud-GPUs und eine Diskussion über den Kauf im Vergleich zur Miete von GPUs.

Cem Dilmegani
Cem Dilmegani
Leitender Analyst
Cem ist seit 2017 leitender Analyst bei AIMultiple.

Cems Arbeit bei AIMultiple wurde von führenden globalen Publikationen wie Business Insider, Forbes, Morning Brew und Washington Post, von globalen Unternehmen wie Deloitte und HPE, von NGOs wie dem World Economic Forum und von supranationalen Organisationen wie der European Commission zitiert. [1], [2], [3], [4], [5]

Im Laufe seiner Karriere war Cem als Tech-Berater, Tech-Einkäufer und Tech-Unternehmer tätig. Er beriet Unternehmen bei ihren Technologieentscheidungen bei McKinsey & Company und Altman Solon über mehr als ein Jahrzehnt. Er veröffentlichte außerdem einen McKinsey-Bericht zur Digitalisierung.

Er leitete Technologiestrategie und -beschaffung eines Telekommunikationsunternehmens und berichtete dabei direkt an den CEO. Außerdem verantwortete er das kommerzielle Wachstum des Deep-Tech-Unternehmens Hypatos, das innerhalb von zwei Jahren von 0 einen siebenstelligen jährlich wiederkehrenden Umsatz und eine neunstellige Bewertung erreichte. Cems Arbeit bei Hypatos wurde von führenden Technologiepublikationen wie TechCrunch und Business Insider aufgegriffen.

Cem spricht regelmäßig auf internationalen Technologiekonferenzen. Er absolvierte die Bogazici University als Computeringenieur und hat einen MBA von der Columbia Business School.
Vollständiges Profil anzeigen
Technisch geprüft von
Ekrem Sarı
Ekrem Sarı
KI-Forscher
Ekrem ist KI-Forscher und Datenwissenschaftler bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.
Vollständiges Profil anzeigen

Kommentare 2

Teilen Sie Ihre Gedanken

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450
Ashley Jenkinson
Ashley Jenkinson
Oct 31, 2024 at 08:54

Cem - great article, I'd love to pick your brain on private networking or direct connects to these GPU instances.

Cem Dilmegani
Cem Dilmegani
Nov 10, 2024 at 06:58

Hi Ashley, thank you! Sure, happy to chat.

Harsh Sharma
Harsh Sharma
Oct 06, 2024 at 02:19

Hi there, fantastic article and very well-researched. Would you mind checking out Dataoorts at https://dataoorts.com

Cem Dilmegani
Cem Dilmegani
Oct 22, 2024 at 03:18

Sure, we'll review to see if we can include Dataoorts in the next edit.