Premium
Dienstleistungen
Premium

KI Anbieter

Vergleichen Sie Latenz und Preise führender Anbieter von KI-Produkten.

Anbieter
Bester Preis
Beste Latenz
Anzahl Modelle
Deepinfra
Deepinfra
AI Provider
Bester Preis
66 Modell Modelle
Beste Latenz
59 Modell Modelle
Anzahl Modelle
77 Modell Modelle
Modell
Latenz
Mischpreis $
Eingabe $
Ausgabe $
llama-3-2-1b
1st
0.44
2nd
$0.01
$0.01$0.01
llama-3-1-8b-turbo-fp8
1st
0.18
1st
$0.02
$0.02$0.03
llama-3-2-3b
1st
0.46
1st
$0.02
$0.02$0.02
mistral-nemo
1st
0.19
1st
$0.03
$0.02$0.04
mistral-7b
3rd
0.45
1st
$0.03
$0.03$0.05
llama-3-1-8b
0.28
3rd
$0.04
$0.03$0.05
llama-3-8b
1st
0.31
1st
$0.04
$0.03$0.06
llama-3-2-11b-vision
2nd
1.92
1st
$0.05
$0.05$0.05
gemma-3-4b
1st
0.35
1st
$0.05
$0.04$0.08
deepseek-ocr
1st
0.17
2nd
$0.05
$0.03$0.10
gpt-oss-20b-high
2nd
0.18
2nd
$0.06
$0.03$0.14
gemma-3-12b
1st
0.29
1st
$0.06
$0.04$0.13
mistral-small-3
3rd
0.39
1st
$0.06
$0.05$0.08
mistral-small-3-1
3rd
0.39
1st
$0.06
$0.05$0.10
nvidia-nemotron-nano-9b-v2
1st
0.42
1st
$0.07
$0.04$0.16
devstral-small-may
1st
0.25
1st
$0.07
$0.06$0.12
gpt-oss-120b-high
2nd
0.26
1st
$0.08
$0.04$0.19
qwen2-5-coder-32b
2nd
0.40
1st
$0.08
$0.06$0.15
phi-4
1st
0.31
1st
$0.09
$0.07$0.14
nvidia-nemotron-3-nano
1st
0.24
1st
$0.10
$0.06$0.24
mistral-small-3-2-fp8
1st
0.25
1st
$0.11
$0.07$0.20
gemma-3-27b
1st
0.36
1st
$0.11
$0.09$0.16
qwen3-14b-fp8
1st
0.21
1st
$0.12
$0.08$0.24
devstral-small
1st
0.26
1st
$0.12
$0.07$0.28
qwen3-coder-30b-a3b-fp8
1st
0.22
1st
$0.12
$0.07$0.26
qwen3-30b-fp8
1st
0.21
1st
$0.13
$0.08$0.29
llama-4-scout
0.32
2nd
$0.14
$0.08$0.30
qwq-32b-preview
1st
0.37
1st
$0.14
$0.12$0.18
qwen3-32b-fp8
1st
0.54
1st
$0.15
$0.10$0.30
llama-3-3-70b-turbo-fp8
1st
0.52
1st
$0.15
$0.10$0.32
qwen3-235b-2507
2nd
0.41
1st
$0.17
$0.07$0.46
llama-nemotron-super-49b-v1-5
1st
0.44
1st
$0.17
$0.10$0.40
qwen2-5-72b
1st
0.31
2nd
$0.19
$0.12$0.39
qwen3-vl-4b-fp8
1st
0.45
1st
$0.23
$0.10$0.60
deepseek-v3-2-exp
1st
0.62
1st
$0.24
$0.21$0.32
qwen3-235b-fp8
1st
0.39
1st
$0.25
$0.13$0.60
gpt-oss-120b-high-turbo
1st
0.19
1st
$0.26
$0.15$0.60
llama-4-maverick-fp8
1st
0.41
1st
$0.26
$0.15$0.60
qwen3-vl-30b-a3b-fp8
1st
0.19
1st
$0.26
$0.15$0.60
llama-3-3-70b
0.55
2nd
$0.27
$0.23$0.40
deepseek-r1-distill-qwen-32b
1st
0.37
1st
$0.27
$0.27$0.27
deepseek-v3-2
1st
0.61
1st
$0.29
$0.26$0.39
hermes-3-llama-3-1-70b
1st
0.30
1st
$0.30
$0.30$0.30
nvidia-nemotron-nano-12b-v2-vl-fp8
1st
0.21
1st
$0.30
$0.20$0.60
olmo-3-1-32b-instruct
1st
0.24
1st
$0.30
$0.20$0.60
llama-3-70b
1st
0.35
1st
$0.33
$0.30$0.40
qwen3-next-80b-a3b
1st
0.30
2nd
$0.34
$0.09$1.10
deepseek-v3-1-terminus-fp4
1st
0.42
1st
$0.35
$0.21$0.79
deepseek-v3-1-fp4
1st
0.75
1st
$0.35
$0.21$0.79
llama-3-2-90b-vision
2nd
0.57
1st
$0.36
$0.35$0.40
deepseek-v3-0324
0.57
1st
$0.37
$0.20$0.88
llama-3-1-70b
1st
0.42
1st
$0.40
$0.40$0.40
llama-3-1-70b-turbo-fp8
1st
0.33
1st
$0.40
$0.40$0.40
glm-4-5-air
1st
0.17
2nd
$0.42
$0.20$1.10
minimax-m2
1st
0.27
1st
$0.45
$0.25$1.02
glm-4-6v-fp8
1st
0.25
1st
$0.45
$0.30$0.90
qwen3-vl-235b-a22b-fp8
1st
0.34
1st
$0.45
$0.20$1.20
deepseek-v3-dec
1st
0.38
1st
$0.46
$0.32$0.89
llama-4-maverick-turbo-fp8
1st
0.47
1st
$0.50
$0.50$0.50
qwen3-coder-480b-turbo-fp4
1st
0.23
1st
$0.51
$0.28$1.20
minimax-m2-1-fp8
1st
0.27
1st
$0.51
$0.28$1.20
mixtral-8x7b
2nd
0.32
1st
$0.54
$0.54$0.54
qwen3-vl-8b-fp8
1st
15.00
1st
$0.66
$0.18$2.09
glm-4-5
1st
0.36
1st
$0.69
$0.38$1.60
qwen3-coder-480b-fp8
1st
0.28
2nd
$0.70
$0.40$1.60
deepseek-r1-distill-llama-70b
1st
0.36
1st
$0.75
$0.60$1.20
glm-4-7-fp4
1st
0.31
1st
$0.76
$0.43$1.75
glm-4-6-fp4
1st
0.38
1st
$0.76
$0.43$1.75
qwen3-235b-a22b-2507-fp8
1st
0.30
2nd
$0.77
$0.23$2.39
kimi-k2-0905
0.78
1st
$0.80
$0.40$2.00
kimi-k2-thinking
0.61
1st
$0.85
$0.47$2.00
kimi-k2
0.76
1st
$0.88
$0.50$2.00
deepseek-r1-0528
1st
0.38
1st
$0.91
$0.50$2.15
glm-4-6-fp8
2nd
35.49
1st
$0.93
$0.60$1.90
deepseek-r1-jan
1st
0.35
1st
$1.13
$0.70$2.40
llama-3-1-nemotron-70b
1st
0.32
1st
$1.20
$1.20$1.20
deepseek-r1-jan-turbo-fp4
1st
0.41
1st
$1.50
$1.00$3.00
llama-3-2-1b
Latenz
0.44
Mischpreis $
$0.01
Eingabe $
$0.01
Ausgabe $
$0.01
llama-3-1-8b-turbo-fp8
Latenz
0.18
Mischpreis $
$0.02
Eingabe $
$0.02
Ausgabe $
$0.03
llama-3-2-3b
Latenz
0.46
Mischpreis $
$0.02
Eingabe $
$0.02
Ausgabe $
$0.02
mistral-nemo
Latenz
0.19
Mischpreis $
$0.03
Eingabe $
$0.02
Ausgabe $
$0.04
mistral-7b
Latenz
0.45
Mischpreis $
$0.03
Eingabe $
$0.03
Ausgabe $
$0.05
llama-3-1-8b
Latenz
0.28
Mischpreis $
$0.04
Eingabe $
$0.03
Ausgabe $
$0.05
llama-3-8b
Latenz
0.31
Mischpreis $
$0.04
Eingabe $
$0.03
Ausgabe $
$0.06
llama-3-2-11b-vision
Latenz
1.92
Mischpreis $
$0.05
Eingabe $
$0.05
Ausgabe $
$0.05
gemma-3-4b
Latenz
0.35
Mischpreis $
$0.05
Eingabe $
$0.04
Ausgabe $
$0.08
deepseek-ocr
Latenz
0.17
Mischpreis $
$0.05
Eingabe $
$0.03
Ausgabe $
$0.10
gpt-oss-20b-high
Latenz
0.18
Mischpreis $
$0.06
Eingabe $
$0.03
Ausgabe $
$0.14
gemma-3-12b
Latenz
0.29
Mischpreis $
$0.06
Eingabe $
$0.04
Ausgabe $
$0.13
mistral-small-3
Latenz
0.39
Mischpreis $
$0.06
Eingabe $
$0.05
Ausgabe $
$0.08
mistral-small-3-1
Latenz
0.39
Mischpreis $
$0.06
Eingabe $
$0.05
Ausgabe $
$0.10
nvidia-nemotron-nano-9b-v2
Latenz
0.42
Mischpreis $
$0.07
Eingabe $
$0.04
Ausgabe $
$0.16
devstral-small-may
Latenz
0.25
Mischpreis $
$0.07
Eingabe $
$0.06
Ausgabe $
$0.12
gpt-oss-120b-high
Latenz
0.26
Mischpreis $
$0.08
Eingabe $
$0.04
Ausgabe $
$0.19
qwen2-5-coder-32b
Latenz
0.40
Mischpreis $
$0.08
Eingabe $
$0.06
Ausgabe $
$0.15
phi-4
Latenz
0.31
Mischpreis $
$0.09
Eingabe $
$0.07
Ausgabe $
$0.14
nvidia-nemotron-3-nano
Latenz
0.24
Mischpreis $
$0.10
Eingabe $
$0.06
Ausgabe $
$0.24
mistral-small-3-2-fp8
Latenz
0.25
Mischpreis $
$0.11
Eingabe $
$0.07
Ausgabe $
$0.20
gemma-3-27b
Latenz
0.36
Mischpreis $
$0.11
Eingabe $
$0.09
Ausgabe $
$0.16
qwen3-14b-fp8
Latenz
0.21
Mischpreis $
$0.12
Eingabe $
$0.08
Ausgabe $
$0.24
devstral-small
Latenz
0.26
Mischpreis $
$0.12
Eingabe $
$0.07
Ausgabe $
$0.28
qwen3-coder-30b-a3b-fp8
Latenz
0.22
Mischpreis $
$0.12
Eingabe $
$0.07
Ausgabe $
$0.26
qwen3-30b-fp8
Latenz
0.21
Mischpreis $
$0.13
Eingabe $
$0.08
Ausgabe $
$0.29
llama-4-scout
Latenz
0.32
Mischpreis $
$0.14
Eingabe $
$0.08
Ausgabe $
$0.30
qwq-32b-preview
Latenz
0.37
Mischpreis $
$0.14
Eingabe $
$0.12
Ausgabe $
$0.18
qwen3-32b-fp8
Latenz
0.54
Mischpreis $
$0.15
Eingabe $
$0.10
Ausgabe $
$0.30
llama-3-3-70b-turbo-fp8
Latenz
0.52
Mischpreis $
$0.15
Eingabe $
$0.10
Ausgabe $
$0.32
qwen3-235b-2507
Latenz
0.41
Mischpreis $
$0.17
Eingabe $
$0.07
Ausgabe $
$0.46
llama-nemotron-super-49b-v1-5
Latenz
0.44
Mischpreis $
$0.17
Eingabe $
$0.10
Ausgabe $
$0.40
qwen2-5-72b
Latenz
0.31
Mischpreis $
$0.19
Eingabe $
$0.12
Ausgabe $
$0.39
qwen3-vl-4b-fp8
Latenz
0.45
Mischpreis $
$0.23
Eingabe $
$0.10
Ausgabe $
$0.60
deepseek-v3-2-exp
Latenz
0.62
Mischpreis $
$0.24
Eingabe $
$0.21
Ausgabe $
$0.32
qwen3-235b-fp8
Latenz
0.39
Mischpreis $
$0.25
Eingabe $
$0.13
Ausgabe $
$0.60
gpt-oss-120b-high-turbo
Latenz
0.19
Mischpreis $
$0.26
Eingabe $
$0.15
Ausgabe $
$0.60
llama-4-maverick-fp8
Latenz
0.41
Mischpreis $
$0.26
Eingabe $
$0.15
Ausgabe $
$0.60
qwen3-vl-30b-a3b-fp8
Latenz
0.19
Mischpreis $
$0.26
Eingabe $
$0.15
Ausgabe $
$0.60
llama-3-3-70b
Latenz
0.55
Mischpreis $
$0.27
Eingabe $
$0.23
Ausgabe $
$0.40
deepseek-r1-distill-qwen-32b
Latenz
0.37
Mischpreis $
$0.27
Eingabe $
$0.27
Ausgabe $
$0.27
deepseek-v3-2
Latenz
0.61
Mischpreis $
$0.29
Eingabe $
$0.26
Ausgabe $
$0.39
hermes-3-llama-3-1-70b
Latenz
0.30
Mischpreis $
$0.30
Eingabe $
$0.30
Ausgabe $
$0.30
nvidia-nemotron-nano-12b-v2-vl-fp8
Latenz
0.21
Mischpreis $
$0.30
Eingabe $
$0.20
Ausgabe $
$0.60
olmo-3-1-32b-instruct
Latenz
0.24
Mischpreis $
$0.30
Eingabe $
$0.20
Ausgabe $
$0.60
llama-3-70b
Latenz
0.35
Mischpreis $
$0.33
Eingabe $
$0.30
Ausgabe $
$0.40
qwen3-next-80b-a3b
Latenz
0.30
Mischpreis $
$0.34
Eingabe $
$0.09
Ausgabe $
$1.10
deepseek-v3-1-terminus-fp4
Latenz
0.42
Mischpreis $
$0.35
Eingabe $
$0.21
Ausgabe $
$0.79
deepseek-v3-1-fp4
Latenz
0.75
Mischpreis $
$0.35
Eingabe $
$0.21
Ausgabe $
$0.79
llama-3-2-90b-vision
Latenz
0.57
Mischpreis $
$0.36
Eingabe $
$0.35
Ausgabe $
$0.40
deepseek-v3-0324
Latenz
0.57
Mischpreis $
$0.37
Eingabe $
$0.20
Ausgabe $
$0.88
llama-3-1-70b
Latenz
0.42
Mischpreis $
$0.40
Eingabe $
$0.40
Ausgabe $
$0.40
llama-3-1-70b-turbo-fp8
Latenz
0.33
Mischpreis $
$0.40
Eingabe $
$0.40
Ausgabe $
$0.40
glm-4-5-air
Latenz
0.17
Mischpreis $
$0.42
Eingabe $
$0.20
Ausgabe $
$1.10
minimax-m2
Latenz
0.27
Mischpreis $
$0.45
Eingabe $
$0.25
Ausgabe $
$1.02
glm-4-6v-fp8
Latenz
0.25
Mischpreis $
$0.45
Eingabe $
$0.30
Ausgabe $
$0.90
qwen3-vl-235b-a22b-fp8
Latenz
0.34
Mischpreis $
$0.45
Eingabe $
$0.20
Ausgabe $
$1.20
deepseek-v3-dec
Latenz
0.38
Mischpreis $
$0.46
Eingabe $
$0.32
Ausgabe $
$0.89
llama-4-maverick-turbo-fp8
Latenz
0.47
Mischpreis $
$0.50
Eingabe $
$0.50
Ausgabe $
$0.50
qwen3-coder-480b-turbo-fp4
Latenz
0.23
Mischpreis $
$0.51
Eingabe $
$0.28
Ausgabe $
$1.20
minimax-m2-1-fp8
Latenz
0.27
Mischpreis $
$0.51
Eingabe $
$0.28
Ausgabe $
$1.20
mixtral-8x7b
Latenz
0.32
Mischpreis $
$0.54
Eingabe $
$0.54
Ausgabe $
$0.54
qwen3-vl-8b-fp8
Latenz
15.00
Mischpreis $
$0.66
Eingabe $
$0.18
Ausgabe $
$2.09
glm-4-5
Latenz
0.36
Mischpreis $
$0.69
Eingabe $
$0.38
Ausgabe $
$1.60
qwen3-coder-480b-fp8
Latenz
0.28
Mischpreis $
$0.70
Eingabe $
$0.40
Ausgabe $
$1.60
deepseek-r1-distill-llama-70b
Latenz
0.36
Mischpreis $
$0.75
Eingabe $
$0.60
Ausgabe $
$1.20
glm-4-7-fp4
Latenz
0.31
Mischpreis $
$0.76
Eingabe $
$0.43
Ausgabe $
$1.75
glm-4-6-fp4
Latenz
0.38
Mischpreis $
$0.76
Eingabe $
$0.43
Ausgabe $
$1.75
qwen3-235b-a22b-2507-fp8
Latenz
0.30
Mischpreis $
$0.77
Eingabe $
$0.23
Ausgabe $
$2.39
kimi-k2-0905
Latenz
0.78
Mischpreis $
$0.80
Eingabe $
$0.40
Ausgabe $
$2.00
kimi-k2-thinking
Latenz
0.61
Mischpreis $
$0.85
Eingabe $
$0.47
Ausgabe $
$2.00
kimi-k2
Latenz
0.76
Mischpreis $
$0.88
Eingabe $
$0.50
Ausgabe $
$2.00
deepseek-r1-0528
Latenz
0.38
Mischpreis $
$0.91
Eingabe $
$0.50
Ausgabe $
$2.15
glm-4-6-fp8
Latenz
35.49
Mischpreis $
$0.93
Eingabe $
$0.60
Ausgabe $
$1.90
deepseek-r1-jan
Latenz
0.35
Mischpreis $
$1.13
Eingabe $
$0.70
Ausgabe $
$2.40
llama-3-1-nemotron-70b
Latenz
0.32
Mischpreis $
$1.20
Eingabe $
$1.20
Ausgabe $
$1.20
deepseek-r1-jan-turbo-fp4
Latenz
0.41
Mischpreis $
$1.50
Eingabe $
$1.00
Ausgabe $
$3.00

FAQ

KI Labs (Open AI, Anthropic, Google) entwickeln grundlegende KI Modelle. KI Anbieter (Baseten, Together AI, Groq, DeepInfra) hosten und betreiben diese Modelle über die Infrastruktur Services und verwalten Rechenressourcen API s sowie das Monitoring. KI Gateways fungieren als Middleware und bieten einheitlichen API Zugriff auf mehrere Anbieter mit intelligentem Routing und Kostenoptimierung.

Vergleichen Sie die tokenbasierten Preisstrukturen der Anbieter. In unserem Benchmark zeigte sich beispielsweise, dass OpenRouter mit 0,08 US-Dollar pro Million Output-Token für Llama 4 Scout die niedrigsten Kosten bietet, gefolgt von SambaNova mit 0,11 US-Dollar. Wir untersuchten auch die modellspezifische Preisgestaltung verschiedener KI-Anbieter . Plattformen wie Baseten ermöglichen dabei eine Kostenverfolgung pro Anfrage nach GPU-Typ für einen einfachen Vergleich.

Ja, die Ratenbegrenzungen variieren erheblich. High-Durchsatzanbieter wie Cerebras und SambaNova sind für große Workloads optimiert, während Groq auf extrem niedrige Latenzzeiten spezialisiert ist. Plattformen wie Baseten ermöglichen die Konfiguration von Autoscaling-Parametern, Fehlkonfigurationen können jedoch Kosten und Latenz beeinflussen. Wählen Sie je nachdem, ob Sie Spitzenlastkapazität oder Dauerleistung benötigen.

Für den Zugriff auf kostenlose KI-Modelle gibt es verschiedene Möglichkeiten. Viele Open-Source-Modelle wie Llama,Mistral und Gemma sind über kostenlose Tarife auf Plattformen wie Hugging Face, OpenRouter und Together AI verfügbar, unterliegen jedoch in der Regel Ratenbegrenzungen und Nutzungsbeschränkungen. Open-Source-Lösungen LLMs bieten eine höhere Datensicherheit, da sie auf eigener Infrastruktur eingesetzt werden können. Zudem entfallen Lizenzgebühren und das Risiko der Anbieterabhängigkeit. Die Modelle selbst sind zwar kostenlos, die Bereitstellungskosten variieren jedoch je nachdem, ob sie lokal (kostenlos, sofern die Hardware dies unterstützt), bei Managed-Anbietern oder in der Cloud betrieben werden.

Wählen Sie KI-Anbieter entsprechend Ihren Prioritäten. Für detailliertes Debugging wählen Sie Baseten (Anfrage-Tracing) oder Together AI (versionsbezogene Metriken). Für extrem niedrige Latenzzeiten liefert Groq in unserem Benchmark eine Latenz des ersten Tokens von nur 0,13 Sekunden. Parasail bietet flexible GPU-Wechselmöglichkeiten zur Kostenoptimierung. Fireworks AI ermöglicht die schnelle Bereitstellung von API-Endpunkten. Databricks integriert MLflow-Tracking und Datenherkunft für die Unternehmensführung. Wenn Sie Flexibilität bei mehreren Anbietern benötigen, sollten Sie KI-Gateways in Betracht ziehen.