KI Anbieter
Vergleichen Sie Latenz und Preise führender Anbieter von KI-Produkten.
Anbieter
Bester Preis
Beste Latenz
Anzahl Modelle
Deepinfra
AI Provider
Bester Preis
66 Modell Modelle
Beste Latenz
59 Modell Modelle
Anzahl Modelle
77 Modell Modelle
Modell | Latenz | Mischpreis $ | Eingabe $ | Ausgabe $ |
|---|---|---|---|---|
| llama-3-2-1b | 1st 0.44 | 2nd $0.01 | $0.01 | $0.01 |
| llama-3-1-8b-turbo-fp8 | 1st 0.18 | 1st $0.02 | $0.02 | $0.03 |
| llama-3-2-3b | 1st 0.46 | 1st $0.02 | $0.02 | $0.02 |
| mistral-nemo | 1st 0.19 | 1st $0.03 | $0.02 | $0.04 |
| mistral-7b | 3rd 0.45 | 1st $0.03 | $0.03 | $0.05 |
| llama-3-1-8b | 0.28 | 3rd $0.04 | $0.03 | $0.05 |
| llama-3-8b | 1st 0.31 | 1st $0.04 | $0.03 | $0.06 |
| llama-3-2-11b-vision | 2nd 1.92 | 1st $0.05 | $0.05 | $0.05 |
| gemma-3-4b | 1st 0.35 | 1st $0.05 | $0.04 | $0.08 |
| deepseek-ocr | 1st 0.17 | 2nd $0.05 | $0.03 | $0.10 |
| gpt-oss-20b-high | 2nd 0.18 | 2nd $0.06 | $0.03 | $0.14 |
| gemma-3-12b | 1st 0.29 | 1st $0.06 | $0.04 | $0.13 |
| mistral-small-3 | 3rd 0.39 | 1st $0.06 | $0.05 | $0.08 |
| mistral-small-3-1 | 3rd 0.39 | 1st $0.06 | $0.05 | $0.10 |
| nvidia-nemotron-nano-9b-v2 | 1st 0.42 | 1st $0.07 | $0.04 | $0.16 |
| devstral-small-may | 1st 0.25 | 1st $0.07 | $0.06 | $0.12 |
| gpt-oss-120b-high | 2nd 0.26 | 1st $0.08 | $0.04 | $0.19 |
| qwen2-5-coder-32b | 2nd 0.40 | 1st $0.08 | $0.06 | $0.15 |
| phi-4 | 1st 0.31 | 1st $0.09 | $0.07 | $0.14 |
| nvidia-nemotron-3-nano | 1st 0.24 | 1st $0.10 | $0.06 | $0.24 |
| mistral-small-3-2-fp8 | 1st 0.25 | 1st $0.11 | $0.07 | $0.20 |
| gemma-3-27b | 1st 0.36 | 1st $0.11 | $0.09 | $0.16 |
| qwen3-14b-fp8 | 1st 0.21 | 1st $0.12 | $0.08 | $0.24 |
| devstral-small | 1st 0.26 | 1st $0.12 | $0.07 | $0.28 |
| qwen3-coder-30b-a3b-fp8 | 1st 0.22 | 1st $0.12 | $0.07 | $0.26 |
| qwen3-30b-fp8 | 1st 0.21 | 1st $0.13 | $0.08 | $0.29 |
| llama-4-scout | 0.32 | 2nd $0.14 | $0.08 | $0.30 |
| qwq-32b-preview | 1st 0.37 | 1st $0.14 | $0.12 | $0.18 |
| qwen3-32b-fp8 | 1st 0.54 | 1st $0.15 | $0.10 | $0.30 |
| llama-3-3-70b-turbo-fp8 | 1st 0.52 | 1st $0.15 | $0.10 | $0.32 |
| qwen3-235b-2507 | 2nd 0.41 | 1st $0.17 | $0.07 | $0.46 |
| llama-nemotron-super-49b-v1-5 | 1st 0.44 | 1st $0.17 | $0.10 | $0.40 |
| qwen2-5-72b | 1st 0.31 | 2nd $0.19 | $0.12 | $0.39 |
| qwen3-vl-4b-fp8 | 1st 0.45 | 1st $0.23 | $0.10 | $0.60 |
| deepseek-v3-2-exp | 1st 0.62 | 1st $0.24 | $0.21 | $0.32 |
| qwen3-235b-fp8 | 1st 0.39 | 1st $0.25 | $0.13 | $0.60 |
| gpt-oss-120b-high-turbo | 1st 0.19 | 1st $0.26 | $0.15 | $0.60 |
| llama-4-maverick-fp8 | 1st 0.41 | 1st $0.26 | $0.15 | $0.60 |
| qwen3-vl-30b-a3b-fp8 | 1st 0.19 | 1st $0.26 | $0.15 | $0.60 |
| llama-3-3-70b | 0.55 | 2nd $0.27 | $0.23 | $0.40 |
| deepseek-r1-distill-qwen-32b | 1st 0.37 | 1st $0.27 | $0.27 | $0.27 |
| deepseek-v3-2 | 1st 0.61 | 1st $0.29 | $0.26 | $0.39 |
| hermes-3-llama-3-1-70b | 1st 0.30 | 1st $0.30 | $0.30 | $0.30 |
| nvidia-nemotron-nano-12b-v2-vl-fp8 | 1st 0.21 | 1st $0.30 | $0.20 | $0.60 |
| olmo-3-1-32b-instruct | 1st 0.24 | 1st $0.30 | $0.20 | $0.60 |
| llama-3-70b | 1st 0.35 | 1st $0.33 | $0.30 | $0.40 |
| qwen3-next-80b-a3b | 1st 0.30 | 2nd $0.34 | $0.09 | $1.10 |
| deepseek-v3-1-terminus-fp4 | 1st 0.42 | 1st $0.35 | $0.21 | $0.79 |
| deepseek-v3-1-fp4 | 1st 0.75 | 1st $0.35 | $0.21 | $0.79 |
| llama-3-2-90b-vision | 2nd 0.57 | 1st $0.36 | $0.35 | $0.40 |
| deepseek-v3-0324 | 0.57 | 1st $0.37 | $0.20 | $0.88 |
| llama-3-1-70b | 1st 0.42 | 1st $0.40 | $0.40 | $0.40 |
| llama-3-1-70b-turbo-fp8 | 1st 0.33 | 1st $0.40 | $0.40 | $0.40 |
| glm-4-5-air | 1st 0.17 | 2nd $0.42 | $0.20 | $1.10 |
| minimax-m2 | 1st 0.27 | 1st $0.45 | $0.25 | $1.02 |
| glm-4-6v-fp8 | 1st 0.25 | 1st $0.45 | $0.30 | $0.90 |
| qwen3-vl-235b-a22b-fp8 | 1st 0.34 | 1st $0.45 | $0.20 | $1.20 |
| deepseek-v3-dec | 1st 0.38 | 1st $0.46 | $0.32 | $0.89 |
| llama-4-maverick-turbo-fp8 | 1st 0.47 | 1st $0.50 | $0.50 | $0.50 |
| qwen3-coder-480b-turbo-fp4 | 1st 0.23 | 1st $0.51 | $0.28 | $1.20 |
| minimax-m2-1-fp8 | 1st 0.27 | 1st $0.51 | $0.28 | $1.20 |
| mixtral-8x7b | 2nd 0.32 | 1st $0.54 | $0.54 | $0.54 |
| qwen3-vl-8b-fp8 | 1st 15.00 | 1st $0.66 | $0.18 | $2.09 |
| glm-4-5 | 1st 0.36 | 1st $0.69 | $0.38 | $1.60 |
| qwen3-coder-480b-fp8 | 1st 0.28 | 2nd $0.70 | $0.40 | $1.60 |
| deepseek-r1-distill-llama-70b | 1st 0.36 | 1st $0.75 | $0.60 | $1.20 |
| glm-4-7-fp4 | 1st 0.31 | 1st $0.76 | $0.43 | $1.75 |
| glm-4-6-fp4 | 1st 0.38 | 1st $0.76 | $0.43 | $1.75 |
| qwen3-235b-a22b-2507-fp8 | 1st 0.30 | 2nd $0.77 | $0.23 | $2.39 |
| kimi-k2-0905 | 0.78 | 1st $0.80 | $0.40 | $2.00 |
| kimi-k2-thinking | 0.61 | 1st $0.85 | $0.47 | $2.00 |
| kimi-k2 | 0.76 | 1st $0.88 | $0.50 | $2.00 |
| deepseek-r1-0528 | 1st 0.38 | 1st $0.91 | $0.50 | $2.15 |
| glm-4-6-fp8 | 2nd 35.49 | 1st $0.93 | $0.60 | $1.90 |
| deepseek-r1-jan | 1st 0.35 | 1st $1.13 | $0.70 | $2.40 |
| llama-3-1-nemotron-70b | 1st 0.32 | 1st $1.20 | $1.20 | $1.20 |
| deepseek-r1-jan-turbo-fp4 | 1st 0.41 | 1st $1.50 | $1.00 | $3.00 |
llama-3-2-1b
Latenz
0.44
Mischpreis $
$0.01
Eingabe $
$0.01
Ausgabe $
$0.01
llama-3-1-8b-turbo-fp8
Latenz
0.18
Mischpreis $
$0.02
Eingabe $
$0.02
Ausgabe $
$0.03
llama-3-2-3b
Latenz
0.46
Mischpreis $
$0.02
Eingabe $
$0.02
Ausgabe $
$0.02
mistral-nemo
Latenz
0.19
Mischpreis $
$0.03
Eingabe $
$0.02
Ausgabe $
$0.04
mistral-7b
Latenz
0.45
Mischpreis $
$0.03
Eingabe $
$0.03
Ausgabe $
$0.05
llama-3-1-8b
Latenz
0.28
Mischpreis $
$0.04
Eingabe $
$0.03
Ausgabe $
$0.05
llama-3-8b
Latenz
0.31
Mischpreis $
$0.04
Eingabe $
$0.03
Ausgabe $
$0.06
llama-3-2-11b-vision
Latenz
1.92
Mischpreis $
$0.05
Eingabe $
$0.05
Ausgabe $
$0.05
gemma-3-4b
Latenz
0.35
Mischpreis $
$0.05
Eingabe $
$0.04
Ausgabe $
$0.08
deepseek-ocr
Latenz
0.17
Mischpreis $
$0.05
Eingabe $
$0.03
Ausgabe $
$0.10
gpt-oss-20b-high
Latenz
0.18
Mischpreis $
$0.06
Eingabe $
$0.03
Ausgabe $
$0.14
gemma-3-12b
Latenz
0.29
Mischpreis $
$0.06
Eingabe $
$0.04
Ausgabe $
$0.13
mistral-small-3
Latenz
0.39
Mischpreis $
$0.06
Eingabe $
$0.05
Ausgabe $
$0.08
mistral-small-3-1
Latenz
0.39
Mischpreis $
$0.06
Eingabe $
$0.05
Ausgabe $
$0.10
nvidia-nemotron-nano-9b-v2
Latenz
0.42
Mischpreis $
$0.07
Eingabe $
$0.04
Ausgabe $
$0.16
devstral-small-may
Latenz
0.25
Mischpreis $
$0.07
Eingabe $
$0.06
Ausgabe $
$0.12
gpt-oss-120b-high
Latenz
0.26
Mischpreis $
$0.08
Eingabe $
$0.04
Ausgabe $
$0.19
qwen2-5-coder-32b
Latenz
0.40
Mischpreis $
$0.08
Eingabe $
$0.06
Ausgabe $
$0.15
phi-4
Latenz
0.31
Mischpreis $
$0.09
Eingabe $
$0.07
Ausgabe $
$0.14
nvidia-nemotron-3-nano
Latenz
0.24
Mischpreis $
$0.10
Eingabe $
$0.06
Ausgabe $
$0.24
mistral-small-3-2-fp8
Latenz
0.25
Mischpreis $
$0.11
Eingabe $
$0.07
Ausgabe $
$0.20
gemma-3-27b
Latenz
0.36
Mischpreis $
$0.11
Eingabe $
$0.09
Ausgabe $
$0.16
qwen3-14b-fp8
Latenz
0.21
Mischpreis $
$0.12
Eingabe $
$0.08
Ausgabe $
$0.24
devstral-small
Latenz
0.26
Mischpreis $
$0.12
Eingabe $
$0.07
Ausgabe $
$0.28
qwen3-coder-30b-a3b-fp8
Latenz
0.22
Mischpreis $
$0.12
Eingabe $
$0.07
Ausgabe $
$0.26
qwen3-30b-fp8
Latenz
0.21
Mischpreis $
$0.13
Eingabe $
$0.08
Ausgabe $
$0.29
llama-4-scout
Latenz
0.32
Mischpreis $
$0.14
Eingabe $
$0.08
Ausgabe $
$0.30
qwq-32b-preview
Latenz
0.37
Mischpreis $
$0.14
Eingabe $
$0.12
Ausgabe $
$0.18
qwen3-32b-fp8
Latenz
0.54
Mischpreis $
$0.15
Eingabe $
$0.10
Ausgabe $
$0.30
llama-3-3-70b-turbo-fp8
Latenz
0.52
Mischpreis $
$0.15
Eingabe $
$0.10
Ausgabe $
$0.32
qwen3-235b-2507
Latenz
0.41
Mischpreis $
$0.17
Eingabe $
$0.07
Ausgabe $
$0.46
llama-nemotron-super-49b-v1-5
Latenz
0.44
Mischpreis $
$0.17
Eingabe $
$0.10
Ausgabe $
$0.40
qwen2-5-72b
Latenz
0.31
Mischpreis $
$0.19
Eingabe $
$0.12
Ausgabe $
$0.39
qwen3-vl-4b-fp8
Latenz
0.45
Mischpreis $
$0.23
Eingabe $
$0.10
Ausgabe $
$0.60
deepseek-v3-2-exp
Latenz
0.62
Mischpreis $
$0.24
Eingabe $
$0.21
Ausgabe $
$0.32
qwen3-235b-fp8
Latenz
0.39
Mischpreis $
$0.25
Eingabe $
$0.13
Ausgabe $
$0.60
gpt-oss-120b-high-turbo
Latenz
0.19
Mischpreis $
$0.26
Eingabe $
$0.15
Ausgabe $
$0.60
llama-4-maverick-fp8
Latenz
0.41
Mischpreis $
$0.26
Eingabe $
$0.15
Ausgabe $
$0.60
qwen3-vl-30b-a3b-fp8
Latenz
0.19
Mischpreis $
$0.26
Eingabe $
$0.15
Ausgabe $
$0.60
llama-3-3-70b
Latenz
0.55
Mischpreis $
$0.27
Eingabe $
$0.23
Ausgabe $
$0.40
deepseek-r1-distill-qwen-32b
Latenz
0.37
Mischpreis $
$0.27
Eingabe $
$0.27
Ausgabe $
$0.27
deepseek-v3-2
Latenz
0.61
Mischpreis $
$0.29
Eingabe $
$0.26
Ausgabe $
$0.39
hermes-3-llama-3-1-70b
Latenz
0.30
Mischpreis $
$0.30
Eingabe $
$0.30
Ausgabe $
$0.30
nvidia-nemotron-nano-12b-v2-vl-fp8
Latenz
0.21
Mischpreis $
$0.30
Eingabe $
$0.20
Ausgabe $
$0.60
olmo-3-1-32b-instruct
Latenz
0.24
Mischpreis $
$0.30
Eingabe $
$0.20
Ausgabe $
$0.60
llama-3-70b
Latenz
0.35
Mischpreis $
$0.33
Eingabe $
$0.30
Ausgabe $
$0.40
qwen3-next-80b-a3b
Latenz
0.30
Mischpreis $
$0.34
Eingabe $
$0.09
Ausgabe $
$1.10
deepseek-v3-1-terminus-fp4
Latenz
0.42
Mischpreis $
$0.35
Eingabe $
$0.21
Ausgabe $
$0.79
deepseek-v3-1-fp4
Latenz
0.75
Mischpreis $
$0.35
Eingabe $
$0.21
Ausgabe $
$0.79
llama-3-2-90b-vision
Latenz
0.57
Mischpreis $
$0.36
Eingabe $
$0.35
Ausgabe $
$0.40
deepseek-v3-0324
Latenz
0.57
Mischpreis $
$0.37
Eingabe $
$0.20
Ausgabe $
$0.88
llama-3-1-70b
Latenz
0.42
Mischpreis $
$0.40
Eingabe $
$0.40
Ausgabe $
$0.40
llama-3-1-70b-turbo-fp8
Latenz
0.33
Mischpreis $
$0.40
Eingabe $
$0.40
Ausgabe $
$0.40
glm-4-5-air
Latenz
0.17
Mischpreis $
$0.42
Eingabe $
$0.20
Ausgabe $
$1.10
minimax-m2
Latenz
0.27
Mischpreis $
$0.45
Eingabe $
$0.25
Ausgabe $
$1.02
glm-4-6v-fp8
Latenz
0.25
Mischpreis $
$0.45
Eingabe $
$0.30
Ausgabe $
$0.90
qwen3-vl-235b-a22b-fp8
Latenz
0.34
Mischpreis $
$0.45
Eingabe $
$0.20
Ausgabe $
$1.20
deepseek-v3-dec
Latenz
0.38
Mischpreis $
$0.46
Eingabe $
$0.32
Ausgabe $
$0.89
llama-4-maverick-turbo-fp8
Latenz
0.47
Mischpreis $
$0.50
Eingabe $
$0.50
Ausgabe $
$0.50
qwen3-coder-480b-turbo-fp4
Latenz
0.23
Mischpreis $
$0.51
Eingabe $
$0.28
Ausgabe $
$1.20
minimax-m2-1-fp8
Latenz
0.27
Mischpreis $
$0.51
Eingabe $
$0.28
Ausgabe $
$1.20
mixtral-8x7b
Latenz
0.32
Mischpreis $
$0.54
Eingabe $
$0.54
Ausgabe $
$0.54
qwen3-vl-8b-fp8
Latenz
15.00
Mischpreis $
$0.66
Eingabe $
$0.18
Ausgabe $
$2.09
glm-4-5
Latenz
0.36
Mischpreis $
$0.69
Eingabe $
$0.38
Ausgabe $
$1.60
qwen3-coder-480b-fp8
Latenz
0.28
Mischpreis $
$0.70
Eingabe $
$0.40
Ausgabe $
$1.60
deepseek-r1-distill-llama-70b
Latenz
0.36
Mischpreis $
$0.75
Eingabe $
$0.60
Ausgabe $
$1.20
glm-4-7-fp4
Latenz
0.31
Mischpreis $
$0.76
Eingabe $
$0.43
Ausgabe $
$1.75
glm-4-6-fp4
Latenz
0.38
Mischpreis $
$0.76
Eingabe $
$0.43
Ausgabe $
$1.75
qwen3-235b-a22b-2507-fp8
Latenz
0.30
Mischpreis $
$0.77
Eingabe $
$0.23
Ausgabe $
$2.39
kimi-k2-0905
Latenz
0.78
Mischpreis $
$0.80
Eingabe $
$0.40
Ausgabe $
$2.00
kimi-k2-thinking
Latenz
0.61
Mischpreis $
$0.85
Eingabe $
$0.47
Ausgabe $
$2.00
kimi-k2
Latenz
0.76
Mischpreis $
$0.88
Eingabe $
$0.50
Ausgabe $
$2.00
deepseek-r1-0528
Latenz
0.38
Mischpreis $
$0.91
Eingabe $
$0.50
Ausgabe $
$2.15
glm-4-6-fp8
Latenz
35.49
Mischpreis $
$0.93
Eingabe $
$0.60
Ausgabe $
$1.90
deepseek-r1-jan
Latenz
0.35
Mischpreis $
$1.13
Eingabe $
$0.70
Ausgabe $
$2.40
llama-3-1-nemotron-70b
Latenz
0.32
Mischpreis $
$1.20
Eingabe $
$1.20
Ausgabe $
$1.20
deepseek-r1-jan-turbo-fp4
Latenz
0.41
Mischpreis $
$1.50
Eingabe $
$1.00
Ausgabe $
$3.00
FAQ
KI Labs (Open AI, Anthropic, Google) entwickeln grundlegende KI Modelle. KI Anbieter (Baseten, Together AI, Groq, DeepInfra) hosten und betreiben diese Modelle über die Infrastruktur Services und verwalten Rechenressourcen API s sowie das Monitoring. KI Gateways fungieren als Middleware und bieten einheitlichen API Zugriff auf mehrere Anbieter mit intelligentem Routing und Kostenoptimierung.
Vergleichen Sie die tokenbasierten Preisstrukturen der Anbieter. In unserem Benchmark zeigte sich beispielsweise, dass OpenRouter mit 0,08 US-Dollar pro Million Output-Token für Llama 4 Scout die niedrigsten Kosten bietet, gefolgt von SambaNova mit 0,11 US-Dollar. Wir untersuchten auch die modellspezifische Preisgestaltung verschiedener KI-Anbieter . Plattformen wie Baseten ermöglichen dabei eine Kostenverfolgung pro Anfrage nach GPU-Typ für einen einfachen Vergleich.
Ja, die Ratenbegrenzungen variieren erheblich. High-Durchsatzanbieter wie Cerebras und SambaNova sind für große Workloads optimiert, während Groq auf extrem niedrige Latenzzeiten spezialisiert ist. Plattformen wie Baseten ermöglichen die Konfiguration von Autoscaling-Parametern, Fehlkonfigurationen können jedoch Kosten und Latenz beeinflussen. Wählen Sie je nachdem, ob Sie Spitzenlastkapazität oder Dauerleistung benötigen.
Für den Zugriff auf kostenlose KI-Modelle gibt es verschiedene Möglichkeiten. Viele Open-Source-Modelle wie Llama,Mistral und Gemma sind über kostenlose Tarife auf Plattformen wie Hugging Face, OpenRouter und Together AI verfügbar, unterliegen jedoch in der Regel Ratenbegrenzungen und Nutzungsbeschränkungen. Open-Source-Lösungen LLMs bieten eine höhere Datensicherheit, da sie auf eigener Infrastruktur eingesetzt werden können. Zudem entfallen Lizenzgebühren und das Risiko der Anbieterabhängigkeit. Die Modelle selbst sind zwar kostenlos, die Bereitstellungskosten variieren jedoch je nachdem, ob sie lokal (kostenlos, sofern die Hardware dies unterstützt), bei Managed-Anbietern oder in der Cloud betrieben werden.
Wählen Sie KI-Anbieter entsprechend Ihren Prioritäten. Für detailliertes Debugging wählen Sie Baseten (Anfrage-Tracing) oder Together AI (versionsbezogene Metriken). Für extrem niedrige Latenzzeiten liefert Groq in unserem Benchmark eine Latenz des ersten Tokens von nur 0,13 Sekunden. Parasail bietet flexible GPU-Wechselmöglichkeiten zur Kostenoptimierung. Fireworks AI ermöglicht die schnelle Bereitstellung von API-Endpunkten. Databricks integriert MLflow-Tracking und Datenherkunft für die Unternehmensführung. Wenn Sie Flexibilität bei mehreren Anbietern benötigen, sollten Sie KI-Gateways in Betracht ziehen.