Fournisseurs d'IA
Explorez la latence et les prix des principaux fournisseurs d'IA
Fournisseur
Meilleur prix
Meilleure latence
Nombre de modèles
Deepinfra
AI Provider
Meilleur prix
66 Modèle Modèles
Meilleure latence
59 Modèle Modèles
Nombre de modèles
77 Modèle Modèles
Modèle | Latence | Prix mixte $ | Entrée $ | Sortie $ |
|---|---|---|---|---|
| llama-3-2-1b | 1st 0.44 | 2nd $0.01 | $0.01 | $0.01 |
| llama-3-1-8b-turbo-fp8 | 1st 0.18 | 1st $0.02 | $0.02 | $0.03 |
| llama-3-2-3b | 1st 0.46 | 1st $0.02 | $0.02 | $0.02 |
| mistral-nemo | 1st 0.19 | 1st $0.03 | $0.02 | $0.04 |
| mistral-7b | 3rd 0.45 | 1st $0.03 | $0.03 | $0.05 |
| llama-3-1-8b | 0.28 | 3rd $0.04 | $0.03 | $0.05 |
| llama-3-8b | 1st 0.31 | 1st $0.04 | $0.03 | $0.06 |
| llama-3-2-11b-vision | 2nd 1.92 | 1st $0.05 | $0.05 | $0.05 |
| gemma-3-4b | 1st 0.35 | 1st $0.05 | $0.04 | $0.08 |
| deepseek-ocr | 1st 0.17 | 2nd $0.05 | $0.03 | $0.10 |
| gpt-oss-20b-high | 2nd 0.18 | 2nd $0.06 | $0.03 | $0.14 |
| gemma-3-12b | 1st 0.29 | 1st $0.06 | $0.04 | $0.13 |
| mistral-small-3 | 3rd 0.39 | 1st $0.06 | $0.05 | $0.08 |
| mistral-small-3-1 | 3rd 0.39 | 1st $0.06 | $0.05 | $0.10 |
| nvidia-nemotron-nano-9b-v2 | 1st 0.42 | 1st $0.07 | $0.04 | $0.16 |
| devstral-small-may | 1st 0.25 | 1st $0.07 | $0.06 | $0.12 |
| gpt-oss-120b-high | 2nd 0.26 | 1st $0.08 | $0.04 | $0.19 |
| qwen2-5-coder-32b | 2nd 0.40 | 1st $0.08 | $0.06 | $0.15 |
| phi-4 | 1st 0.31 | 1st $0.09 | $0.07 | $0.14 |
| nvidia-nemotron-3-nano | 1st 0.24 | 1st $0.10 | $0.06 | $0.24 |
| mistral-small-3-2-fp8 | 1st 0.25 | 1st $0.11 | $0.07 | $0.20 |
| gemma-3-27b | 1st 0.36 | 1st $0.11 | $0.09 | $0.16 |
| qwen3-14b-fp8 | 1st 0.21 | 1st $0.12 | $0.08 | $0.24 |
| devstral-small | 1st 0.26 | 1st $0.12 | $0.07 | $0.28 |
| qwen3-coder-30b-a3b-fp8 | 1st 0.22 | 1st $0.12 | $0.07 | $0.26 |
| qwen3-30b-fp8 | 1st 0.21 | 1st $0.13 | $0.08 | $0.29 |
| llama-4-scout | 0.32 | 2nd $0.14 | $0.08 | $0.30 |
| qwq-32b-preview | 1st 0.37 | 1st $0.14 | $0.12 | $0.18 |
| qwen3-32b-fp8 | 1st 0.54 | 1st $0.15 | $0.10 | $0.30 |
| llama-3-3-70b-turbo-fp8 | 1st 0.52 | 1st $0.15 | $0.10 | $0.32 |
| qwen3-235b-2507 | 2nd 0.41 | 1st $0.17 | $0.07 | $0.46 |
| llama-nemotron-super-49b-v1-5 | 1st 0.44 | 1st $0.17 | $0.10 | $0.40 |
| qwen2-5-72b | 1st 0.31 | 2nd $0.19 | $0.12 | $0.39 |
| qwen3-vl-4b-fp8 | 1st 0.45 | 1st $0.23 | $0.10 | $0.60 |
| deepseek-v3-2-exp | 1st 0.62 | 1st $0.24 | $0.21 | $0.32 |
| qwen3-235b-fp8 | 1st 0.39 | 1st $0.25 | $0.13 | $0.60 |
| gpt-oss-120b-high-turbo | 1st 0.19 | 1st $0.26 | $0.15 | $0.60 |
| llama-4-maverick-fp8 | 1st 0.41 | 1st $0.26 | $0.15 | $0.60 |
| qwen3-vl-30b-a3b-fp8 | 1st 0.19 | 1st $0.26 | $0.15 | $0.60 |
| llama-3-3-70b | 0.55 | 2nd $0.27 | $0.23 | $0.40 |
| deepseek-r1-distill-qwen-32b | 1st 0.37 | 1st $0.27 | $0.27 | $0.27 |
| deepseek-v3-2 | 1st 0.61 | 1st $0.29 | $0.26 | $0.39 |
| hermes-3-llama-3-1-70b | 1st 0.30 | 1st $0.30 | $0.30 | $0.30 |
| nvidia-nemotron-nano-12b-v2-vl-fp8 | 1st 0.21 | 1st $0.30 | $0.20 | $0.60 |
| olmo-3-1-32b-instruct | 1st 0.24 | 1st $0.30 | $0.20 | $0.60 |
| llama-3-70b | 1st 0.35 | 1st $0.33 | $0.30 | $0.40 |
| qwen3-next-80b-a3b | 1st 0.30 | 2nd $0.34 | $0.09 | $1.10 |
| deepseek-v3-1-terminus-fp4 | 1st 0.42 | 1st $0.35 | $0.21 | $0.79 |
| deepseek-v3-1-fp4 | 1st 0.75 | 1st $0.35 | $0.21 | $0.79 |
| llama-3-2-90b-vision | 2nd 0.57 | 1st $0.36 | $0.35 | $0.40 |
| deepseek-v3-0324 | 0.57 | 1st $0.37 | $0.20 | $0.88 |
| llama-3-1-70b | 1st 0.42 | 1st $0.40 | $0.40 | $0.40 |
| llama-3-1-70b-turbo-fp8 | 1st 0.33 | 1st $0.40 | $0.40 | $0.40 |
| glm-4-5-air | 1st 0.17 | 2nd $0.42 | $0.20 | $1.10 |
| minimax-m2 | 1st 0.27 | 1st $0.45 | $0.25 | $1.02 |
| glm-4-6v-fp8 | 1st 0.25 | 1st $0.45 | $0.30 | $0.90 |
| qwen3-vl-235b-a22b-fp8 | 1st 0.34 | 1st $0.45 | $0.20 | $1.20 |
| deepseek-v3-dec | 1st 0.38 | 1st $0.46 | $0.32 | $0.89 |
| llama-4-maverick-turbo-fp8 | 1st 0.47 | 1st $0.50 | $0.50 | $0.50 |
| qwen3-coder-480b-turbo-fp4 | 1st 0.23 | 1st $0.51 | $0.28 | $1.20 |
| minimax-m2-1-fp8 | 1st 0.27 | 1st $0.51 | $0.28 | $1.20 |
| mixtral-8x7b | 2nd 0.32 | 1st $0.54 | $0.54 | $0.54 |
| qwen3-vl-8b-fp8 | 1st 15.00 | 1st $0.66 | $0.18 | $2.09 |
| glm-4-5 | 1st 0.36 | 1st $0.69 | $0.38 | $1.60 |
| qwen3-coder-480b-fp8 | 1st 0.28 | 2nd $0.70 | $0.40 | $1.60 |
| deepseek-r1-distill-llama-70b | 1st 0.36 | 1st $0.75 | $0.60 | $1.20 |
| glm-4-7-fp4 | 1st 0.31 | 1st $0.76 | $0.43 | $1.75 |
| glm-4-6-fp4 | 1st 0.38 | 1st $0.76 | $0.43 | $1.75 |
| qwen3-235b-a22b-2507-fp8 | 1st 0.30 | 2nd $0.77 | $0.23 | $2.39 |
| kimi-k2-0905 | 0.78 | 1st $0.80 | $0.40 | $2.00 |
| kimi-k2-thinking | 0.61 | 1st $0.85 | $0.47 | $2.00 |
| kimi-k2 | 0.76 | 1st $0.88 | $0.50 | $2.00 |
| deepseek-r1-0528 | 1st 0.38 | 1st $0.91 | $0.50 | $2.15 |
| glm-4-6-fp8 | 2nd 35.49 | 1st $0.93 | $0.60 | $1.90 |
| deepseek-r1-jan | 1st 0.35 | 1st $1.13 | $0.70 | $2.40 |
| llama-3-1-nemotron-70b | 1st 0.32 | 1st $1.20 | $1.20 | $1.20 |
| deepseek-r1-jan-turbo-fp4 | 1st 0.41 | 1st $1.50 | $1.00 | $3.00 |
llama-3-2-1b
Latence
0.44
Prix mixte $
$0.01
Entrée $
$0.01
Sortie $
$0.01
llama-3-1-8b-turbo-fp8
Latence
0.18
Prix mixte $
$0.02
Entrée $
$0.02
Sortie $
$0.03
llama-3-2-3b
Latence
0.46
Prix mixte $
$0.02
Entrée $
$0.02
Sortie $
$0.02
mistral-nemo
Latence
0.19
Prix mixte $
$0.03
Entrée $
$0.02
Sortie $
$0.04
mistral-7b
Latence
0.45
Prix mixte $
$0.03
Entrée $
$0.03
Sortie $
$0.05
llama-3-1-8b
Latence
0.28
Prix mixte $
$0.04
Entrée $
$0.03
Sortie $
$0.05
llama-3-8b
Latence
0.31
Prix mixte $
$0.04
Entrée $
$0.03
Sortie $
$0.06
llama-3-2-11b-vision
Latence
1.92
Prix mixte $
$0.05
Entrée $
$0.05
Sortie $
$0.05
gemma-3-4b
Latence
0.35
Prix mixte $
$0.05
Entrée $
$0.04
Sortie $
$0.08
deepseek-ocr
Latence
0.17
Prix mixte $
$0.05
Entrée $
$0.03
Sortie $
$0.10
gpt-oss-20b-high
Latence
0.18
Prix mixte $
$0.06
Entrée $
$0.03
Sortie $
$0.14
gemma-3-12b
Latence
0.29
Prix mixte $
$0.06
Entrée $
$0.04
Sortie $
$0.13
mistral-small-3
Latence
0.39
Prix mixte $
$0.06
Entrée $
$0.05
Sortie $
$0.08
mistral-small-3-1
Latence
0.39
Prix mixte $
$0.06
Entrée $
$0.05
Sortie $
$0.10
nvidia-nemotron-nano-9b-v2
Latence
0.42
Prix mixte $
$0.07
Entrée $
$0.04
Sortie $
$0.16
devstral-small-may
Latence
0.25
Prix mixte $
$0.07
Entrée $
$0.06
Sortie $
$0.12
gpt-oss-120b-high
Latence
0.26
Prix mixte $
$0.08
Entrée $
$0.04
Sortie $
$0.19
qwen2-5-coder-32b
Latence
0.40
Prix mixte $
$0.08
Entrée $
$0.06
Sortie $
$0.15
phi-4
Latence
0.31
Prix mixte $
$0.09
Entrée $
$0.07
Sortie $
$0.14
nvidia-nemotron-3-nano
Latence
0.24
Prix mixte $
$0.10
Entrée $
$0.06
Sortie $
$0.24
mistral-small-3-2-fp8
Latence
0.25
Prix mixte $
$0.11
Entrée $
$0.07
Sortie $
$0.20
gemma-3-27b
Latence
0.36
Prix mixte $
$0.11
Entrée $
$0.09
Sortie $
$0.16
qwen3-14b-fp8
Latence
0.21
Prix mixte $
$0.12
Entrée $
$0.08
Sortie $
$0.24
devstral-small
Latence
0.26
Prix mixte $
$0.12
Entrée $
$0.07
Sortie $
$0.28
qwen3-coder-30b-a3b-fp8
Latence
0.22
Prix mixte $
$0.12
Entrée $
$0.07
Sortie $
$0.26
qwen3-30b-fp8
Latence
0.21
Prix mixte $
$0.13
Entrée $
$0.08
Sortie $
$0.29
llama-4-scout
Latence
0.32
Prix mixte $
$0.14
Entrée $
$0.08
Sortie $
$0.30
qwq-32b-preview
Latence
0.37
Prix mixte $
$0.14
Entrée $
$0.12
Sortie $
$0.18
qwen3-32b-fp8
Latence
0.54
Prix mixte $
$0.15
Entrée $
$0.10
Sortie $
$0.30
llama-3-3-70b-turbo-fp8
Latence
0.52
Prix mixte $
$0.15
Entrée $
$0.10
Sortie $
$0.32
qwen3-235b-2507
Latence
0.41
Prix mixte $
$0.17
Entrée $
$0.07
Sortie $
$0.46
llama-nemotron-super-49b-v1-5
Latence
0.44
Prix mixte $
$0.17
Entrée $
$0.10
Sortie $
$0.40
qwen2-5-72b
Latence
0.31
Prix mixte $
$0.19
Entrée $
$0.12
Sortie $
$0.39
qwen3-vl-4b-fp8
Latence
0.45
Prix mixte $
$0.23
Entrée $
$0.10
Sortie $
$0.60
deepseek-v3-2-exp
Latence
0.62
Prix mixte $
$0.24
Entrée $
$0.21
Sortie $
$0.32
qwen3-235b-fp8
Latence
0.39
Prix mixte $
$0.25
Entrée $
$0.13
Sortie $
$0.60
gpt-oss-120b-high-turbo
Latence
0.19
Prix mixte $
$0.26
Entrée $
$0.15
Sortie $
$0.60
llama-4-maverick-fp8
Latence
0.41
Prix mixte $
$0.26
Entrée $
$0.15
Sortie $
$0.60
qwen3-vl-30b-a3b-fp8
Latence
0.19
Prix mixte $
$0.26
Entrée $
$0.15
Sortie $
$0.60
llama-3-3-70b
Latence
0.55
Prix mixte $
$0.27
Entrée $
$0.23
Sortie $
$0.40
deepseek-r1-distill-qwen-32b
Latence
0.37
Prix mixte $
$0.27
Entrée $
$0.27
Sortie $
$0.27
deepseek-v3-2
Latence
0.61
Prix mixte $
$0.29
Entrée $
$0.26
Sortie $
$0.39
hermes-3-llama-3-1-70b
Latence
0.30
Prix mixte $
$0.30
Entrée $
$0.30
Sortie $
$0.30
nvidia-nemotron-nano-12b-v2-vl-fp8
Latence
0.21
Prix mixte $
$0.30
Entrée $
$0.20
Sortie $
$0.60
olmo-3-1-32b-instruct
Latence
0.24
Prix mixte $
$0.30
Entrée $
$0.20
Sortie $
$0.60
llama-3-70b
Latence
0.35
Prix mixte $
$0.33
Entrée $
$0.30
Sortie $
$0.40
qwen3-next-80b-a3b
Latence
0.30
Prix mixte $
$0.34
Entrée $
$0.09
Sortie $
$1.10
deepseek-v3-1-terminus-fp4
Latence
0.42
Prix mixte $
$0.35
Entrée $
$0.21
Sortie $
$0.79
deepseek-v3-1-fp4
Latence
0.75
Prix mixte $
$0.35
Entrée $
$0.21
Sortie $
$0.79
llama-3-2-90b-vision
Latence
0.57
Prix mixte $
$0.36
Entrée $
$0.35
Sortie $
$0.40
deepseek-v3-0324
Latence
0.57
Prix mixte $
$0.37
Entrée $
$0.20
Sortie $
$0.88
llama-3-1-70b
Latence
0.42
Prix mixte $
$0.40
Entrée $
$0.40
Sortie $
$0.40
llama-3-1-70b-turbo-fp8
Latence
0.33
Prix mixte $
$0.40
Entrée $
$0.40
Sortie $
$0.40
glm-4-5-air
Latence
0.17
Prix mixte $
$0.42
Entrée $
$0.20
Sortie $
$1.10
minimax-m2
Latence
0.27
Prix mixte $
$0.45
Entrée $
$0.25
Sortie $
$1.02
glm-4-6v-fp8
Latence
0.25
Prix mixte $
$0.45
Entrée $
$0.30
Sortie $
$0.90
qwen3-vl-235b-a22b-fp8
Latence
0.34
Prix mixte $
$0.45
Entrée $
$0.20
Sortie $
$1.20
deepseek-v3-dec
Latence
0.38
Prix mixte $
$0.46
Entrée $
$0.32
Sortie $
$0.89
llama-4-maverick-turbo-fp8
Latence
0.47
Prix mixte $
$0.50
Entrée $
$0.50
Sortie $
$0.50
qwen3-coder-480b-turbo-fp4
Latence
0.23
Prix mixte $
$0.51
Entrée $
$0.28
Sortie $
$1.20
minimax-m2-1-fp8
Latence
0.27
Prix mixte $
$0.51
Entrée $
$0.28
Sortie $
$1.20
mixtral-8x7b
Latence
0.32
Prix mixte $
$0.54
Entrée $
$0.54
Sortie $
$0.54
qwen3-vl-8b-fp8
Latence
15.00
Prix mixte $
$0.66
Entrée $
$0.18
Sortie $
$2.09
glm-4-5
Latence
0.36
Prix mixte $
$0.69
Entrée $
$0.38
Sortie $
$1.60
qwen3-coder-480b-fp8
Latence
0.28
Prix mixte $
$0.70
Entrée $
$0.40
Sortie $
$1.60
deepseek-r1-distill-llama-70b
Latence
0.36
Prix mixte $
$0.75
Entrée $
$0.60
Sortie $
$1.20
glm-4-7-fp4
Latence
0.31
Prix mixte $
$0.76
Entrée $
$0.43
Sortie $
$1.75
glm-4-6-fp4
Latence
0.38
Prix mixte $
$0.76
Entrée $
$0.43
Sortie $
$1.75
qwen3-235b-a22b-2507-fp8
Latence
0.30
Prix mixte $
$0.77
Entrée $
$0.23
Sortie $
$2.39
kimi-k2-0905
Latence
0.78
Prix mixte $
$0.80
Entrée $
$0.40
Sortie $
$2.00
kimi-k2-thinking
Latence
0.61
Prix mixte $
$0.85
Entrée $
$0.47
Sortie $
$2.00
kimi-k2
Latence
0.76
Prix mixte $
$0.88
Entrée $
$0.50
Sortie $
$2.00
deepseek-r1-0528
Latence
0.38
Prix mixte $
$0.91
Entrée $
$0.50
Sortie $
$2.15
glm-4-6-fp8
Latence
35.49
Prix mixte $
$0.93
Entrée $
$0.60
Sortie $
$1.90
deepseek-r1-jan
Latence
0.35
Prix mixte $
$1.13
Entrée $
$0.70
Sortie $
$2.40
llama-3-1-nemotron-70b
Latence
0.32
Prix mixte $
$1.20
Entrée $
$1.20
Sortie $
$1.20
deepseek-r1-jan-turbo-fp4
Latence
0.41
Prix mixte $
$1.50
Entrée $
$1.00
Sortie $
$3.00
FAQ
Les laboratoires d'IA (OpenAI, Anthropic, Google) développent les modèles d'IA fondamentaux. Les fournisseurs d'IA (Baseten, Together AI, Groq, DeepInfra) hébergent et mettent à disposition ces modèles via des services d'infrastructure, gérant les ressources de calcul, les API et la supervision. Les passerelles d'IA servent d'intermédiaires, offrant un accès API unifié à plusieurs fournisseurs grâce à un routage intelligent et une optimisation des coûts.
Comparez les structures tarifaires des fournisseurs, basées sur les jetons. Par exemple, notre analyse comparative a révélé qu'OpenRouter propose le tarif le plus bas (0,08 $ par million de jetons de sortie) pour Llama 4 Scout, suivi de SambaNova à 0,11 $. Nous avons également examiné les tarifs spécifiques à chaque modèle chez les fournisseurs d'IA , où des plateformes comme Baseten proposent un suivi des coûts par requête et par type de GPU pour faciliter la comparaison.
Oui, les limites de débit varient considérablement. Les fournisseurs à haut débit comme Cerebras et SambaNova sont optimisés pour les charges de travail importantes, tandis que Groq se spécialise dans les réponses à très faible latence. Des plateformes comme Baseten permettent de configurer les paramètres de mise à l'échelle automatique, mais une mauvaise configuration peut impacter les coûts et la latence. Choisissez en fonction de vos besoins : capacité de pointe ou performances stables.
Oui, plusieurs options permettent d'accéder à des modèles d'IA gratuits. De nombreux modèles open source, comme Llama, Mistral et Gemma, sont disponibles via des API gratuites sur des plateformes telles que Hugging Face, OpenRouter et Together AI, bien qu'elles soient généralement soumises à des limitations de débit et d'utilisation. Les modèles LLM open source offrent une sécurité des données renforcée, car ils peuvent être déployés sur une infrastructure privée. De plus, ils éliminent les frais de licence et les risques de dépendance vis-à-vis d'un fournisseur. Si les modèles eux-mêmes sont gratuits, les coûts de déploiement varient selon qu'ils sont exécutés localement (gratuit si votre matériel le permet), chez des fournisseurs de services gérés ou dans le cloud.
Choisissez vos fournisseurs d'IA en fonction de vos priorités. Pour un débogage détaillé, privilégiez Baseten (traçage au niveau des requêtes) ou Together AI (métriques par version). Pour une latence ultra-faible, notre test a révélé que Groq offre une latence de 0,13 s pour le premier jeton. Pour optimiser les coûts, Parasail propose une commutation GPU flexible. Pour un déploiement rapide, Fireworks AI fournit des points de terminaison API immédiats. Pour la gouvernance d'entreprise, Databricks intègre le suivi MLflow et la traçabilité des données. Envisagez l'utilisation de passerelles d'IA si vous avez besoin de flexibilité entre plusieurs fournisseurs.