Proveedores de IA
Descubre la latencia y los precios de los principales proveedores de IA.
Proveedor
Mejor precio
Mejor latencia
N.º de modelos
Deepinfra
AI Provider
Mejor precio
66 Modelo Modelos
Mejor latencia
59 Modelo Modelos
N.º de modelos
77 Modelo Modelos
Modelo | Latencia | Precio combinado $ | Entrada $ | Salida $ |
|---|---|---|---|---|
| llama-3-2-1b | 1st 0.44 | 2nd $0.01 | $0.01 | $0.01 |
| llama-3-1-8b-turbo-fp8 | 1st 0.18 | 1st $0.02 | $0.02 | $0.03 |
| llama-3-2-3b | 1st 0.46 | 1st $0.02 | $0.02 | $0.02 |
| mistral-nemo | 1st 0.19 | 1st $0.03 | $0.02 | $0.04 |
| mistral-7b | 3rd 0.45 | 1st $0.03 | $0.03 | $0.05 |
| llama-3-1-8b | 0.28 | 3rd $0.04 | $0.03 | $0.05 |
| llama-3-8b | 1st 0.31 | 1st $0.04 | $0.03 | $0.06 |
| llama-3-2-11b-vision | 2nd 1.92 | 1st $0.05 | $0.05 | $0.05 |
| gemma-3-4b | 1st 0.35 | 1st $0.05 | $0.04 | $0.08 |
| deepseek-ocr | 1st 0.17 | 2nd $0.05 | $0.03 | $0.10 |
| gpt-oss-20b-high | 2nd 0.18 | 2nd $0.06 | $0.03 | $0.14 |
| gemma-3-12b | 1st 0.29 | 1st $0.06 | $0.04 | $0.13 |
| mistral-small-3 | 3rd 0.39 | 1st $0.06 | $0.05 | $0.08 |
| mistral-small-3-1 | 3rd 0.39 | 1st $0.06 | $0.05 | $0.10 |
| nvidia-nemotron-nano-9b-v2 | 1st 0.42 | 1st $0.07 | $0.04 | $0.16 |
| devstral-small-may | 1st 0.25 | 1st $0.07 | $0.06 | $0.12 |
| gpt-oss-120b-high | 2nd 0.26 | 1st $0.08 | $0.04 | $0.19 |
| qwen2-5-coder-32b | 2nd 0.40 | 1st $0.08 | $0.06 | $0.15 |
| phi-4 | 1st 0.31 | 1st $0.09 | $0.07 | $0.14 |
| nvidia-nemotron-3-nano | 1st 0.24 | 1st $0.10 | $0.06 | $0.24 |
| mistral-small-3-2-fp8 | 1st 0.25 | 1st $0.11 | $0.07 | $0.20 |
| gemma-3-27b | 1st 0.36 | 1st $0.11 | $0.09 | $0.16 |
| qwen3-14b-fp8 | 1st 0.21 | 1st $0.12 | $0.08 | $0.24 |
| devstral-small | 1st 0.26 | 1st $0.12 | $0.07 | $0.28 |
| qwen3-coder-30b-a3b-fp8 | 1st 0.22 | 1st $0.12 | $0.07 | $0.26 |
| qwen3-30b-fp8 | 1st 0.21 | 1st $0.13 | $0.08 | $0.29 |
| llama-4-scout | 0.32 | 2nd $0.14 | $0.08 | $0.30 |
| qwq-32b-preview | 1st 0.37 | 1st $0.14 | $0.12 | $0.18 |
| qwen3-32b-fp8 | 1st 0.54 | 1st $0.15 | $0.10 | $0.30 |
| llama-3-3-70b-turbo-fp8 | 1st 0.52 | 1st $0.15 | $0.10 | $0.32 |
| qwen3-235b-2507 | 2nd 0.41 | 1st $0.17 | $0.07 | $0.46 |
| llama-nemotron-super-49b-v1-5 | 1st 0.44 | 1st $0.17 | $0.10 | $0.40 |
| qwen2-5-72b | 1st 0.31 | 2nd $0.19 | $0.12 | $0.39 |
| qwen3-vl-4b-fp8 | 1st 0.45 | 1st $0.23 | $0.10 | $0.60 |
| deepseek-v3-2-exp | 1st 0.62 | 1st $0.24 | $0.21 | $0.32 |
| qwen3-235b-fp8 | 1st 0.39 | 1st $0.25 | $0.13 | $0.60 |
| gpt-oss-120b-high-turbo | 1st 0.19 | 1st $0.26 | $0.15 | $0.60 |
| llama-4-maverick-fp8 | 1st 0.41 | 1st $0.26 | $0.15 | $0.60 |
| qwen3-vl-30b-a3b-fp8 | 1st 0.19 | 1st $0.26 | $0.15 | $0.60 |
| llama-3-3-70b | 0.55 | 2nd $0.27 | $0.23 | $0.40 |
| deepseek-r1-distill-qwen-32b | 1st 0.37 | 1st $0.27 | $0.27 | $0.27 |
| deepseek-v3-2 | 1st 0.61 | 1st $0.29 | $0.26 | $0.39 |
| hermes-3-llama-3-1-70b | 1st 0.30 | 1st $0.30 | $0.30 | $0.30 |
| nvidia-nemotron-nano-12b-v2-vl-fp8 | 1st 0.21 | 1st $0.30 | $0.20 | $0.60 |
| olmo-3-1-32b-instruct | 1st 0.24 | 1st $0.30 | $0.20 | $0.60 |
| llama-3-70b | 1st 0.35 | 1st $0.33 | $0.30 | $0.40 |
| qwen3-next-80b-a3b | 1st 0.30 | 2nd $0.34 | $0.09 | $1.10 |
| deepseek-v3-1-terminus-fp4 | 1st 0.42 | 1st $0.35 | $0.21 | $0.79 |
| deepseek-v3-1-fp4 | 1st 0.75 | 1st $0.35 | $0.21 | $0.79 |
| llama-3-2-90b-vision | 2nd 0.57 | 1st $0.36 | $0.35 | $0.40 |
| deepseek-v3-0324 | 0.57 | 1st $0.37 | $0.20 | $0.88 |
| llama-3-1-70b | 1st 0.42 | 1st $0.40 | $0.40 | $0.40 |
| llama-3-1-70b-turbo-fp8 | 1st 0.33 | 1st $0.40 | $0.40 | $0.40 |
| glm-4-5-air | 1st 0.17 | 2nd $0.42 | $0.20 | $1.10 |
| minimax-m2 | 1st 0.27 | 1st $0.45 | $0.25 | $1.02 |
| glm-4-6v-fp8 | 1st 0.25 | 1st $0.45 | $0.30 | $0.90 |
| qwen3-vl-235b-a22b-fp8 | 1st 0.34 | 1st $0.45 | $0.20 | $1.20 |
| deepseek-v3-dec | 1st 0.38 | 1st $0.46 | $0.32 | $0.89 |
| llama-4-maverick-turbo-fp8 | 1st 0.47 | 1st $0.50 | $0.50 | $0.50 |
| qwen3-coder-480b-turbo-fp4 | 1st 0.23 | 1st $0.51 | $0.28 | $1.20 |
| minimax-m2-1-fp8 | 1st 0.27 | 1st $0.51 | $0.28 | $1.20 |
| mixtral-8x7b | 2nd 0.32 | 1st $0.54 | $0.54 | $0.54 |
| qwen3-vl-8b-fp8 | 1st 15.00 | 1st $0.66 | $0.18 | $2.09 |
| glm-4-5 | 1st 0.36 | 1st $0.69 | $0.38 | $1.60 |
| qwen3-coder-480b-fp8 | 1st 0.28 | 2nd $0.70 | $0.40 | $1.60 |
| deepseek-r1-distill-llama-70b | 1st 0.36 | 1st $0.75 | $0.60 | $1.20 |
| glm-4-7-fp4 | 1st 0.31 | 1st $0.76 | $0.43 | $1.75 |
| glm-4-6-fp4 | 1st 0.38 | 1st $0.76 | $0.43 | $1.75 |
| qwen3-235b-a22b-2507-fp8 | 1st 0.30 | 2nd $0.77 | $0.23 | $2.39 |
| kimi-k2-0905 | 0.78 | 1st $0.80 | $0.40 | $2.00 |
| kimi-k2-thinking | 0.61 | 1st $0.85 | $0.47 | $2.00 |
| kimi-k2 | 0.76 | 1st $0.88 | $0.50 | $2.00 |
| deepseek-r1-0528 | 1st 0.38 | 1st $0.91 | $0.50 | $2.15 |
| glm-4-6-fp8 | 2nd 35.49 | 1st $0.93 | $0.60 | $1.90 |
| deepseek-r1-jan | 1st 0.35 | 1st $1.13 | $0.70 | $2.40 |
| llama-3-1-nemotron-70b | 1st 0.32 | 1st $1.20 | $1.20 | $1.20 |
| deepseek-r1-jan-turbo-fp4 | 1st 0.41 | 1st $1.50 | $1.00 | $3.00 |
llama-3-2-1b
Latencia
0.44
Precio combinado $
$0.01
Entrada $
$0.01
Salida $
$0.01
llama-3-1-8b-turbo-fp8
Latencia
0.18
Precio combinado $
$0.02
Entrada $
$0.02
Salida $
$0.03
llama-3-2-3b
Latencia
0.46
Precio combinado $
$0.02
Entrada $
$0.02
Salida $
$0.02
mistral-nemo
Latencia
0.19
Precio combinado $
$0.03
Entrada $
$0.02
Salida $
$0.04
mistral-7b
Latencia
0.45
Precio combinado $
$0.03
Entrada $
$0.03
Salida $
$0.05
llama-3-1-8b
Latencia
0.28
Precio combinado $
$0.04
Entrada $
$0.03
Salida $
$0.05
llama-3-8b
Latencia
0.31
Precio combinado $
$0.04
Entrada $
$0.03
Salida $
$0.06
llama-3-2-11b-vision
Latencia
1.92
Precio combinado $
$0.05
Entrada $
$0.05
Salida $
$0.05
gemma-3-4b
Latencia
0.35
Precio combinado $
$0.05
Entrada $
$0.04
Salida $
$0.08
deepseek-ocr
Latencia
0.17
Precio combinado $
$0.05
Entrada $
$0.03
Salida $
$0.10
gpt-oss-20b-high
Latencia
0.18
Precio combinado $
$0.06
Entrada $
$0.03
Salida $
$0.14
gemma-3-12b
Latencia
0.29
Precio combinado $
$0.06
Entrada $
$0.04
Salida $
$0.13
mistral-small-3
Latencia
0.39
Precio combinado $
$0.06
Entrada $
$0.05
Salida $
$0.08
mistral-small-3-1
Latencia
0.39
Precio combinado $
$0.06
Entrada $
$0.05
Salida $
$0.10
nvidia-nemotron-nano-9b-v2
Latencia
0.42
Precio combinado $
$0.07
Entrada $
$0.04
Salida $
$0.16
devstral-small-may
Latencia
0.25
Precio combinado $
$0.07
Entrada $
$0.06
Salida $
$0.12
gpt-oss-120b-high
Latencia
0.26
Precio combinado $
$0.08
Entrada $
$0.04
Salida $
$0.19
qwen2-5-coder-32b
Latencia
0.40
Precio combinado $
$0.08
Entrada $
$0.06
Salida $
$0.15
phi-4
Latencia
0.31
Precio combinado $
$0.09
Entrada $
$0.07
Salida $
$0.14
nvidia-nemotron-3-nano
Latencia
0.24
Precio combinado $
$0.10
Entrada $
$0.06
Salida $
$0.24
mistral-small-3-2-fp8
Latencia
0.25
Precio combinado $
$0.11
Entrada $
$0.07
Salida $
$0.20
gemma-3-27b
Latencia
0.36
Precio combinado $
$0.11
Entrada $
$0.09
Salida $
$0.16
qwen3-14b-fp8
Latencia
0.21
Precio combinado $
$0.12
Entrada $
$0.08
Salida $
$0.24
devstral-small
Latencia
0.26
Precio combinado $
$0.12
Entrada $
$0.07
Salida $
$0.28
qwen3-coder-30b-a3b-fp8
Latencia
0.22
Precio combinado $
$0.12
Entrada $
$0.07
Salida $
$0.26
qwen3-30b-fp8
Latencia
0.21
Precio combinado $
$0.13
Entrada $
$0.08
Salida $
$0.29
llama-4-scout
Latencia
0.32
Precio combinado $
$0.14
Entrada $
$0.08
Salida $
$0.30
qwq-32b-preview
Latencia
0.37
Precio combinado $
$0.14
Entrada $
$0.12
Salida $
$0.18
qwen3-32b-fp8
Latencia
0.54
Precio combinado $
$0.15
Entrada $
$0.10
Salida $
$0.30
llama-3-3-70b-turbo-fp8
Latencia
0.52
Precio combinado $
$0.15
Entrada $
$0.10
Salida $
$0.32
qwen3-235b-2507
Latencia
0.41
Precio combinado $
$0.17
Entrada $
$0.07
Salida $
$0.46
llama-nemotron-super-49b-v1-5
Latencia
0.44
Precio combinado $
$0.17
Entrada $
$0.10
Salida $
$0.40
qwen2-5-72b
Latencia
0.31
Precio combinado $
$0.19
Entrada $
$0.12
Salida $
$0.39
qwen3-vl-4b-fp8
Latencia
0.45
Precio combinado $
$0.23
Entrada $
$0.10
Salida $
$0.60
deepseek-v3-2-exp
Latencia
0.62
Precio combinado $
$0.24
Entrada $
$0.21
Salida $
$0.32
qwen3-235b-fp8
Latencia
0.39
Precio combinado $
$0.25
Entrada $
$0.13
Salida $
$0.60
gpt-oss-120b-high-turbo
Latencia
0.19
Precio combinado $
$0.26
Entrada $
$0.15
Salida $
$0.60
llama-4-maverick-fp8
Latencia
0.41
Precio combinado $
$0.26
Entrada $
$0.15
Salida $
$0.60
qwen3-vl-30b-a3b-fp8
Latencia
0.19
Precio combinado $
$0.26
Entrada $
$0.15
Salida $
$0.60
llama-3-3-70b
Latencia
0.55
Precio combinado $
$0.27
Entrada $
$0.23
Salida $
$0.40
deepseek-r1-distill-qwen-32b
Latencia
0.37
Precio combinado $
$0.27
Entrada $
$0.27
Salida $
$0.27
deepseek-v3-2
Latencia
0.61
Precio combinado $
$0.29
Entrada $
$0.26
Salida $
$0.39
hermes-3-llama-3-1-70b
Latencia
0.30
Precio combinado $
$0.30
Entrada $
$0.30
Salida $
$0.30
nvidia-nemotron-nano-12b-v2-vl-fp8
Latencia
0.21
Precio combinado $
$0.30
Entrada $
$0.20
Salida $
$0.60
olmo-3-1-32b-instruct
Latencia
0.24
Precio combinado $
$0.30
Entrada $
$0.20
Salida $
$0.60
llama-3-70b
Latencia
0.35
Precio combinado $
$0.33
Entrada $
$0.30
Salida $
$0.40
qwen3-next-80b-a3b
Latencia
0.30
Precio combinado $
$0.34
Entrada $
$0.09
Salida $
$1.10
deepseek-v3-1-terminus-fp4
Latencia
0.42
Precio combinado $
$0.35
Entrada $
$0.21
Salida $
$0.79
deepseek-v3-1-fp4
Latencia
0.75
Precio combinado $
$0.35
Entrada $
$0.21
Salida $
$0.79
llama-3-2-90b-vision
Latencia
0.57
Precio combinado $
$0.36
Entrada $
$0.35
Salida $
$0.40
deepseek-v3-0324
Latencia
0.57
Precio combinado $
$0.37
Entrada $
$0.20
Salida $
$0.88
llama-3-1-70b
Latencia
0.42
Precio combinado $
$0.40
Entrada $
$0.40
Salida $
$0.40
llama-3-1-70b-turbo-fp8
Latencia
0.33
Precio combinado $
$0.40
Entrada $
$0.40
Salida $
$0.40
glm-4-5-air
Latencia
0.17
Precio combinado $
$0.42
Entrada $
$0.20
Salida $
$1.10
minimax-m2
Latencia
0.27
Precio combinado $
$0.45
Entrada $
$0.25
Salida $
$1.02
glm-4-6v-fp8
Latencia
0.25
Precio combinado $
$0.45
Entrada $
$0.30
Salida $
$0.90
qwen3-vl-235b-a22b-fp8
Latencia
0.34
Precio combinado $
$0.45
Entrada $
$0.20
Salida $
$1.20
deepseek-v3-dec
Latencia
0.38
Precio combinado $
$0.46
Entrada $
$0.32
Salida $
$0.89
llama-4-maverick-turbo-fp8
Latencia
0.47
Precio combinado $
$0.50
Entrada $
$0.50
Salida $
$0.50
qwen3-coder-480b-turbo-fp4
Latencia
0.23
Precio combinado $
$0.51
Entrada $
$0.28
Salida $
$1.20
minimax-m2-1-fp8
Latencia
0.27
Precio combinado $
$0.51
Entrada $
$0.28
Salida $
$1.20
mixtral-8x7b
Latencia
0.32
Precio combinado $
$0.54
Entrada $
$0.54
Salida $
$0.54
qwen3-vl-8b-fp8
Latencia
15.00
Precio combinado $
$0.66
Entrada $
$0.18
Salida $
$2.09
glm-4-5
Latencia
0.36
Precio combinado $
$0.69
Entrada $
$0.38
Salida $
$1.60
qwen3-coder-480b-fp8
Latencia
0.28
Precio combinado $
$0.70
Entrada $
$0.40
Salida $
$1.60
deepseek-r1-distill-llama-70b
Latencia
0.36
Precio combinado $
$0.75
Entrada $
$0.60
Salida $
$1.20
glm-4-7-fp4
Latencia
0.31
Precio combinado $
$0.76
Entrada $
$0.43
Salida $
$1.75
glm-4-6-fp4
Latencia
0.38
Precio combinado $
$0.76
Entrada $
$0.43
Salida $
$1.75
qwen3-235b-a22b-2507-fp8
Latencia
0.30
Precio combinado $
$0.77
Entrada $
$0.23
Salida $
$2.39
kimi-k2-0905
Latencia
0.78
Precio combinado $
$0.80
Entrada $
$0.40
Salida $
$2.00
kimi-k2-thinking
Latencia
0.61
Precio combinado $
$0.85
Entrada $
$0.47
Salida $
$2.00
kimi-k2
Latencia
0.76
Precio combinado $
$0.88
Entrada $
$0.50
Salida $
$2.00
deepseek-r1-0528
Latencia
0.38
Precio combinado $
$0.91
Entrada $
$0.50
Salida $
$2.15
glm-4-6-fp8
Latencia
35.49
Precio combinado $
$0.93
Entrada $
$0.60
Salida $
$1.90
deepseek-r1-jan
Latencia
0.35
Precio combinado $
$1.13
Entrada $
$0.70
Salida $
$2.40
llama-3-1-nemotron-70b
Latencia
0.32
Precio combinado $
$1.20
Entrada $
$1.20
Salida $
$1.20
deepseek-r1-jan-turbo-fp4
Latencia
0.41
Precio combinado $
$1.50
Entrada $
$1.00
Salida $
$3.00
FAQ
Los laboratorios de IA (OpenAI, Anthropic, Google) desarrollan modelos de IA fundamentales. Los proveedores de IA (Baseten, Together AI, Groq, DeepInfra) alojan y distribuyen estos modelos mediante servicios de infraestructura, gestionando recursos informáticos, API y monitorización. Las pasarelas de IA actúan como middleware, ofreciendo acceso unificado a las API de múltiples proveedores con enrutamiento inteligente y optimización de costes.
Comparamos las estructuras de precios basadas en tokens de los proveedores. Por ejemplo, en nuestra comparativa , descubrimos que OpenRouter ofrece el menor coste, a 0,08 $ por millón de tokens de salida para Llama 4 Scout, seguido de SambaNova a 0,11 $. También analizamos los precios específicos de cada modelo en los distintos proveedores de IA , donde plataformas como Baseten ofrecen un seguimiento del coste por solicitud según el tipo de GPU para facilitar la comparación.
Sí, los límites de velocidad varían considerablemente. Los proveedores de alto rendimiento como Cerebras y SambaNova están optimizados para cargas de trabajo a gran escala, mientras que Groq se especializa en respuestas de latencia ultrabaja. Plataformas como Baseten permiten configurar parámetros de autoescalado, aunque una configuración incorrecta puede afectar tanto al coste como a la latencia. Elija en función de si necesita capacidad de ráfaga o rendimiento constante.
Sí, existen varias opciones para acceder a modelos de IA gratuitos. Muchos modelos de código abierto, como Llama, Mistral y Gemma, están disponibles a través de API gratuitas en plataformas como Hugging Face, OpenRouter y Together AI, aunque suelen tener límites de uso y restricciones. Los modelos de lógica descriptiva (LLM) de código abierto ofrecen mayor seguridad de datos, ya que se pueden implementar en infraestructura privada, además de eliminar las tarifas de licencia y los riesgos de dependencia de un proveedor. Si bien los modelos en sí son gratuitos, los costos de implementación varían según si se ejecutan localmente (gratis si el hardware lo permite), en proveedores gestionados o en la nube.
Elija proveedores de IA según sus prioridades. Para una depuración detallada, seleccione Baseten (rastreo a nivel de solicitud) o Together AI (métricas por versión). Para una latencia ultrabaja, nuestra prueba comparativa reveló que Groq ofrece una latencia de primer token de 0,13 s. Para optimizar los costos, Parasail ofrece conmutación flexible de GPU. Para una implementación rápida, Fireworks AI proporciona puntos finales de API inmediatos. Para la gobernanza empresarial, Databricks integra el seguimiento de MLflow y el linaje de datos. Considere usar pasarelas de IA si necesita flexibilidad con múltiples proveedores.