Precios, rendimiento y comparativa de proveedores de GPU en la nube
Los precios de lista de GPU en la nube para el mismo modelo pueden diferir varias veces de un proveedor a otro. Hemos seleccionado la tarifa más baja, el proveedor, el rango de mercado y la mediana para más de 40 configuraciones de GPU en los tres niveles de precios, además de un benchmark de rendimiento por dólar en 10 modelos.
Precio por rendimiento de GPU en la nube
Vea la GPU más rentable para su carga de trabajo entre 13 proveedores de hiperescala y neocloud, clasificados por rendimiento por dólar:
Rendimiento y precios de las GPU en la nube
Actualizado el 28 de Julio de 2026
Vast IA
Vast IA
IONOS
Vast IA
Verda
Verda
Verda
Verda
Vast IA
Vast IA
Vast IA
Vast IA
Consulte la metodología de referencia de GPU en la nube para más detalles.
Bajo demanda es el modelo de precios más directo, donde paga por la capacidad de cómputo por hora o segundo según lo que use, sin compromisos a largo plazo ni pagos iniciales.
Estas instancias se recomiendan para usuarios que prefieren la flexibilidad de una plataforma de GPU en la nube sin pago inicial ni compromiso a largo plazo. Las instancias bajo demanda suelen ser más caras que las spot, pero ofrecen capacidad garantizada sin interrupciones.
Precios bajo demanda de GPU en la nube
Clasificación: Los patrocinadores están enlazados y resaltados en la parte superior de la tabla. Las filas restantes se clasifican en orden ascendente según el precio bajo demanda más bajo. El rango muestra la diferencia entre el precio de lista más bajo y el más alto para el mismo SKU en todos los proveedores. La mediana es el punto medio de la distribución de precios en todas las listas de ese SKU y sirve como referencia de mercado justo. Los precios reflejan la actualización semanal más reciente del catálogo.
Bajo demanda es el modelo de alquiler predeterminado, pago por hora, sin compromiso, capacidad garantizada mientras mantenga la instancia en ejecución. Es el nivel más caro, pero el único sin contrapartidas.
Precios spot de GPU en la nube
Clasificación: Las filas se clasifican por el precio spot más bajo en orden ascendente. La capacidad spot es interrumpible. La mediana es el punto medio de la distribución de precios spot para ese SKU.
La capacidad spot es interrumpible; el proveedor puede reclamar la instancia con poca o ninguna advertencia, normalmente cuando la demanda bajo demanda aumenta. Las tarifas spot suelen ser entre un 40 y un 64% más bajas que las bajo demanda en el mismo proveedor. Use spot para entrenamiento con puntos de control, inferencia por lotes y trabajos de evaluación que toleren reinicios. Evítelo para inferencia sensible a la latencia o servicios de una sola réplica sin redundancia.
Precios reservados de GPU en la nube (1 año)
Clasificación: Las filas se clasifican por el precio reservado a 1 año más bajo en orden ascendente. Las reservas aseguran capacidad durante el plazo. La mediana es el punto medio de la distribución de precios reservados para ese SKU.
Las reservas aseguran capacidad por un plazo fijo a cambio de un descuento respecto al precio bajo demanda. Los contratos de un año suelen ser entre un 19 y un 57% más bajos que la tarifa bajo demanda del mismo proveedor. En algunos casos, las tarifas de reserva caen por debajo de las spot, porque el proveedor que reserva aísla el inventario del mercado spot por completo.
Comparación de rendimiento de proveedores en la nube
El mismo modelo de GPU puede rendir ligeramente diferente entre proveedores debido a la elección de la CPU del host, la estructura de red, la configuración del controlador y la sobrecarga de virtualización. Para cuantificar esto, ejecutamos cargas de trabajo idénticas de generación de texto e imágenes en AMD MI300X 192GB en DigitalOcean y Runpod:
Observaciones clave:
- Para la generación de texto, Digital Ocean demostró un rendimiento ligeramente superior, procesando aproximadamente un 0.4% más de tokens por segundo.
- Por el contrario, para la generación de imágenes, Runpod mostró una ventaja marginal, procesando aproximadamente un 0.4% más de imágenes por segundo.
La diferencia es tan pequeña que no importa para la mayoría de las cargas de trabajo. Para inferencia sensible a la latencia o entrenamiento a gran escala donde cada punto porcentual se acumula en millones de inferencias, realice un benchmark de la configuración específica del proveedor antes de comprometerse a una reserva larga.
Comprar on-premise o alquilar en la nube
Ser propietario tiene sentido cuando la carga de trabajo es predecible, el equipo tiene los conocimientos operativos y la utilización del hardware se mantiene por encima de ~70% durante la vida útil de la GPU. Para demanda variable, picos de entrenamiento o experimentos de producto, el alquiler en la nube gana en eficiencia de capital y flexibilidad de escalado. El punto de equilibrio se sitúa aproximadamente en 12 meses de utilización: por encima del 70%, la capacidad reservada o propia casi siempre supera al bajo demanda; por debajo del 50%, spot o bajo demanda gana en flexibilidad; la franja intermedia depende de cuánta interrupción de capacidad tolere su carga de trabajo.
Un patrón práctico a escala: tener un clúster base propio dimensionado para la demanda constante y alquilar en la nube para picos y trabajos exploratorios. Meta anunció una asociación de varios años en febrero de 2026 para desplegar hasta 6 gigavatios de AMD Instinct GPUs, lo que indica que incluso los operadores a escala de hiperescala siguen ampliando la capacidad propia mientras consumen GPU en la nube para cargas de trabajo variables.
Las GPU de consumo (RTX 4090, RTX 5090) ofrecen el mejor precio por FLOP en teoría, pero el acuerdo de licencia de NVIDIA restringe su uso en centros de datos comerciales. Siguen siendo útiles para estaciones de trabajo individuales y trabajos de prueba de concepto, no para despliegue en producción.
Metodología de referencia de GPU en la nube
Los benchmarks de rendimiento utilizan cuantización FP de 4 bits en todas las pruebas. El pipeline ejecuta:
- Ajuste fino de texto: Llama 3.2 en las primeras 5,000 conversaciones de FineTome, 5 épocas, 1M tokens totales, framework Unsloth. Rendimiento = (tokens × épocas) / tiempo total.
- Inferencia de texto: 1M tokens generados con llama-cpp-python.
- Ajuste fino de imagen: YOLOv9 en 100 imágenes de SkyFusion, 4 épocas, Unsloth.
- Inferencia de imagen: YOLOv9 ajustado en aproximadamente 500 imágenes a 640×640.
La métrica de rendimiento por dólar divide la salida de la carga de trabajo por el costo por hora de la instancia. Los valores de rendimiento son específicos de la carga de trabajo y sirven como guías relativas; el mismo hardware ofrecerá un rendimiento materialmente diferente en su propio modelo.
Preguntas frecuentes
Un mismo nombre de modelo de GPU a menudo cubre múltiples SKU físicos. H100 se comercializa en variantes PCIe, SXM, SXM5 y NVL con diferentes precios y anchos de banda de interconexión. A100 se comercializa con 40GB y 80GB de VRAM; V100 con 16GB y 32GB. Dentro de un proveedor, la tarifa listada también varía según la clase de CPU del host, la RAM y el almacenamiento incluidos, y la región. Las tablas de precios anteriores separan los SKU por interconexión y VRAM donde los datos de origen lo permiten, de modo que cada fila sea una sola tarjeta física en lugar de un agregado de nombre de modelo.
El componente ejecuta una carga de trabajo fija (generación de texto o imagen, ajuste fino o inferencia) en cada instancia de GPU y divide la salida total por el costo por hora de la instancia. Un número más alto significa más barato por salida para esa carga de trabajo. La clasificación cambia con la carga de trabajo: una tarjeta optimizada para inferencia FP8 puede superar a una tarjeta con más VRAM en generación de texto, pero perder en un ajuste fino de modelo de imagen grande. Seleccione la pestaña de carga de trabajo que coincida con su tarea antes de leer la tabla de clasificación.
Las tablas de precios se actualizan con un rastreo mensual del catálogo.
Lecturas adicionales
- Comparativa de múltiples GPU: B200 vs H200 vs H100 vs MI300X
- Los 30 principales proveedores de GPU en la nube y sus GPU
- Benchmark de concurrencia de GPU
- Más de 25 fabricantes de chips de IA: NVIDIA y sus competidores
- Índice de precios de alquiler de GPU en la nube
- DGX Spark vs Mac Studio y Halo: Benchmarks y alternativas
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sarı, Ekrem},
title = {{Precios, rendimiento y comparativa de proveedores de GPU en la nube}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/cloud-gpu-pricing}},
note = {AIMultiple. Recuperado el 17 de Junio de 2026}
}
Comentarios 2
Comparte tus ideas
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.
Cem - great article, I'd love to pick your brain on private networking or direct connects to these GPU instances.
Hi Ashley, thank you! Sure, happy to chat.
Hi there, fantastic article and very well-researched. Would you mind checking out Dataoorts at https://dataoorts.com
Sure, we'll review to see if we can include Dataoorts in the next edit.