Os preços de tabela de GPU em nuvem para o mesmo modelo podem variar várias vezes de um provedor para outro. Selecionamos a menor tarifa, o provedor, a faixa de mercado e a mediana para 40+ configurações de GPU em todos os três níveis de preços, além de um benchmark de throughput por dólar em 10 modelos.
Preço de GPU em nuvem por throughput
Veja a GPU mais econômica para sua carga de trabalho entre 13 provedores de hyperscaler e neocloud, classificados por throughput por dólar:
Preços e desempenho de GPUs na nuvem
1.246 ofertas de 25 fornecedores
IONOS
AssinanteVast IA
Melhor preçoVast IA
Vast IA
Verda
Verda
Verda
Verda
Vast IA
Runpod
Consulte a metodologia de benchmark de GPU em nuvem para obter detalhes.
O modelo sob demanda é o modelo de precificação mais direto, no qual você paga pela capacidade de computação por hora ou por segundo, conforme o uso, sem compromissos de longo prazo nem pagamentos antecipados.
Essas instâncias são recomendadas para usuários que preferem a flexibilidade de uma plataforma de GPU em nuvem sem pagamento antecipado nem compromisso de longo prazo. As instâncias sob demanda costumam ser mais caras do que as instâncias spot, mas oferecem capacidade garantida e ininterrupta.
Preços de GPU em nuvem sob demanda
Ranking: Os assinantes aparecem vinculados e em destaque no topo da tabela. As demais linhas são classificadas em ordem crescente pelo menor preço sob demanda. A faixa mostra a diferença entre o menor e o maior preço de tabela para a mesma SKU em todos os provedores. A mediana é o ponto central da distribuição de preços em todas as listagens para essa SKU e serve como referência de mercado justo. Os preços refletem a atualização semanal mais recente do catálogo.
O modelo sob demanda é o modelo de locação padrão: pague por hora, sem compromisso, com capacidade garantida enquanto você mantiver a instância em execução. É o nível mais caro, mas o único sem contrapartidas.
Preços de GPU em nuvem spot
Ranking: As linhas são classificadas pelo menor preço spot em ordem crescente. A capacidade spot é interruptível. A mediana é o ponto central da distribuição de preços spot para essa SKU.
A capacidade spot é interruptível; o provedor pode retomar a instância com pouco ou nenhum aviso, geralmente quando a demanda sob demanda aumenta. As tarifas spot costumam ser 35-70% mais baixas do que as sob demanda no mesmo provedor. Use spot para treinamento com checkpoints, inferência em lote e jobs de avaliação que toleram reinicializações. Evite-a para inferência sensível à latência ou serviços de réplica única sem failover.
Preços de GPU em nuvem reservada (1 ano)
Ranking: As linhas são classificadas pelo menor preço reservado de 1 ano em ordem crescente. As reservas garantem capacidade pelo período contratado. A mediana é o ponto central da distribuição de preços reservados para essa SKU.
As reservas garantem capacidade por um prazo fixo em troca de um desconto em relação ao modelo sob demanda. Os contratos de um ano costumam ser 19-57% mais baratos do que a tabela sob demanda do mesmo provedor. Em alguns casos, as tarifas de reserva ficam abaixo do spot porque o provedor que faz a reserva isola totalmente o inventário do mercado spot.
Comparação de desempenho entre provedores de nuvem
O mesmo modelo de GPU pode ter um desempenho ligeiramente diferente entre provedores por causa da escolha da CPU do host, da malha de rede, da configuração de drivers e da sobrecarga de virtualização. Para quantificar isso, executamos cargas de trabalho idênticas de geração de texto e imagem em AMD MI300X 192GB na DigitalOcean e na Runpod:
Principais observações:
- Para geração de texto, a Digital Ocean demonstrou um throughput ligeiramente maior, processando aproximadamente 0.4% mais tokens por segundo.
- Por outro lado, para geração de imagem, a Runpod mostrou uma vantagem marginal, processando cerca de 0.4% mais imagens por segundo.
A diferença é pequena o suficiente para não importar na maioria das cargas de trabalho. Para inferência sensível à latência ou treinamento em larga escala, em que cada ponto percentual se acumula ao longo de milhões de inferências, faça um benchmark da configuração específica do provedor antes de assumir uma reserva longa.
Comprar on-prem ou alugar na nuvem
Possuir faz sentido quando a carga de trabalho é previsível, a equipe tem o conhecimento operacional e a utilização do hardware permanece acima de ~70% ao longo da vida útil da GPU. Para demanda variável, picos de treinamento ou experimentos de produto, o aluguel em nuvem vence em eficiência de capital e flexibilidade de escala. O ponto de equilíbrio fica aproximadamente em 12 meses de utilização: acima de 70%, a capacidade reservada ou própria quase sempre supera o modelo sob demanda; abaixo de 50%, spot ou sob demanda vence em flexibilidade; a faixa intermediária depende de quanta interrupção de capacidade sua carga de trabalho tolera.
Um padrão prático em escala: ter um cluster básico dimensionado para a demanda em regime permanente e alugar na nuvem para picos e trabalhos exploratórios. A Meta anunciou uma parceria plurianual em fevereiro de 2026 para implantar até 6 gigawatts de AMD Instinct GPUs, sinalizando que até operadores em escala de hyperscaler continuam expandindo a capacidade própria enquanto ainda consomem GPU em nuvem para cargas de trabalho variáveis.
As GPUs de consumo (RTX 4090, RTX 5090) oferecem o melhor preço por FLOP no papel, mas o EULA da NVIDIA restringe seu uso em data centers comerciais. Elas continuam úteis para estações de trabalho individuais e trabalhos de prova de conceito, não para implantação em produção.
Metodologia de benchmark de GPU em nuvem
Os benchmarks de throughput usam quantização FP de 4 bits em todos os testes. O pipeline executa:
- Finetuning de texto: Llama 3.2 nas primeiras 5.000 conversas do FineTome, 5 épocas, 1M tokens totais, framework Unsloth. Throughput = (tokens × épocas) / tempo total.
- Inferência de texto: 1M tokens gerados com llama-cpp-python.
- Finetuning de imagem: YOLOv9 em 100 imagens do SkyFusion, 4 épocas, Unsloth.
- Inferência de imagem: YOLOv9 com fine-tuning em ~500 imagens a 640×640.
A métrica de throughput por dólar divide a saída carga de trabalho pelo custo por hora da instância. Os valores de throughput são específicos da carga de trabalho e servem como diretrizes relativas; o mesmo hardware terá um throughput materialmente diferente no seu próprio modelo.
Perguntas frequentes
Um único nome de modelo de GPU geralmente cobre vários SKUs físicos. A H100 é fornecida nas variantes PCIe, SXM, SXM5 e NVL com preços e larguras de banda de interconexão diferentes. A A100 é fornecida com 40GB e 80GB de VRAM; a V100 com 16GB e 32GB. Dentro de um provedor, a tarifa listada também varia conforme a classe de CPU do host, RAM e armazenamento incluídos e a região. As tabelas de preços acima dividem os SKUs por interconexão e VRAM quando os dados de origem permitem, para que cada linha seja uma única placa física em vez de uma agregação por nome de modelo.
O componente executa uma carga de trabalho fixa (geração de imagem ou texto, finetuning ou inferência) em cada instância de GPU e divide a saída total pelo custo por hora da instância. Um número maior significa menor custo por saída para essa carga de trabalho. O ranking muda com a carga de trabalho: uma placa otimizada para inferência FP8 pode superar uma placa com mais VRAM na geração de texto, mas perder em um finetuning de modelo de imagem grande. Escolha a aba de carga de trabalho que corresponde ao seu job antes de ler a classificação.
As tabelas de preços são atualizadas mensalmente por meio de uma varredura de catálogo.
Leitura adicional
- Benchmark Multi-GPU: B200 vs H200 vs H100 vs MI300X
- Top 30 provedores de GPU em nuvem e suas GPUs
- Benchmark de concorrência de GPU
- Top 25+ fabricantes de chips de IA: NVIDIA e seus concorrentes
- Índice de preços de aluguel de GPU em nuvem
- DGX Spark vs Mac Studio e Halo: benchmarks e alternativas
Cite este benchmark
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sarı, Ekrem},
title = {{Preços de GPU em nuvem, desempenho e comparação de provedores}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/cloud-gpu-pricing}},
note = {AIMultiple. Acessado em 17 Junho 2026}
}Resultados e carimbos de data/hora de 117 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo 3 arquivos CSV.
Registro de alterações
14 atualizações- 2026
Removida a seção "Preços mais baixos para as GPUs mais populares".
- 2025
Expandida a seção "Metodologia de benchmark de GPU em nuvem".
Adicionada uma comparação de desempenho de provedores de nuvem à introdução.
Atualizada a seção Preços com detalhes de configuração e framework.
Metodologia expandida para operações de texto e imagem.
- 2024
Adicionada uma seção de metodologia de benchmark de GPU em nuvem.
Atualizada a seção "Preços mais baixos para os modelos de GPU mais populares".
Adicionados mercados de GPU em nuvem à introdução.
Adicionados os 10 modelos mais baratos e populares à introdução.
- 2023
Adicionadas GPUs sob demanda de grandes provedores de nuvem de tecnologia à seção de modelos de preços.
Adicionado CoreWeave e NVIDIA DGX Cloud à lista dos principais provedores de GPU em nuvem.
Adicionada uma seção sobre provedores de GPU em nuvem e suas ofertas.
Expandida a seção "Quais marcas de GPU estão disponíveis na nuvem?".
Expandida a seção "Isenção de responsabilidade" com considerações adicionais sobre GPU em nuvem e uma discussão sobre comprar versus alugar GPUs.
O trabalho de Cem na AIMultiple foi citado por publicações globais líderes, incluindo Business Insider, Forbes, Morning Brew e Washington Post, por empresas globais como Deloitte e HPE, ONGs como o World Economic Forum e organizações supranacionais como a European Commission. [1], [2], [3], [4], [5]
Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas sobre suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.
Ele liderou a estratégia de tecnologia e as compras de uma operadora de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de deep tech Hypatos, que atingiu uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia líderes como TechCrunch e Business Insider.
Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou como engenheiro da computação pela Bogazici University e possui um MBA pela Columbia Business School.
Comentários 2
Compartilhe suas ideias
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.
Cem - great article, I'd love to pick your brain on private networking or direct connects to these GPU instances.
Hi Ashley, thank you! Sure, happy to chat.
Hi there, fantastic article and very well-researched. Would you mind checking out Dataoorts at https://dataoorts.com
Sure, we'll review to see if we can include Dataoorts in the next edit.