Serviços
Contate-nos

Preços de GPU em nuvem, desempenho e comparação de provedores

Cem Dilmegani
Cem Dilmegani
atualizado em 17 jun. 2026

Os preços de tabela de GPU em nuvem para o mesmo modelo podem variar várias vezes de um provedor para outro. Selecionamos a menor tarifa, o provedor, a faixa de mercado e a mediana para 40+ configurações de GPU em todos os três níveis de preços, além de um benchmark de throughput por dólar em 10 modelos.

Preço de GPU em nuvem por throughput

Veja a GPU mais econômica para sua carga de trabalho entre 13 provedores de hyperscaler e neocloud, classificados por throughput por dólar:

Preços e desempenho de GPUs na nuvem

1.246 ofertas de 25 fornecedores

Atualizado em 4 Setembro 2026
Exibindo os 10 mais baratos de 260
IONOS
Assinante
AP1-10 GPU T4
$1,07
por GPU / hora
Visite o site
GPU
1 x NVIDIA T4 16 GB
VRAM total
16 GB
Est. mensal
$778
16 vCPU · 128 GB RAM
Texto
1.072 tok/s3.6M tokens por 1 $
Imagem
24.4 img/s80.7k imagens por 1 $
Vast IA
Melhor preço
2x-nvidia-t4-32gb
$0,15
por GPU / hora
GPU
2 x NVIDIA T4 32 GB
VRAM total
64 GB
Est. mensal
$216
19 vCPU · 63 GB RAMFP16FP32INT4INT8
Texto
2.143 tok/s25.7M tokens por 1 $
Imagem
48.8 img/s588k imagens por 1 $
Vast IA
4x-nvidia-t4-64gb
$0,15
por GPU / hora
GPU
4 x NVIDIA T4 64 GB
VRAM total
256 GB
Est. mensal
$434
56 vCPU · 504 GB RAMFP16FP32INT4INT8
Texto
4.286 tok/s26.2M tokens por 1 $
Imagem
97.6 img/s598k imagens por 1 $
Vast IA
8x-nvidia-v100-256gb
$0,16
por GPU / hora
GPU
8 x NVIDIA V100 256 GB
VRAM total
2.048 GB
Est. mensal
$936
FP16FP32FP64INT8
Texto
26.976 tok/s75.9M tokens por 1 $
Imagem
180.8 img/s509k imagens por 1 $
Verda
2x-nvidia-v100-32gb
$0,17
por GPU / hora
GPU
2 x NVIDIA V100 32 GB
VRAM total
64 GB
Est. mensal
$248
10 vCPU · 45 GB RAMFP16FP32FP64INT8
Texto
6.744 tok/s71.4M tokens por 1 $
Imagem
45.2 img/s476k imagens por 1 $
Verda
8x-nvidia-v100-128gb
$0,17
por GPU / hora
GPU
8 x NVIDIA V100 128 GB
VRAM total
1.024 GB
Est. mensal
$993
48 vCPU · 180 GB RAMFP16FP32FP64INT8
Texto
26.976 tok/s71.4M tokens por 1 $
Imagem
180.8 img/s479k imagens por 1 $
Verda
4x-nvidia-v100-64gb
$0,17
por GPU / hora
GPU
4 x NVIDIA V100 64 GB
VRAM total
256 GB
Est. mensal
$496
20 vCPU · 90 GB RAMFP16FP32FP64INT8
Texto
13.488 tok/s71.4M tokens por 1 $
Imagem
90.4 img/s476k imagens por 1 $
Verda
1x-nvidia-v100-16gb
$0,17
por GPU / hora
GPU
1 x NVIDIA V100 16 GB
VRAM total
16 GB
Est. mensal
$124
6 vCPU · 23 GB RAMFP16FP32FP64INT8
Texto
3.372 tok/s71.4M tokens por 1 $
Imagem
22.6 img/s487k imagens por 1 $
Vast IA
1x-nvidia-v100-32gb
$0,18
por GPU / hora
GPU
1 x NVIDIA V100 32 GB
VRAM total
32 GB
Est. mensal
$132
72 vCPU · 48 GB RAMFP16FP32FP64INT8
Texto
3.372 tok/s67.4M tokens por 1 $
Imagem
22.6 img/s460k imagens por 1 $
Runpod
1x-nvidia-v100-16gb
$0,23
por GPU / hora
GPU
1 x NVIDIA V100 16 GB
VRAM total
16 GB
Est. mensal
$168
6 vCPU · 30 GB RAMFP16FP32FP64INT8
Texto
3.372 tok/s52.8M tokens por 1 $
Imagem
22.6 img/s360k imagens por 1 $
Filtros
Todos os modelos de GPU
Qualquer número de GPU
Todos os fornecedores
Qualquer interconexão

Consulte a metodologia de benchmark de GPU em nuvem para obter detalhes.

O modelo sob demanda é o modelo de precificação mais direto, no qual você paga pela capacidade de computação por hora ou por segundo, conforme o uso, sem compromissos de longo prazo nem pagamentos antecipados.

Essas instâncias são recomendadas para usuários que preferem a flexibilidade de uma plataforma de GPU em nuvem sem pagamento antecipado nem compromisso de longo prazo. As instâncias sob demanda costumam ser mais caras do que as instâncias spot, mas oferecem capacidade garantida e ininterrupta.

Preços de GPU em nuvem sob demanda

Ranking: Os assinantes aparecem vinculados e em destaque no topo da tabela. As demais linhas são classificadas em ordem crescente pelo menor preço sob demanda. A faixa mostra a diferença entre o menor e o maior preço de tabela para a mesma SKU em todos os provedores. A mediana é o ponto central da distribuição de preços em todas as listagens para essa SKU e serve como referência de mercado justo. Os preços refletem a atualização semanal mais recente do catálogo.

O modelo sob demanda é o modelo de locação padrão: pague por hora, sem compromisso, com capacidade garantida enquanto você mantiver a instância em execução. É o nível mais caro, mas o único sem contrapartidas.

Preços de GPU em nuvem spot

Ranking: As linhas são classificadas pelo menor preço spot em ordem crescente. A capacidade spot é interruptível. A mediana é o ponto central da distribuição de preços spot para essa SKU.

A capacidade spot é interruptível; o provedor pode retomar a instância com pouco ou nenhum aviso, geralmente quando a demanda sob demanda aumenta. As tarifas spot costumam ser 35-70% mais baixas do que as sob demanda no mesmo provedor. Use spot para treinamento com checkpoints, inferência em lote e jobs de avaliação que toleram reinicializações. Evite-a para inferência sensível à latência ou serviços de réplica única sem failover.

Preços de GPU em nuvem reservada (1 ano)

Ranking: As linhas são classificadas pelo menor preço reservado de 1 ano em ordem crescente. As reservas garantem capacidade pelo período contratado. A mediana é o ponto central da distribuição de preços reservados para essa SKU.

As reservas garantem capacidade por um prazo fixo em troca de um desconto em relação ao modelo sob demanda. Os contratos de um ano costumam ser 19-57% mais baratos do que a tabela sob demanda do mesmo provedor. Em alguns casos, as tarifas de reserva ficam abaixo do spot porque o provedor que faz a reserva isola totalmente o inventário do mercado spot.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Comparação de desempenho entre provedores de nuvem

O mesmo modelo de GPU pode ter um desempenho ligeiramente diferente entre provedores por causa da escolha da CPU do host, da malha de rede, da configuração de drivers e da sobrecarga de virtualização. Para quantificar isso, executamos cargas de trabalho idênticas de geração de texto e imagem em AMD MI300X 192GB na DigitalOcean e na Runpod:

Principais observações:

  • Para geração de texto, a Digital Ocean demonstrou um throughput ligeiramente maior, processando aproximadamente 0.4% mais tokens por segundo.
  • Por outro lado, para geração de imagem, a Runpod mostrou uma vantagem marginal, processando cerca de 0.4% mais imagens por segundo.

A diferença é pequena o suficiente para não importar na maioria das cargas de trabalho. Para inferência sensível à latência ou treinamento em larga escala, em que cada ponto percentual se acumula ao longo de milhões de inferências, faça um benchmark da configuração específica do provedor antes de assumir uma reserva longa.

Comprar on-prem ou alugar na nuvem

Possuir faz sentido quando a carga de trabalho é previsível, a equipe tem o conhecimento operacional e a utilização do hardware permanece acima de ~70% ao longo da vida útil da GPU. Para demanda variável, picos de treinamento ou experimentos de produto, o aluguel em nuvem vence em eficiência de capital e flexibilidade de escala. O ponto de equilíbrio fica aproximadamente em 12 meses de utilização: acima de 70%, a capacidade reservada ou própria quase sempre supera o modelo sob demanda; abaixo de 50%, spot ou sob demanda vence em flexibilidade; a faixa intermediária depende de quanta interrupção de capacidade sua carga de trabalho tolera.

Um padrão prático em escala: ter um cluster básico dimensionado para a demanda em regime permanente e alugar na nuvem para picos e trabalhos exploratórios. A Meta anunciou uma parceria plurianual em fevereiro de 2026 para implantar até 6 gigawatts de AMD Instinct GPUs, sinalizando que até operadores em escala de hyperscaler continuam expandindo a capacidade própria enquanto ainda consomem GPU em nuvem para cargas de trabalho variáveis.

As GPUs de consumo (RTX 4090, RTX 5090) oferecem o melhor preço por FLOP no papel, mas o EULA da NVIDIA restringe seu uso em data centers comerciais. Elas continuam úteis para estações de trabalho individuais e trabalhos de prova de conceito, não para implantação em produção.

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Metodologia de benchmark de GPU em nuvem

Os benchmarks de throughput usam quantização FP de 4 bits em todos os testes. O pipeline executa:

  • Finetuning de texto: Llama 3.2 nas primeiras 5.000 conversas do FineTome, 5 épocas, 1M tokens totais, framework Unsloth. Throughput = (tokens × épocas) / tempo total.
  • Inferência de texto: 1M tokens gerados com llama-cpp-python.
  • Finetuning de imagem: YOLOv9 em 100 imagens do SkyFusion, 4 épocas, Unsloth.
  • Inferência de imagem: YOLOv9 com fine-tuning em ~500 imagens a 640×640.

A métrica de throughput por dólar divide a saída carga de trabalho pelo custo por hora da instância. Os valores de throughput são específicos da carga de trabalho e servem como diretrizes relativas; o mesmo hardware terá um throughput materialmente diferente no seu próprio modelo.

Perguntas frequentes

Um único nome de modelo de GPU geralmente cobre vários SKUs físicos. A H100 é fornecida nas variantes PCIe, SXM, SXM5 e NVL com preços e larguras de banda de interconexão diferentes. A A100 é fornecida com 40GB e 80GB de VRAM; a V100 com 16GB e 32GB. Dentro de um provedor, a tarifa listada também varia conforme a classe de CPU do host, RAM e armazenamento incluídos e a região. As tabelas de preços acima dividem os SKUs por interconexão e VRAM quando os dados de origem permitem, para que cada linha seja uma única placa física em vez de uma agregação por nome de modelo.

O componente executa uma carga de trabalho fixa (geração de imagem ou texto, finetuning ou inferência) em cada instância de GPU e divide a saída total pelo custo por hora da instância. Um número maior significa menor custo por saída para essa carga de trabalho. O ranking muda com a carga de trabalho: uma placa otimizada para inferência FP8 pode superar uma placa com mais VRAM na geração de texto, mas perder em um finetuning de modelo de imagem grande. Escolha a aba de carga de trabalho que corresponde ao seu job antes de ler a classificação.

As tabelas de preços são atualizadas mensalmente por meio de uma varredura de catálogo.

Leitura adicional

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Cem Dilmegani and Ekrem Sarı (2026) - "Preços de GPU em nuvem, desempenho e comparação de provedores". Publicado on-line em AIMultiple.com. Acessado em 17 Junho 2026, em: https://aimultiple.com/cloud-gpu-pricing [Recurso on-line]

Dilmegani, C., & Sarı, E. (2026, 17 Junho). Preços de GPU em nuvem, desempenho e comparação de provedores. AIMultiple. https://aimultiple.com/cloud-gpu-pricing

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Sarı, Ekrem},
  title  = {{Preços de GPU em nuvem, desempenho e comparação de provedores}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/cloud-gpu-pricing}},
  note   = {AIMultiple. Acessado em 17 Junho 2026}
}
Baixar todos os dados

Resultados e carimbos de data/hora de 117 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo 3 arquivos CSV.

Última atualização: 17 Agosto 2026
Baixar

Registro de alterações

14 atualizações
  1. 2026

    Removida a seção "Preços mais baixos para as GPUs mais populares".

  2. 2025

    Expandida a seção "Metodologia de benchmark de GPU em nuvem".

  3. Adicionada uma comparação de desempenho de provedores de nuvem à introdução.

  4. Atualizada a seção Preços com detalhes de configuração e framework.

  5. Metodologia expandida para operações de texto e imagem.

  6. 2024

    Adicionada uma seção de metodologia de benchmark de GPU em nuvem.

  7. Atualizada a seção "Preços mais baixos para os modelos de GPU mais populares".

  8. Adicionados mercados de GPU em nuvem à introdução.

  9. Adicionados os 10 modelos mais baratos e populares à introdução.

  10. 2023

    Adicionadas GPUs sob demanda de grandes provedores de nuvem de tecnologia à seção de modelos de preços.

  11. Adicionado CoreWeave e NVIDIA DGX Cloud à lista dos principais provedores de GPU em nuvem.

  12. Adicionada uma seção sobre provedores de GPU em nuvem e suas ofertas.

  13. Expandida a seção "Quais marcas de GPU estão disponíveis na nuvem?".

  14. Expandida a seção "Isenção de responsabilidade" com considerações adicionais sobre GPU em nuvem e uma discussão sobre comprar versus alugar GPUs.

Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem é o analista principal da AIMultiple desde 2017.

O trabalho de Cem na AIMultiple foi citado por publicações globais líderes, incluindo Business Insider, Forbes, Morning Brew e Washington Post, por empresas globais como Deloitte e HPE, ONGs como o World Economic Forum e organizações supranacionais como a European Commission. [1], [2], [3], [4], [5]

Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas sobre suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.

Ele liderou a estratégia de tecnologia e as compras de uma operadora de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de deep tech Hypatos, que atingiu uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia líderes como TechCrunch e Business Insider.

Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou como engenheiro da computação pela Bogazici University e possui um MBA pela Columbia Business School.
Ver perfil completo
Revisado tecnicamente por
Ekrem Sarı
Ekrem Sarı
Pesquisador de IA
Ekrem é Pesquisador de IA e Cientista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.
Ver perfil completo

Comentários 2

Compartilhe suas ideias

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450
Ashley Jenkinson
Ashley Jenkinson
Oct 31, 2024 at 08:54

Cem - great article, I'd love to pick your brain on private networking or direct connects to these GPU instances.

Cem Dilmegani
Cem Dilmegani
Nov 10, 2024 at 06:58

Hi Ashley, thank you! Sure, happy to chat.

Harsh Sharma
Harsh Sharma
Oct 06, 2024 at 02:19

Hi there, fantastic article and very well-researched. Would you mind checking out Dataoorts at https://dataoorts.com

Cem Dilmegani
Cem Dilmegani
Oct 22, 2024 at 03:18

Sure, we'll review to see if we can include Dataoorts in the next edit.