Serviços
Contate-nos

Cloud GPU Preços, Desempenho e Comparação de Fornecedores

Cem Dilmegani
Cem Dilmegani
atualizado em 17 jun. 2026

Os preços de tabela de Cloud GPU para o mesmo modelo podem diferir várias vezes de um fornecedor para outro. Selecionámos o preço mais baixo, fornecedor, intervalo de mercado e mediana para mais de 40 configurações de GPU nos três níveis de preços, mais um benchmark de débito por dólar em 10 modelos.

Cloud GPU preço por débito

Veja a GPU mais económica para a sua carga de trabalho em 13 fornecedores hyperscaler e neocloud, classificados por débito por dólar:

Preços e desempenho de GPUs na nuvem

1.172 ofertas de 24 fornecedores

Atualizado em 14 Agosto 2026
Exibindo os 10 mais baratos de 245
IONOS
Assinante
AP1-10 GPU T4
$0.94
por GPU / hora
Visite o site
GPU
1 x NVIDIA T4 16 GB
VRAM total
16 GB
Est. mensal
$688
16 vCPU · 128 GB RAM
Texto
1.072 tok/s4.1M tokens por 1 $
Imagem
24.4 img/s91.9k imagens por 1 $
Vast IA
Melhor preço
2x-nvidia-v100-32gb
$0.10
por GPU / hora
GPU
2 x NVIDIA V100 32 GB
VRAM total
64 GB
Est. mensal
$148
128 vCPU · 32 GB RAMFP16FP32FP64INT8
Texto
6.744 tok/s121M tokens por 1 $
Imagem
45.2 img/s810k imagens por 1 $
Vast IA
2x-nvidia-t4-30gb
$0.15
por GPU / hora
GPU
2 x NVIDIA T4 30 GB
VRAM total
60 GB
Est. mensal
$218
56 vCPU · 64 GB RAMFP16FP32INT8INT4
Texto
2.143 tok/s25.7M tokens por 1 $
Imagem
48.8 img/s588k imagens por 1 $
Vast IA
1x-nvidia-t4-15gb
$0.15
por GPU / hora
GPU
1 x NVIDIA T4 15 GB
VRAM total
15 GB
Est. mensal
$110
4 vCPU · 28 GB RAMFP16FP32INT8INT4
Texto
1.072 tok/s25.7M tokens por 1 $
Imagem
24.4 img/s576k imagens por 1 $
Vast IA
1x-nvidia-v100-32gb
$0.16
por GPU / hora
GPU
1 x NVIDIA V100 32 GB
VRAM total
32 GB
Est. mensal
$118
72 vCPU · 48 GB RAMFP16FP32FP64INT8
Texto
3.372 tok/s75.9M tokens por 1 $
Imagem
22.6 img/s518k imagens por 1 $
Verda
8x-nvidia-v100-128gb
$0.17
por GPU / hora
GPU
8 x NVIDIA V100 128 GB
VRAM total
1.024 GB
Est. mensal
$993
48 vCPU · 180 GB RAMFP16FP32FP64INT8
Texto
26.976 tok/s71.4M tokens por 1 $
Imagem
180.8 img/s479k imagens por 1 $
Verda
2x-nvidia-v100-32gb
$0.17
por GPU / hora
GPU
2 x NVIDIA V100 32 GB
VRAM total
64 GB
Est. mensal
$248
10 vCPU · 45 GB RAMFP16FP32FP64INT8
Texto
6.744 tok/s71.4M tokens por 1 $
Imagem
45.2 img/s476k imagens por 1 $
Verda
1x-nvidia-v100-16gb
$0.17
por GPU / hora
GPU
1 x NVIDIA V100 16 GB
VRAM total
16 GB
Est. mensal
$124
6 vCPU · 23 GB RAMFP16FP32FP64INT8
Texto
3.372 tok/s71.4M tokens por 1 $
Imagem
22.6 img/s487k imagens por 1 $
Verda
4x-nvidia-v100-64gb
$0.17
por GPU / hora
GPU
4 x NVIDIA V100 64 GB
VRAM total
256 GB
Est. mensal
$496
20 vCPU · 90 GB RAMFP16FP32FP64INT8
Texto
13.488 tok/s71.4M tokens por 1 $
Imagem
90.4 img/s476k imagens por 1 $
Runpod
1x-nvidia-v100-16gb
$0.23
por GPU / hora
GPU
1 x NVIDIA V100 16 GB
VRAM total
16 GB
Est. mensal
$168
6 vCPU · 30 GB RAMFP16FP32FP64INT8
Texto
3.372 tok/s52.8M tokens por 1 $
Imagem
22.6 img/s360k imagens por 1 $
Filtros
Todos os modelos de GPU
Qualquer número de GPU
Todos os fornecedores
Qualquer interconexão

Consulte a metodologia de benchmark de cloud GPU para mais detalhes.

On-demand é o modelo de preços mais direto, onde paga pela capacidade de computação por hora ou segundo, dependendo do que usar, sem compromissos de longo prazo ou pagamentos adiantados.

Estas instâncias são recomendadas para utilizadores que preferem a flexibilidade de uma plataforma de cloud GPU sem qualquer pagamento adiantado ou compromisso de longo prazo. As instâncias on-demand são geralmente mais caras do que as instâncias spot, mas oferecem capacidade garantida e ininterrupta.

Preços de cloud GPU on-demand

Classificação: Os patrocinadores estão linkados e destacados no topo da tabela. As restantes linhas são classificadas por ordem crescente do preço on-demand mais baixo. O intervalo mostra a diferença entre o preço de tabela mais baixo e o mais alto para o mesmo SKU em todos os fornecedores. A mediana é o meio da distribuição de preços em todas as listagens para esse SKU e serve como uma âncora de mercado justo. Os preços refletem a atualização semanal mais recente do catálogo.

On-demand é o modelo de aluguer padrão, pagamento por hora, sem compromisso, capacidade garantida enquanto mantiver a instância a correr. É o nível mais caro, mas o único sem compromissos.

Preços de cloud GPU spot

Classificação: As linhas são classificadas pelo preço spot mais baixo por ordem crescente. A capacidade spot é interruptível. A mediana é o meio da distribuição de preços spot para esse SKU.

A capacidade spot é interruptível; o fornecedor pode reaver a instância com pouco ou nenhum aviso, geralmente quando a procura on-demand aumenta. As tarifas spot são tipicamente 40-64% abaixo do on-demand no mesmo fornecedor. Use spot para treino com checkpointing, inferência em lote e trabalhos de avaliação que toleram reinícios. Evite-o para inferência sensível à latência ou serviços de réplica única sem failover.

Preços reservados de cloud GPU (1 ano)

Classificação: As linhas são classificadas pelo preço reservado de 1 ano mais baixo em ordem crescente. As reservas garantem capacidade pelo prazo. A mediana é o meio da distribuição de preços reservados para esse SKU.

As reservas garantem capacidade por um prazo fixo em troca de um desconto em relação ao on-demand. Os contratos de um ano são tipicamente 19-57% abaixo da tabela on-demand do mesmo fornecedor. Em alguns casos, as tarifas de reserva ficam abaixo do spot, porque o fornecedor que faz a reserva isola o inventário do mercado spot por completo.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Comparação de desempenho de fornecedores cloud

O mesmo modelo de GPU pode ter um desempenho ligeiramente diferente entre fornecedores devido à escolha do CPU do host, estrutura de rede, configuração do driver e sobrecarga de virtualização. Para quantificar isto, executámos cargas de trabalho idênticas de geração de texto e imagem em AMD MI300X 192GB na DigitalOcean e na Runpod:

Observações principais:

  • Para geração de texto, a Digital Ocean demonstrou um débito ligeiramente superior, processando aproximadamente mais 0.4% de tokens por segundo.
  • Por outro lado, para geração de imagem, a Runpod mostrou uma vantagem marginal, processando cerca de mais 0.4% de imagens por segundo.

A diferença é suficientemente pequena para não ser relevante para a maioria das cargas de trabalho. Para inferência crítica em termos de latência ou treino em grande escala, onde cada ponto percentual se acumula em milhões de inferências, faça um benchmark da configuração específica do fornecedor antes de se comprometer com uma reserva longa.

Comprar on-prem ou alugar na cloud

Comprar faz sentido quando a carga de trabalho é previsível, a equipa tem o conhecimento operacional e a utilização do hardware se mantém acima de ~70% durante a vida útil da GPU. Para procura variável, picos de treino ou experiências de produto, o aluguer na cloud ganha em eficiência de capital e flexibilidade de escala. O ponto de equilíbrio situa-se aproximadamente nos 12 meses de utilização: acima de 70%, a capacidade reservada ou própria quase sempre supera o on-demand; abaixo de 50%, o spot ou on-demand ganha em flexibilidade; a faixa intermédia depende do nível de disrupção de capacidade que a sua carga de trabalho tolera.

Um padrão prático em escala: possuir um cluster base dimensionado para a procura constante, alugar na cloud para picos e trabalho exploratório. A Meta anunciou uma parceria plurianual em fevereiro de 2026 para implementar até 6 gigawatts de AMD Instinct GPUs, sinalizando que mesmo operadores à escala de hyperscaler continuam a expandir a capacidade própria enquanto consomem cloud GPU para cargas de trabalho variáveis.

As GPUs de consumo (RTX 4090, RTX 5090) oferecem o melhor preço por FLOP no papel, mas o EULA da NVIDIA restringe o seu uso em centros de dados comerciais. Continuam a ser úteis para estações de trabalho individuais e trabalho de prova de conceito, não para implementação em produção.

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Metodologia de benchmark de cloud GPU

Os benchmarks de débito usam quantização FP de 4 bits em todos os testes. O pipeline executa:

  • Fine-tuning de texto: Llama 3.2 nas primeiras 5.000 conversas do FineTome, 5 epochs, 1M de tokens totais, framework Unsloth. Débito = (tokens × epochs) / tempo total.
  • Inferência de texto: 1M de tokens gerados com llama-cpp-python.
  • Fine-tuning de imagem: YOLOv9 em 100 imagens do SkyFusion, 4 epochs, Unsloth.
  • Inferência de imagem: YOLOv9 com fine-tuning em ~500 imagens a 640×640.

A métrica de débito por dólar divide a produção da carga de trabalho pelo custo horário da instância. Os valores de débito são específicos da carga de trabalho e servem como orientações relativas; o mesmo hardware terá um débito materialmente diferente no seu próprio modelo.

Perguntas frequentes

Um único nome de modelo de GPU frequentemente abrange vários SKUs físicos. A H100 é vendida nas variantes PCIe, SXM, SXM5 e NVL com preços e larguras de banda de interconexão diferentes. A A100 é vendida com 40GB e 80GB de VRAM; a V100 é vendida com 16GB e 32GB. Dentro de um fornecedor, o preço listado também varia consoante a classe do CPU do host, a RAM e armazenamento incluídos e a região. As tabelas de preços acima dividem os SKUs por interconexão e VRAM sempre que os dados de origem o permitem, para que cada linha seja uma placa física única e não um agregado do nome do modelo.

O componente executa uma carga de trabalho fixa (geração de imagem ou texto, fine-tuning ou inferência) em cada instância de GPU e divide a produção total pelo custo horário da instância. Um número mais alto significa mais barato por resultado para essa carga de trabalho. A classificação muda com a carga de trabalho: Uma placa otimizada para inferência FP8 pode superar uma placa com mais VRAM em geração de texto, mas perder num fine-tuning de modelo de imagem grande. Escolha o separador da carga de trabalho que corresponde à sua tarefa antes de ler a tabela de classificação.

As tabelas de preços são atualizadas numa pesquisa mensal do catálogo.

Leitura adicional

Cite esta pesquisa

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Cem Dilmegani and Ekrem Sarı (2026) - "Cloud GPU Preços, Desempenho e Comparação de Fornecedores". Publicado on-line em AIMultiple.com. Acessado em 17 Junho 2026, em: https://aimultiple.com/cloud-gpu-pricing [Recurso on-line]

Dilmegani, C., & Sarı, E. (2026, 17 Junho). Cloud GPU Preços, Desempenho e Comparação de Fornecedores. AIMultiple. https://aimultiple.com/cloud-gpu-pricing

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Sarı, Ekrem},
  title  = {{Cloud GPU Preços, Desempenho e Comparação de Fornecedores}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/cloud-gpu-pricing}},
  note   = {AIMultiple. Acessado em 17 Junho 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem tem sido o analista principal do AIMultiple desde 2017. O AIMultiple informa centenas de milhares de empresas (de acordo com o similarWeb), incluindo 60% das empresas da Fortune 500 todos os meses.

O trabalho de Cem foi citado por publicações globais de destaque, incluindo Business Insider, Forbes, Washington Post, empresas globais como Deloitte, HPE e ONGs como o Fórum Econômico Mundial e organizações supranacionais como a Comissão Europeia.

Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas em suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.

Ele liderou a estratégia de tecnologia e aquisições de uma empresa de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de tecnologia profunda Hypatos, que alcançou uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia de destaque como TechCrunch e Business Insider.

Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou na Universidade Bogazici como engenheiro de computação e possui um MBA pela Columbia Business School.
Ver perfil completo
Revisado tecnicamente por
Ekrem Sarı
Ekrem Sarı
Pesquisador de IA
Ekrem é Pesquisador de IA e Analista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.
Ver perfil completo

Comentários 2

Compartilhe suas ideias

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450
Ashley Jenkinson
Ashley Jenkinson
Oct 31, 2024 at 08:54

Cem - great article, I'd love to pick your brain on private networking or direct connects to these GPU instances.

Cem Dilmegani
Cem Dilmegani
Nov 10, 2024 at 06:58

Hi Ashley, thank you! Sure, happy to chat.

Harsh Sharma
Harsh Sharma
Oct 06, 2024 at 02:19

Hi there, fantastic article and very well-researched. Would you mind checking out Dataoorts at https://dataoorts.com

Cem Dilmegani
Cem Dilmegani
Oct 22, 2024 at 03:18

Sure, we'll review to see if we can include Dataoorts in the next edit.