Premium
Serviços
Premium

Benchmark Multi-GPU: B200 vs H200 vs H100 vs MI300X

Sedat Dogan
Sedat Dogan
atualizado em 21 set. 2026

Por mais de duas décadas, otimizar o desempenho computacional tem sido um pilar do meu trabalho. Avaliamos as GPUs NVIDIA B200, H200, H100 e AMD MI300X para avaliar o quão bem elas escalam para Large Language Model (LLM) inference. Usando o framework vLLM com o model meta-llama/Llama-3.1-8B-Instruct, executamos testes em 1, 2, 4 e 8 GPUs.

Analisamos o throughput e a eficiência de escalonamento para ilustrar como cada arquitetura de GPU lida com cargas de trabalho paralelizadas e intensivas em computação.

Resultados do benchmark Multi-GPU

Throughput total vs. contagem de GPU

Carregando gráfico
  • Throughput total (tokens/segundo): Esta métrica representa o poder de processamento bruto de todo o sistema multi-GPU. Ela mede o número total de tokens de entrada e saída processados por segundo, tornando-se o indicador mais importante de desempenho máximo sob uma carga de trabalho saturada e offline.

Para entender como calculamos a pontuação, veja nossa metodologia de benchmark multi-GPU.

Principais insights de desempenho:

Análise de desempenho: A NVIDIA H200 entrega o maior throughput em todas as configurações testadas, com melhorias de desempenho de 9-10% em relação à H100. O sistema atinge 99,8% de eficiência de escalonamento com configurações dual-GPU, indicando utilização quase ideal dos recursos.

AMD MI300X: características de desempenho: A AMD MI300X atinge um throughput de 18.752 tokens por segundo em GPU única, representando aproximadamente 74% do desempenho da H200. O sistema mantém eficiências de escalonamento de 95% e 81% para configurações de duas GPUs e quatro GPUs, respectivamente.

Latência média de inference vs. contagem de GPU

  • Latência média de inference (milissegundos): Esta métrica mede o tempo médio necessário para processar uma única solicitação do início ao fim. Uma latência menor se traduz em uma experiência mais rápida e responsiva para os usuários finais.

Principais insights de desempenho:

Análise de desempenho da latência: A NVIDIA B200 apresenta as menores medições de latência entre todas as configurações avaliadas, atingindo 2.40ms com implementações de oito GPUs. Essas características de desempenho a posicionam para aplicações que exigem tempos de resposta mínimos, como sistemas interativos em tempo real onde a latência sub-3ms é um requisito de design.

Observações sobre eficiência de escalonamento: A análise revela retornos decrescentes na redução de latência à medida que o número de GPUs aumenta em todas as plataformas. A maior redução de latência ocorre durante a transição de configurações de uma para duas GPUs (aproximadamente 50% entre as plataformas). Configurações com mais de 4 GPUs apresentam melhorias de latência progressivamente menores.

Análise comparativa entre H200 e H100: A H200 demonstra latência 5-8% menor do que a H100 em todas as escalas, com a diferença absoluta diminuindo em contagens mais altas de GPUs (2.81ms versus 2.86ms com oito GPUs, uma diferença de 0.05ms). Essa diferença de desempenho marginal, quando comparada com a diferença de preço de 41%, sugere que a H100 pode oferecer características de custo-desempenho mais favoráveis para implantações sensíveis à latência.

AMD MI300X: características de latência: A MI300X demonstra valores de latência 37-75% maiores do que a H200 nas configurações testadas, o que pode ser atribuído às diferenças atuais na maturidade da pilha de software entre as implementações vLLM ROCm e CUDA. Em uma escala de oito GPUs, a MI300X atinge uma latência de 4.20ms, que permanece dentro de parâmetros aceitáveis para inúmeras aplicações de produção, apesar do diferencial de desempenho em relação às plataformas NVIDIA.

Desempenho vs. preço: uma análise de custo-eficiência

Embora as métricas brutas de desempenho sejam cruciais, a decisão final de qualquer organização depende da custo-eficiência. Para analisar o retorno sobre o investimento (ROI) de cada plataforma, mapeamos nossos resultados de throughput em relação aos preços sob demanda por hora do RunPod no momento dos testes. Isso nos permite calcular uma pontuação de “desempenho por dólar”, revelando qual configuração oferece o maior poder computacional pelo menor custo.

Nota: Todas as informações de preços refletem as tarifas sob demanda disponíveis na plataforma RunPod Cloud no momento do benchmark (setembro de 2025) e estão sujeitas a alterações. Os custos são apresentados para análise comparativa e não incluem taxas de armazenamento ou rede.

Como calculamos o throughput por dólar

Para gerar este gráfico, processamos nossos dados brutos de desempenho em relação aos custos por hora. A fórmula de cálculo é:

  • Preparação dos dados: Para cada ponto de dados em nossa tabela de resultados, recuperamos o custo por hora correspondente para a configuração específica de GPU (por exemplo, 4x H100 custa $10,76).
  • Cálculo: Em seguida, aplicamos a fórmula para calcular o valor throughput_per_dollar. Por exemplo, a H100 com 1x GPU entregou 23.243 tokens/s a um custo de $2,69/h, resultando em uma pontuação de 8.642 tokens/s por dólar.

Essa pontuação de eficiência fornece uma ferramenta de tomada de decisão, movendo a conversa de “qual é o mais rápido?” para “qual é o investimento mais inteligente para nossa carga de trabalho?”

O que é escalonamento multi-GPU?

O escalonamento multi-GPU refere-se à capacidade de um sistema de aumentar seu desempenho distribuindo uma única tarefa grande entre várias GPUs. Para inference de LLM, isso pode ser alcançado por meio de paralelismo de dados, onde cópias independentes do model são executadas em cada GPU, com um balanceador de carga distribuindo as solicitações recebidas entre todas as instâncias.

Idealmente, usar duas GPUs forneceria o dobro do desempenho de uma única GPU (aceleração de 2x). No entanto, na realidade, os ganhos de desempenho são limitados por CPU e gargalos do sistema, o tempo que o sistema host gasta gerenciando vários processos simultâneos, restrições de largura de banda de memória e contenção de recursos. Nosso benchmark mede a eficiência com que cada plataforma gerencia essas restrições em nível de sistema, um fator crítico para construir servidores de inference de IA econômicos e de alto desempenho para models de pequeno a médio porte.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Quais são os desafios nos testes de escalonamento Multi-GPU?

Fazer benchmark de sistemas multi-GPU apresenta desafios únicos que podem afetar significativamente o desempenho.

Sobrecarga de comunicação e gargalos de interconexão

Quando um model é dividido entre várias GPUs, a interconexão, como o NVLink da NVIDIA ou o Infinity Fabric da AMD, torna-se um gargalo crítico de desempenho. A eficiência da comunicação inter-GPU afeta diretamente o escalonamento. Se o tempo gasto esperando dados de outra GPU exceder o tempo economizado pela paralelização da computação, os ganhos de desempenho diminuirão. Esse efeito é particularmente pronunciado em models que não são grandes o suficiente para saturar totalmente a capacidade computacional de cada GPU.

Maturidade do ecossistema de software

O desempenho não é apenas uma função do hardware. A pilha de software, incluindo drivers, bibliotecas de comunicação (como NCCL para NVIDIA e RCCL para AMD) e o engine de inference (vLLM), desempenha um papel monumental. Descobrimos que o desempenho de uma plataforma está profundamente ligado à maturidade de seu suporte de software. Um ecossistema estabelecido como o CUDA da NVIDIA geralmente se beneficia de anos de fine-tuning e otimização, o que pode levar a uma eficiência de escalonamento superior em comparação com integrações mais recentes como o ROCm da AMD, mesmo em hardware poderoso.

Otimizações específicas da plataforma

Como nossos testes revelaram, alcançar o desempenho ideal geralmente exige configurações específicas da plataforma. Usar uma abordagem genérica de “tamanho único” pode levar a um desempenho enganosamente baixo. A imagem Docker correta, as variáveis de ambiente (por exemplo, habilitar kernels personalizados da AMD) e até mesmo os data types do model (por exemplo, bfloat16 para Blackwell) são essenciais para liberar o verdadeiro potencial do hardware. Isso torna as comparações justas “apple-to-apple” um desafio técnico significativo.

Metodologia de benchmark Multi-GPU

Testamos as mais recentes arquiteturas de GPU de alto desempenho da NVIDIA e da AMD para avaliar suas capacidades de escalonamento. Nosso benchmark mediu o desempenho de configurações de uma e de múltiplas GPUs (1x, 2x, 4x, 8x) usando o model padrão meta-llama/Llama-3.1-8B-Instruct1 e o engine de inference vLLM2.

Ambiente e processo de teste

  • Plataforma: Todos os benchmarks foram executados no RunPod Cloud para garantir acesso consistente ao hardware.
  • Engine de inference: vLLM (ferramenta vllm bench throughput) foi usado como engine padronizado.
  • Model: meta-llama/Llama-3.1-8B-Instruct.
  • Dataset: dataset ShareGPT Vicuna (25.000 prompts) para simular uma carga de trabalho conversacional.
  • Estratégia: Paralelismo de dados; cada teste multi-GPU executou uma instância independente do vLLM em cada GPU. A carga total de prompts foi distribuída uniformemente entre as instâncias, que foram executadas simultaneamente para simular um ambiente de produção balanceado por carga. Essa abordagem elimina a comunicação inter-GPU (NVLink/PCIe) como gargalo, transferindo os limitadores de desempenho para o sistema host (CPU, RAM).
  • Automação: Scripts Bash personalizados foram usados para automatizar a configuração do ambiente, a execução dos testes, o monitoramento de recursos (nvidia-smi, rocm-smi) e a agregação de resultados.

Configurações específicas da plataforma

Alcançar o desempenho ideal exigiu configurações personalizadas para cada arquitetura.

Plataformas NVIDIA (H100, H200, B200)

  • Imagem base: runpod/pytorch:2.8.0-py3.11-cuda12.8.1.
  • Instalação do vLLM:
    • H100/H200 (Hopper): Instalação padrão via pip install vllm.
    • B200 (Blackwell): O vLLM foi compilado a partir do código-fonte (pip install -e .) para habilitar o suporte nativo à nova arquitetura, resolvendo erros de “no kernel image”.
  • Parâmetros principais:
  • Variável de ambiente crítica:

Plataforma AMD (MI300X)

  • Imagem base: rocm/vllm:rocm6.4.1_vllm_0.10.1_20250909
  • Instalação do vLLM: Nenhuma instalação foi necessária, pois a versão otimizada foi incluída na imagem.
  • Parâmetros principais & otimizações: O ajuste extensivo identificou as seguintes configurações não padrão como críticas para alcançar o throughput máximo:
  • Variáveis de ambiente específicas da AMD:
  • Visibilidade do dispositivo: ROCR_VISIBLE_DEVICES foi usado em vez do equivalente do CUDA para atribuir instâncias a GPUs específicas.

Fases de execução do benchmark

Cada execução de benchmark seguiu um protocolo de execução em três fases para garantir resultados precisos e reproduzíveis:

Fase 1: Aquecimento

Antes de cada teste de configuração multi-GPU, realizamos uma fase de aquecimento dedicada para eliminar os efeitos de partida a frio:

  • Duração: 100 prompts processados na GPU 0
  • Objetivo: Carregamento do model, inicialização do cache KV e compilação de kernel CUDA/ROCm
  • Resultado: Descartado (não incluído nas medições)
  • Comportamento específico da plataforma:
    • NVIDIA (CUDA): Compilação de kernel e otimização de grafo CUDA (~30-60 segundos)
    • AMD (ROCm): Compilação de kernel e ajuste opcional TunableOp (varia conforme a configuração PYTORCH_TUNABLEOP_ENABLED)

Fase 2: Inicialização do monitoramento de GPU

Simultaneamente à execução do benchmark, lançamos processos de monitoramento dedicados para cada GPU:

  • Taxa de amostragem: intervalos de 1 segundo
  • Métricas coletadas: utilização da GPU, uso de memória, temperatura, consumo de energia
  • Ferramentas: nvidia-smi (NVIDIA) ou rocm-smi (AMD)
  • Saída: logs CSV para pós-análise

Fase 3: Execução paralela do benchmark

Após a conclusão do aquecimento, todas as instâncias de GPU foram iniciadas simultaneamente:

  • Cada GPU processou uma parcela igual dos 25.000 prompts totais
  • Todas as instâncias foram iniciadas no mesmo segundo para simular o balanceamento de carga de produção
  • Throughput total é medido como a soma de todas as saídas de GPU
  • Tempo de execução medido desde o início da primeira instância até a conclusão da última instância
Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Impacto do desempenho no mundo real a partir dos testes

Nossos testes revelaram que pequenos erros de configuração podem levar a resultados de desempenho significativos e enganosos. A tabela a seguir ilustra o impacto de configurações incorretas específicas da plataforma:

Conclusão

Para servir models na classe 8B-13B, o paralelismo de dados é uma estratégia altamente eficiente. A escolha do hardware depende das prioridades específicas de implantação.

Para cargas de trabalho em que a custo-eficiência é uma consideração primordial, a NVIDIA H100 oferece características favoráveis, equilibrando métricas de desempenho, custos de aquisição e comportamento de escalonamento previsível.

Quando a maximização do throughput é o objetivo principal sem restrições orçamentárias, a NVIDIA H200 apresenta as medições de desempenho mais altas entre as plataformas avaliadas.

A AMD MI300X apresenta características notáveis para estratégias de implantação de longo prazo e ambientes de infraestrutura baseados na AMD. Antecipa-se que as melhorias de desempenho ocorram por meio de iterações de otimização de software, e a capacidade substancial de VRAM da plataforma permite acomodar arquiteturas de models maiores.

A NVIDIA B200 demonstra limitações nesta configuração específica de carga de trabalho, exibindo restrições de desempenho relacionadas à CPU e custo-eficiência abaixo do ideal. A arquitetura parece mais adequada para implementações que usam models em grande escala com estratégias de paralelismo de tensor.

Leitura adicional

Explore outras pesquisas de hardware de IA, como:

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Sedat Dogan and Ekrem Sarı (2026) - "Benchmark Multi-GPU: B200 vs H200 vs H100 vs MI300X". Publicado on-line em AIMultiple.com. Acessado em 21 setembro 2026, em: https://aimultiple.com/multi-gpu [Recurso on-line]

Dogan, S., & Sarı, E. (2026, 21 setembro). Benchmark Multi-GPU: B200 vs H200 vs H100 vs MI300X. AIMultiple. https://aimultiple.com/multi-gpu

@misc{dogan2026,
  author = {Dogan, Sedat and Sarı, Ekrem},
  title  = {{Benchmark Multi-GPU: B200 vs H200 vs H100 vs MI300X}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/multi-gpu}},
  note   = {AIMultiple. Acessado em 21 setembro 2026}
}
Baixar todos os dados

Resultados e carimbos de data/hora de 7 pontos de dados. Baixe os dados resumidos exibidos nos gráficos e tabelas deste artigo como um arquivo ZIP contendo um arquivo CSV.

Última atualização: 26 setembro 2026
Baixar

Quer os dados granulares por trás disso? Assine o Premium

Registro de alterações

2 atualizações
  1. Atualizado o conjunto de dados na seção de resultados do benchmark multi-GPU.

  2. Removida a métrica 'Requisições por segundo' da seção 'Throughput total vs. contagem de GPU'.

Sedat Dogan
Sedat Dogan
CTO
Sedat é um líder em tecnologia e segurança da informação com 20 anos de experiência em desenvolvimento de software, infraestrutura de rede e cibersegurança. Sedat:
- Tem 20 anos de experiência como hacker de chapéu branco e guru de desenvolvimento, com ampla experiência em linguagens de programação e arquiteturas de servidores.
- É conselheiro de administração em uma VC que investe em empresas de tecnologia em estágio inicial e na Ödeal, uma plataforma regional de pagamentos digitais que atende 125.000 comerciantes.
- Liderou a infraestrutura tecnológica e a cibersegurança de sete eleições nacionais e foi reconhecido no Hall da Fama da cibersegurança por líderes globais de tecnologia, incluindo o Twitter.
Ver perfil completo
Pesquisado por
Ekrem Sarı
Ekrem Sarı
Pesquisador de IA
Ekrem é Pesquisador de IA e Cientista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450