Serviços
Contate-nos

GPU Benchmark de Concorrência: H100 vs H200 vs B200 vs MI300X

Sedat Dogan
Sedat Dogan
atualizado em 12 mar. 2026

Passei os últimos 20 anos focado na otimização de desempenho computacional em nível de sistema. Realizamos benchmark das mais recentes NVIDIA GPUs, incluindo as NVIDIA’s H100, H200 e B200, e a AMD’s MI300X, para análise de escalabilidade de concorrência. Utilizando o framework vLLM com o gpt-oss-20b modelo, testamos como essas GPUs lidam com requisições concorrentes, de 1 a 512. Medindo a vazão de saída do sistema, a velocidade de saída por consulta e a latência de ponta a ponta, compartilhamos descobertas para ajudar a entender o desempenho de GPU para cargas de trabalho de IA.

Resultados do Benchmark de Concorrência

Vazão de saída do sistema vs concorrência

Loading Chart

Este gráfico mostra o número total de tokens de saída gerados por segundo pelo sistema em cada nível de concorrência.

Velocidade de saída por consulta vs concorrência

Esta métrica ilustra a rapidez com que uma consulta individual é processada (em tokens por segundo) à medida que o sistema fica mais ocupado. Ela é calculada com base na latência de ponta a ponta para uma saída de 1.000 tokens.

Latência de ponta a ponta vs concorrência

Este gráfico exibe o tempo médio (em milissegundos) que leva para concluir uma requisição do início ao fim em diferentes níveis de concorrência.

Tokens por segundo por dólar vs. Concorrência

Este gráfico avalia a eficiência de custo de cada GPU medindo quantos tokens são gerados por segundo para cada dólar gasto em aluguel por hora. Essa métrica é crucial para entender o retorno sobre o investimento de cada opção de hardware, especialmente para implantações com orçamento limitado.

Observação: Os preços são baseados nas taxas horárias sob demanda da plataforma de nuvem Runpod a partir de março de 2026. Os preços estão sujeitos a alterações e podem variar conforme a disponibilidade e o tipo de instância.

Você pode ler mais sobre nossa metodologia de benchmark de concorrência.

O que é concorrência?

A concorrência se refere à capacidade de uma GPU processar múltiplas requisições simultaneamente, um fator-chave para cargas de trabalho de IA, como inferência de grandes modelos de linguagem. Em nossa avaliação de desempenho, os níveis de concorrência representam o número de requisições simultâneas (de 1 a 512) enviadas à GPU durante os testes. Uma concorrência mais alta testa a capacidade da GPU de gerenciar tarefas paralelas sem degradar o desempenho, equilibrando vazão e latência.

Entender a concorrência ajuda os usuários a determinar a GPU certa para cargas de trabalho com demandas variáveis ou necessidades de processamento em lote. Ao executar testes gráficos ou suítes de benchmark de GPU, o desempenho de concorrência pode diferir significativamente entre GPUs, tornando essencial que consumidores e compradores comparem os resultados de testes em diferentes configurações de sistema e faixas de preço.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

O que é vLLM?

vLLM é uma biblioteca de código aberto rápida e fácil de usar para inferência e disponibilização de grandes modelos de linguagem (LLM), apoiada por uma comunidade de colaboradores. Ela gerencia tanto implantações de LLM na nuvem quanto auto-hospedadas LLM gerenciando memória, processando requisições concorrentes e disponibilizando modelos como gpt-oss-20b de forma eficiente. Para LLMs auto-hospedadas, o vLLM simplifica a implantação com recursos como PagedAttention1 para gerenciamento de memória, batching contínuo e suporte para NVIDIA e AMD GPUs, permitindo múltiplas requisições concorrentes em hardware local.

Metodologia do benchmark de concorrência

Testamos as mais recentes arquiteturas de GPU de alto desempenho da NVIDIA e da AMD para avaliar suas capacidades de escalabilidade de concorrência para cargas de trabalho de inferência de IA. Nosso benchmark testou as NVIDIA H100, H200 e B200 GPUs ao lado da AMD’s MI300X, executando o modelo OpenAI gpt-oss-20b via vLLM sob condições variáveis de carga concorrente. Através da medição de métricas de vazão, distribuições de latência e padrões de utilização de recursos, esta análise visa fornecer insights para implantações de inferência de IA.

Infraestrutura de testes

Implementamos nossos testes na infraestrutura de nuvem da Runpod, utilizando as mais avançadas arquiteturas de GPU da NVIDIA e o framework vLLM.

  • GPU plataforma: infraestrutura de nuvem da Runpod (H100, H200, B200 e MI300X)
  • Modelo: OpenAI GPT-OSS-20B via framework vLLM

Ambiente de software

NVIDIA GPUs (H100, H200, B200):

  • Template RunPod: runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404
  • instalação vLLM: vllm[flashinfer]==0.11.0

AMD GPU (MI300X):

  • Imagem Docker: rocm/vllm-dev:open-mi300-08052025

Configuração do servidor vLLM

Diferentes configurações do vLLM foram usadas para otimizar o desempenho para cada arquitetura de hardware.

  • Para as NVIDIA H100, H200 e B200 GPUs, o servidor foi iniciado com o seguinte comando:
  • Para a AMD MI300X GPU, foi utilizada uma compilação vLLM otimizada para ROCm com configurações específicas para a arquitetura:

Observação: Este benchmark foi realizado utilizando vLLM v0.11.0. O vLLM v1.0, lançado no início de 2025, introduz mudanças arquiteturais que podem produzir resultados de vazão diferentes.

Configuração do benchmark

Cada GPU foi testada em 9 níveis diferentes de concorrência com parâmetros padronizados para garantir resultados consistentes.

  • Níveis de concorrência: 1, 4, 8, 16, 32, 64, 128, 256, 512 requisições concorrentes
  • Duração do teste: 180 segundos de fase de medição com 30s de aquecimento/resfriamento
  • Tamanho da requisição: 1.000 tokens de entrada/saída por requisição

Observação sobre validação de resultados: Antes de registrar as métricas finais, realizamos inúmeros testes para determinar a configuração ideal para cada GPU. Uma vez identificada, o benchmark foi executado três vezes consecutivas para verificar a estabilidade. Os resultados de vazão foram consistentes nessas execuções, com uma variação inferior a 0.1%. Os números relatados nesta análise são baseados na última dessas três execuções consecutivas.

Métricas principais

Acompanhamos o desempenho em várias dimensões para fornecer uma visão abrangente das capacidades da GPU sob carga.

  • Vazão: Tokens de saída do sistema por segundo, requisições bem-sucedidas por segundo e velocidade de geração de tokens por requisição individual
  • Latência: Tempo até o Primeiro Token (TTFT), latência de ponta a ponta com percentis P50/P95/P99, latência média por requisição
  • Confiabilidade: Percentual de taxa de sucesso, classificação de timeout vs. outros erros

Considerações sobre a pilha de software

O desempenho não é apenas uma função do hardware. Frameworks como o vLLM possuem suporte mais maduro e altamente otimizado para o ecossistema CUDA da NVIDIA em comparação com o ROCm da AMD. As diferenças de desempenho observadas nos resultados da MI300X podem refletir parcialmente o estado atual da otimização de software, em vez do potencial teórico do hardware.

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Roteiro de hardware de próxima geração

As GPUs testadas neste benchmark, a B200, H200, H100 e MI300X, representam a geração atual de hardware de inferência de IA. Tanto a NVIDIA quanto a AMD anunciaram seus sucessores, o que é um contexto relevante para equipes que planejam investimentos em infraestrutura para 2026 e além.

Do lado da NVIDIA, Jensen Huang anunciou na CES 2026 que a plataforma Vera Rubin NVL72 entrou em produção total, com os primeiros sistemas previstos para envio no segundo semestre de 2026.2 De acordo com a NVIDIA, a GPU Rubin oferece aproximadamente 50 PFLOPs de desempenho de inferência FP4, cerca de cinco vezes o dos sistemas baseados em Blackwell, como o B200 avaliado aqui.2

Do lado da AMD, o Instinct MI400, baseado na arquitetura CDNA 5, está planejado para 2026 e espera-se que duplique aproximadamente o desempenho de computação do MI350, introduzindo 432 GB de memória HBM4.3 A AMD também anunciou que a Meta implantará servidores Instinct personalizados baseados no MI450 com até 6 gigawatts de capacidade, com embarques começando no segundo semestre de 2026.4 A Oracle também oferecerá um supercluster de IA publicamente disponível, alimentado por aproximadamente 50.000 GPUs da série MI450 a partir do terceiro trimestre de 2026.5

Para equipes que avaliam as GPUs neste benchmark para implantações de curto prazo, a B200 e a MI300X permanecem como as opções de maior desempenho atualmente disponíveis. Para horizontes de planejamento mais longos, o roteiro de 2026 sugere uma mudança significativa tanto na vazão quanto na eficiência de custo de ambos os fornecedores.

Conclusão

A B200 lidera em vazão e escala bem para inferência em lote. A MI300X oferece os tempos de resposta mais rápidos em baixa concorrência, sendo mais adequada para aplicações em tempo real, como chatbots. A H100 e a H200 ficam no meio, cobrindo cargas de trabalho de uso geral sem se destacar em nenhuma das dimensões.

O compromisso central se mantém em todo o hardware: maior concorrência aumenta a vazão do sistema, mas eleva a latência por requisição. Escolha com base em se sua carga de trabalho prioriza volume ou tempo de resposta.

Leitura adicional

Explore outras pesquisas sobre hardware de IA, como:

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Sedat Dogan and Ekrem Sarı (2026) - "GPU Benchmark de Concorrência: H100 vs H200 vs B200 vs MI300X". Publicado on-line em AIMultiple.com. Acessado em 12 Março 2026, em: https://aimultiple.com/gpu-benchmark [Recurso on-line]

Dogan, S., & Sarı, E. (2026, 12 Março). GPU Benchmark de Concorrência: H100 vs H200 vs B200 vs MI300X. AIMultiple. https://aimultiple.com/gpu-benchmark

@misc{dogan2026,
  author = {Dogan, Sedat and Sarı, Ekrem},
  title  = {{GPU Benchmark de Concorrência: H100 vs H200 vs B200 vs MI300X}},
  year   = {2026},
  month  = mar,
  howpublished    = {\url{https://aimultiple.com/gpu-benchmark}},
  note   = {AIMultiple. Acessado em 12 Março 2026}
}
Sedat Dogan
Sedat Dogan
CTO
Sedat é um líder em tecnologia e segurança da informação com experiência em desenvolvimento de software, coleta de dados web e cibersegurança. Sedat: - Possui 20 anos de experiência como hacker ético e guru de desenvolvimento, com vasta expertise em linguagens de programação e arquiteturas de servidores. - É consultor de executivos de alto nível e membros do conselho de administração de empresas com operações tecnológicas de alto tráfego e missão crítica, como infraestrutura de pagamentos. - Possui grande perspicácia comercial, além de sua expertise técnica.
Ver perfil completo
Pesquisado por
Ekrem Sarı
Ekrem Sarı
Pesquisador de IA
Ekrem é Pesquisador de IA e Analista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450