Serviços
Contate-nos

GPU Benchmark de Concorrência: H100 vs H200 vs B200 vs MI300X

Sedat Dogan
Sedat Dogan
atualizado em 12 mar. 2026

Passei os últimos 20 anos focando na otimização de desempenho computacional em nível de sistema. Avaliamos as mais recentes NVIDIA GPUs, incluindo as NVIDIA H100, H200 e B200, e a AMD MI300X, para análise de escalabilidade de concorrência. Usando o framework vLLM com o gpt-oss-20b model, testamos como essas GPUs lidam com solicitações simultâneas, de 1 a 512. Ao medir a vazão de saída do sistema, a velocidade de saída por consulta e a latência de ponta a ponta, compartilhamos descobertas para ajudar a entender o desempenho de GPU para cargas de trabalho de IA.

Resultados do benchmark de concorrência

Vazão de saída do sistema vs concorrência

Loading Chart

Este gráfico mostra o número total de tokens de saída gerados por segundo pelo sistema em cada nível de concorrência.

Velocidade de saída por consulta vs concorrência

Esta métrica ilustra a rapidez com que uma consulta individual é processada (em tokens por segundo) à medida que o sistema fica mais ocupado. Ela é calculada com base na latência de ponta a ponta para uma saída de 1.000 tokens.

Latência de ponta a ponta vs concorrência

Este gráfico exibe o tempo médio (em milissegundos) necessário para concluir uma solicitação do início ao fim em diferentes níveis de concorrência.

Tokens por segundo por dólar vs. Concorrência

Este gráfico avalia a eficiência de custo de cada GPU medindo quantos tokens são gerados por segundo para cada dólar gasto em aluguel por hora. Esta métrica é crucial para entender o retorno sobre o investimento de cada opção de hardware, especialmente para implantações com orçamento limitado.

Observação: Os preços são baseados nas tarifas por hora sob demanda da plataforma de nuvem Runpod em março de 2026. Os preços estão sujeitos a alterações e podem variar conforme a disponibilidade e o tipo de instância.

Você pode ler mais sobre nossa metodologia de benchmark de concorrência.

O que é concorrência?

Concorrência refere-se à capacidade de uma GPU de processar várias solicitações simultaneamente, um fator-chave para cargas de trabalho de IA, como inferência de modelos de linguagem de grande porte. Em nossa avaliação de desempenho, os níveis de concorrência representam o número de solicitações simultâneas (de 1 a 512) enviadas à GPU durante as execuções de teste. Maior concorrência testa a capacidade da GPU de gerenciar tarefas paralelas sem degradar o desempenho, equilibrando vazão e latência.

Entender a concorrência ajuda os usuários a determinar a GPU certa para cargas de trabalho com demanda variável ou necessidades de processamento em lote. Ao executar testes gráficos ou suítes de benchmark de GPU, o desempenho de concorrência pode diferir significativamente entre GPUs, tornando essencial que consumidores e compradores comparem os resultados dos testes em diferentes configurações de sistema e faixas de preço.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

O que é vLLM?

vLLM é uma biblioteca open-source rápida e fácil de usar para inferência e serving de modelos de linguagem de grande porte (LLM), apoiada por uma comunidade de colaboradores. Ela lida com implantações em nuvem e LLM auto-hospedado gerenciando memória, processando solicitações simultâneas e servindo modelos como gpt-oss-20b de forma eficiente. Para LLMs auto-hospedados, o vLLM simplifica a implantação com recursos como PagedAttention1 para gerenciamento de memória, batching contínuo e suporte para GPUs NVIDIA e AMD, permitindo múltiplas solicitações simultâneas em hardware local.

Metodologia do benchmark de concorrência

Testamos as mais recentes arquiteturas de GPU de alto desempenho da NVIDIA e da AMD para avaliar suas capacidades de escalabilidade de concorrência para cargas de trabalho de inferência de IA. Nosso benchmark testou as GPUs NVIDIA H100, H200 e B200 juntamente com a MI300X da AMD, executando o OpenAI gpt-oss-20b modelo via vLLM sob condições variáveis de carga simultânea. Por meio da medição de métricas de vazão, distribuições de latência e padrões de utilização de recursos, esta análise visa fornecer insights para implantações de inferência de IA.

Infraestrutura de teste

Implantamos nossos testes na infraestrutura de nuvem da Runpod, utilizando as arquiteturas de GPU mais avançadas da NVIDIA e o framework vLLM.

  • Plataforma de GPU: infraestrutura de nuvem Runpod (H100, H200, B200 e MI300X)
  • Modelo: OpenAI GPT-OSS-20B via framework vLLM

Ambiente de software

NVIDIA GPUs (H100, H200, B200):

  • Template do RunPod: runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404
  • Instalação do vLLM: vllm[flashinfer]==0.11.0

AMD GPU (MI300X):

  • Imagem Docker: rocm/vllm-dev:open-mi300-08052025

Configuração do servidor vLLM

Diferentes configurações do vLLM foram usadas para otimizar o desempenho de cada arquitetura de hardware.

  • Para as NVIDIA H100, H200 e B200 GPUs, o servidor foi iniciado com o seguinte comando:
  • Para a AMD MI300X GPU, uma compilação do vLLM otimizada para ROCm foi usada com configurações específicas para a arquitetura:

Observação: Este benchmark foi conduzido usando o vLLM v0.11.0. O vLLM v1.0, lançado no início de 2025, introduz mudanças arquiteturais que podem produzir resultados de vazão diferentes.

Configuração do benchmark

Cada GPU foi testada em 9 níveis diferentes de concorrência com parâmetros padronizados para garantir resultados consistentes.

  • Níveis de concorrência: 1, 4, 8, 16, 32, 64, 128, 256, 512 solicitações simultâneas
  • Duração do teste: 180 segundos de fase de medição com 30s de ramp-up/cool-down
  • Tamanho da solicitação: 1.000 tokens de entrada/saída por solicitação

Observação sobre a validação dos resultados: Antes de registrar as métricas finais, executamos vários testes para determinar a configuração ideal para cada GPU. Uma vez identificada, o benchmark foi executado três vezes consecutivas para verificar a estabilidade. Os resultados de vazão foram consistentes nessas execuções, com uma variação inferior a 0.1%. Os números relatados nesta análise são baseados na execução final dessas três execuções consecutivas.

Métricas principais

Monitoramos o desempenho em várias dimensões para fornecer uma visão abrangente das capacidades da GPU sob carga.

  • Vazão: tokens de saída do sistema por segundo, solicitações bem-sucedidas por segundo e velocidade de geração de tokens por solicitação individual
  • Latência: Tempo até o Primeiro Token (TTFT), latência de ponta a ponta com percentis P50/P95/P99, latência média por solicitação
  • Confiabilidade: porcentagem de taxa de sucesso, classificação de timeout vs. outros erros

Considerações sobre a stack de software

O desempenho não é apenas uma função do hardware. Frameworks como o vLLM têm suporte mais maduro e altamente otimizado para o ecossistema CUDA da NVIDIA em comparação com o ROCm da AMD. As diferenças de desempenho observadas nos resultados do MI300X podem refletir em parte o estado atual da otimização de software, em vez do potencial teórico do hardware.

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Roadmap de hardware de próxima geração

As GPUs testadas neste benchmark — a B200, a H200, a H100 e a MI300X — representam a geração atual de hardware de inferência de IA. Tanto a NVIDIA quanto a AMD anunciaram suas sucessoras, o que é um contexto relevante para equipes que planejam investimentos em infraestrutura para 2026 e além.

No lado da NVIDIA, Jensen Huang anunciou na CES 2026 que a plataforma Vera Rubin NVL72 entrou em produção plena, com os primeiros sistemas previstos para envio no segundo semestre de 2026.2 De acordo com a NVIDIA, a GPU Rubin oferece aproximadamente 50 PFLOPs de desempenho de inferência FP4, cerca de cinco vezes o dos sistemas baseados em Blackwell, como o B200 avaliado aqui.2

No lado da AMD, o Instinct MI400, baseado na arquitetura CDNA 5, está planejado para 2026 e espera-se que aproximadamente dobre o desempenho de computação do MI350, introduzindo 432 GB de memória HBM4.3 A AMD também anunciou que a Meta implantará servidores Instinct personalizados baseados no MI450 com capacidade de até 6 gigawatts, com envios a partir do segundo semestre de 2026.4 A Oracle oferecerá adicionalmente um supercluster de IA publicamente disponível, alimentado por aproximadamente 50.000 GPUs da série MI450 a partir do terceiro trimestre de 2026.5

Para equipes que avaliam as GPUs deste benchmark para implantações de curto prazo, a B200 e a MI300X continuam sendo as opções de maior desempenho atualmente disponíveis. Para horizontes de planejamento mais longos, o roadmap de 2026 sugere uma mudança significativa tanto em vazão quanto em eficiência de custo por parte de ambos os fornecedores.

Conclusão

A B200 lidera em vazão e escala bem para inferência em lote. A MI300X oferece os tempos de resposta mais rápidos em baixa concorrência, tornando-a mais adequada para aplicações em tempo real, como chatbots. A H100 e a H200 ficam no meio, cobrindo cargas de trabalho de uso geral sem se destacar em nenhuma das dimensões.

O trade-off central vale para todo o hardware: maior concorrência aumenta a vazão do sistema, mas eleva a latência por solicitação. Escolha com base em se sua carga de trabalho prioriza volume ou tempo de resposta.

Leitura adicional

Explore outras pesquisas sobre hardware de IA, como:

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Sedat Dogan and Ekrem Sarı (2026) - "GPU Benchmark de Concorrência: H100 vs H200 vs B200 vs MI300X". Publicado on-line em AIMultiple.com. Acessado em 12 Março 2026, em: https://aimultiple.com/gpu-benchmark [Recurso on-line]

Dogan, S., & Sarı, E. (2026, 12 Março). GPU Benchmark de Concorrência: H100 vs H200 vs B200 vs MI300X. AIMultiple. https://aimultiple.com/gpu-benchmark

@misc{dogan2026,
  author = {Dogan, Sedat and Sarı, Ekrem},
  title  = {{GPU Benchmark de Concorrência: H100 vs H200 vs B200 vs MI300X}},
  year   = {2026},
  month  = mar,
  howpublished    = {\url{https://aimultiple.com/gpu-benchmark}},
  note   = {AIMultiple. Acessado em 12 Março 2026}
}

Registro de alterações

4 atualizações
  1. 2026

    Removida a seção 'Desafios e limitações nos testes de concorrência'.

  2. 2025

    Substituída a seção de conclusão.

  3. Adicionado AMD MI300X à lista de GPUs benchmarkadas.

  4. Expandida a seção de metodologia de benchmark de concorrência para incluir a GPU MI300X da AMD.

Sedat Dogan
Sedat Dogan
CTO
Sedat é um líder em tecnologia e segurança da informação com 20 anos de experiência em desenvolvimento de software, infraestrutura de rede e cibersegurança. Sedat:
- Tem 20 anos de experiência como hacker de chapéu branco e guru de desenvolvimento, com ampla experiência em linguagens de programação e arquiteturas de servidores.
- É conselheiro de administração em uma VC que investe em empresas de tecnologia em estágio inicial e na Ödeal, uma plataforma regional de pagamentos digitais que atende 125.000 comerciantes.
- Liderou a infraestrutura tecnológica e a cibersegurança de sete eleições nacionais e foi reconhecido no Hall da Fama da cibersegurança por líderes globais de tecnologia, incluindo o Twitter.
Ver perfil completo
Pesquisado por
Ekrem Sarı
Ekrem Sarı
Pesquisador de IA
Ekrem é Pesquisador de IA e Cientista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450