Serviços
Contate-nos

GPU Benchmark de Simultaneidade: H100 vs H200 vs B200 vs MI300X

Sedat Dogan
Sedat Dogan
atualizado em 12 mar. 2026

Passei os últimos 20 anos focado em otimização de desempenho computacional em nível de sistema. Realizamos benchmark das mais recentes GPUs da NVIDIA, incluindo a NVIDIA H100, H200 e B200, e a AMD MI300X, para análise de escalonamento de simultaneidade. Usando a framework vLLM com o modelo gpt-oss-20b, testamos como estas GPUs lidam com solicitações simultâneas, de 1 a 512. Medindo a taxa de saída do sistema, velocidade de saída por consulta e latência ponta a ponta, compartilhamos descobertas para ajudar a entender o desempenho das GPUs para cargas de trabalho de IA.

Resultados do benchmark de simultaneidade

Taxa de saída do sistema vs simultaneidade

Loading Chart

Este gráfico mostra o número total de tokens de saída gerados por segundo pelo sistema em cada nível de simultaneidade.

Velocidade de saída por consulta vs simultaneidade

Esta métrica ilustra a rapidez com que uma consulta individual é processada (em tokens por segundo) à medida que o sistema fica mais ocupado. É calculada com base na latência ponta a ponta para uma saída de 1.000 tokens.

Latência ponta a ponta vs simultaneidade

Este gráfico exibe o tempo médio (em milissegundos) necessário para concluir uma solicitação do início ao fim em diferentes níveis de simultaneidade.

Tokens por segundo por dólar vs. Simultaneidade

Este gráfico avalia a eficiência de custo de cada GPU medindo quantos tokens são gerados por segundo para cada dólar gasto em aluguel por hora. Esta métrica é crucial para entender o retorno sobre o investimento de cada opção de hardware, especialmente para implantações com orçamento limitado.

Nota: Os preços baseiam-se nas taxas horárias sob demanda da plataforma de nuvem Runpod em março de 2026. Os preços estão sujeitos a alterações e podem variar conforme a disponibilidade e o tipo de instância.

Você pode ler mais sobre nossa metodologia de benchmark de simultaneidade.

O que é simultaneidade?

Simultaneidade refere-se à capacidade de uma GPU de processar várias solicitações simultaneamente, um fator-chave para cargas de trabalho de IA, como inferência de grandes modelos de linguagem. Em nossa avaliação de desempenho, os níveis de simultaneidade representam o número de solicitações simultâneas (de 1 a 512) enviadas à GPU durante as execuções de teste. Uma simultaneidade mais alta testa a capacidade da GPU de gerenciar tarefas paralelas sem degradar o desempenho, equilibrando taxa de saída e latência.

Entender a simultaneidade ajuda os usuários a determinar a GPU certa para cargas de trabalho com demanda variável ou necessidades de processamento em lote. Ao executar testes gráficos ou conjuntos de benchmark de GPU, o desempenho da simultaneidade pode diferir significativamente entre GPUs, tornando essencial que consumidores e compradores comparem os resultados de teste em diferentes configurações de sistema e faixas de preço.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

O que é vLLM?

vLLM é uma biblioteca de código aberto rápida e fácil de usar para inferência e serviço de grandes modelos de linguagem (LLM), apoiada por uma comunidade de contribuidores. Ela lida com implantações em nuvem e auto-hospedadas LLM através da gestão de memória, processamento de solicitações simultâneas e servindo modelos como gpt-oss-20b de forma eficiente. Para LLMs auto-hospedadas, o vLLM simplifica a implantação com recursos como PagedAttention1 para gerenciamento de memória, agrupamento contínuo e suporte para GPUs NVIDIA e AMD, permitindo várias solicitações simultâneas no hardware local.

Metodologia do benchmark de simultaneidade

Testamos as mais recentes arquiteturas de GPU de alto desempenho da NVIDIA e da AMD para avaliar suas capacidades de escalonamento de simultaneidade para cargas de trabalho de inferência de IA. Nosso benchmark testou as GPUs NVIDIA H100, H200 e B200, juntamente com a MI300X da AMD, executando o modelo OpenAI gpt-oss-20b via vLLM sob condições variáveis de carga simultânea. Através da medição de métricas de taxa de saída, distribuições de latência e padrões de utilização de recursos, esta análise visa fornecer insights para implantações de inferência de IA.

Infraestrutura de teste

Implementamos nossos testes na infraestrutura de nuvem do Runpod, utilizando as arquiteturas de GPU mais avançadas da NVIDIA e a framework vLLM.

  • GPU plataforma: infraestrutura de nuvem Runpod (H100, H200, B200 e MI300X)
  • Modelo: OpenAI GPT-OSS-20B via framework vLLM

Ambiente de software

NVIDIA GPUs (H100, H200, B200):

  • RunPod template: runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404
  • vLLM installation: vllm[flashinfer]==0.11.0

AMD GPU (MI300X):

  • Docker image: rocm/vllm-dev:open-mi300-08052025

Configuração do servidor vLLM

Diferentes configurações do vLLM foram usadas para otimizar o desempenho para cada arquitetura de hardware.

  • Para NVIDIA H100, H200 e B200 GPUs, o servidor foi iniciado com o seguinte comando:
  • Para a AMD MI300X GPU, foi utilizada uma compilação vLLM otimizada para ROCm com configurações específicas para a arquitetura:

Nota: Este benchmark foi conduzido usando vLLM v0.11.0. O vLLM v1.0, lançado no início de 2025, introduz mudanças arquiteturais que podem produzir resultados de taxa de saída diferentes.

Configuração do benchmark

Cada GPU foi testada em 9 níveis de simultaneidade diferentes com parâmetros padronizados para garantir resultados consistentes.

  • Níveis de simultaneidade: 1, 4, 8, 16, 32, 64, 128, 256, 512 solicitações simultâneas
  • Duração do teste: 180 segundos de fase de medição com 30s de aquecimento/arrefecimento
  • Tamanho da solicitação: 1.000 tokens de entrada/saída por solicitação

Nota sobre a validação dos resultados: Antes de registrar as métricas finais, realizamos inúmeros testes para determinar a configuração ideal para cada GPU. Uma vez identificada, o benchmark foi executado três vezes consecutivas para verificar a estabilidade. Os resultados de taxa de saída foram consistentes nessas execuções, com uma variação inferior a 0,1%. Os números relatados nesta análise baseiam-se na última dessas três execuções consecutivas.

Principais métricas

Acompanhamos o desempenho em várias dimensões para fornecer uma visão abrangente das capacidades das GPUs sob carga.

  • Taxa de saída: Tokens de saída do sistema por segundo, solicitações bem-sucedidas por segundo e velocidade de geração de tokens por solicitação individual
  • Latência: Tempo até o primeiro token (TTFT), latência ponta a ponta com percentis P50/P95/P99, latência média por solicitação
  • Confiabilidade: Percentagem de taxa de sucesso, classificação de timeout vs. outros erros

Considerações sobre a pilha de software

O desempenho não é apenas uma função do hardware. Frameworks como vLLM têm suporte mais maduro e altamente otimizado para o ecossistema CUDA da NVIDIA em comparação com o ROCm da AMD. As diferenças de desempenho observadas nos resultados do MI300X podem refletir parcialmente o estado atual da otimização do software, em vez do potencial teórico do hardware.

Veja mais dos nossos benchmarks e insights baseados em dados na Pesquisa Google.
GoogleAdicionar como fonte preferencial

Roteiro de hardware de próxima geração

As GPUs testadas neste benchmark, a B200, H200, H100 e MI300X, representam a geração atual de hardware de inferência de IA. Tanto a NVIDIA como a AMD anunciaram suas sucessoras, o que é um contexto relevante para equipes que planeiam investimentos em infraestrutura para 2026 e além.

Pelo lado da NVIDIA, Jensen Huang anunciou na CES 2026 que a plataforma Vera Rubin NVL72 entrou em produção total, com os primeiros sistemas previstos para envio na segunda metade de 2026.2 De acordo com a NVIDIA, a GPU Rubin oferece aproximadamente 50 PFLOPs de desempenho de inferência FP4, cerca de cinco vezes mais do que sistemas baseados em Blackwell, como o B200 aqui testado.3

Pelo lado da AMD, a Instinct MI400, baseada na arquitetura CDNA 5, está planeada para 2026 e espera-se que dobre aproximadamente o desempenho de computação do MI350, ao mesmo tempo que introduz 432 GB de memória HBM4.4 A AMD também anunciou que a Meta implantará servidores Instinct personalizados baseados no MI450 com até 6 gigawatts de capacidade, com envios a partir da segunda metade de 2026.5 A Oracle oferecerá adicionalmente um supercluster de IA público alimentado por aproximadamente 50.000 GPUs da série MI450 a partir do terceiro trimestre de 2026.6

Para equipes que avaliam as GPUs neste benchmark para implantações de curto prazo, a B200 e a MI300X continuam sendo as opções de melhor desempenho atualmente disponíveis. Para horizontes de planejamento mais longos, o roteiro de 2026 sugere uma mudança significativa tanto na taxa de saída quanto na eficiência de custo de ambos os fornecedores.

Conclusão

A B200 lidera em taxa de saída e escala bem para inferência em lote. A MI300X oferece os tempos de resposta mais rápidos em baixa simultaneidade, tornando-a uma melhor opção para aplicações em tempo real, como chatbots. A H100 e a H200 situam-se no meio, cobrindo cargas de trabalho de uso geral sem se destacarem em nenhuma das dimensões.

A troca fundamental mantém-se em todo o hardware: maior simultaneidade aumenta a taxa de saída do sistema, mas aumenta a latência por solicitação. Escolha com base em se a sua carga de trabalho prioriza o volume ou o tempo de resposta.

Leitura adicional

Explore outras pesquisas sobre hardware de IA, como:

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Sedat Dogan and Ekrem Sarı (2026) - "GPU Benchmark de Simultaneidade: H100 vs H200 vs B200 vs MI300X". Publicado on-line em AIMultiple.com. Acessado em 12 Março 2026, em: https://aimultiple.com/gpu-benchmark [Recurso on-line]

Dogan, S., & Sarı, E. (2026, 12 Março). GPU Benchmark de Simultaneidade: H100 vs H200 vs B200 vs MI300X. AIMultiple. https://aimultiple.com/gpu-benchmark

@misc{dogan2026,
  author = {Dogan, Sedat and Sarı, Ekrem},
  title  = {{GPU Benchmark de Simultaneidade: H100 vs H200 vs B200 vs MI300X}},
  year   = {2026},
  month  = mar,
  howpublished    = {\url{https://aimultiple.com/gpu-benchmark}},
  note   = {AIMultiple. Acessado em 12 Março 2026}
}
Sedat Dogan
Sedat Dogan
CTO
Sedat é um líder em tecnologia e segurança da informação com experiência em desenvolvimento de software, coleta de dados web e cibersegurança. Sedat: - Possui 20 anos de experiência como hacker ético e guru de desenvolvimento, com vasta expertise em linguagens de programação e arquiteturas de servidores. - É consultor de executivos de alto nível e membros do conselho de administração de empresas com operações tecnológicas de alto tráfego e missão crítica, como infraestrutura de pagamentos. - Possui grande perspicácia comercial, além de sua expertise técnica.
Ver perfil completo
Pesquisado por
Ekrem Sarı
Ekrem Sarı
Pesquisador de IA
Ekrem é pesquisador de IA na AIMultiple, com foco em automação inteligente, GPUs, agentes de IA e frameworks RAG.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450