Passei os últimos 20 anos focado na otimização de desempenho computacional em nível de sistema. Realizamos benchmark das mais recentes NVIDIA GPUs, incluindo as NVIDIA’s H100, H200 e B200, e a AMD’s MI300X, para análise de escalabilidade de concorrência. Utilizando o framework vLLM com o gpt-oss-20b modelo, testamos como essas GPUs lidam com requisições concorrentes, de 1 a 512. Medindo a vazão de saída do sistema, a velocidade de saída por consulta e a latência de ponta a ponta, compartilhamos descobertas para ajudar a entender o desempenho de GPU para cargas de trabalho de IA.
Resultados do Benchmark de Concorrência
Vazão de saída do sistema vs concorrência
Este gráfico mostra o número total de tokens de saída gerados por segundo pelo sistema em cada nível de concorrência.
Velocidade de saída por consulta vs concorrência
Esta métrica ilustra a rapidez com que uma consulta individual é processada (em tokens por segundo) à medida que o sistema fica mais ocupado. Ela é calculada com base na latência de ponta a ponta para uma saída de 1.000 tokens.
Latência de ponta a ponta vs concorrência
Este gráfico exibe o tempo médio (em milissegundos) que leva para concluir uma requisição do início ao fim em diferentes níveis de concorrência.
Tokens por segundo por dólar vs. Concorrência
Este gráfico avalia a eficiência de custo de cada GPU medindo quantos tokens são gerados por segundo para cada dólar gasto em aluguel por hora. Essa métrica é crucial para entender o retorno sobre o investimento de cada opção de hardware, especialmente para implantações com orçamento limitado.
Observação: Os preços são baseados nas taxas horárias sob demanda da plataforma de nuvem Runpod a partir de março de 2026. Os preços estão sujeitos a alterações e podem variar conforme a disponibilidade e o tipo de instância.
Você pode ler mais sobre nossa metodologia de benchmark de concorrência.
O que é concorrência?
A concorrência se refere à capacidade de uma GPU processar múltiplas requisições simultaneamente, um fator-chave para cargas de trabalho de IA, como inferência de grandes modelos de linguagem. Em nossa avaliação de desempenho, os níveis de concorrência representam o número de requisições simultâneas (de 1 a 512) enviadas à GPU durante os testes. Uma concorrência mais alta testa a capacidade da GPU de gerenciar tarefas paralelas sem degradar o desempenho, equilibrando vazão e latência.
Entender a concorrência ajuda os usuários a determinar a GPU certa para cargas de trabalho com demandas variáveis ou necessidades de processamento em lote. Ao executar testes gráficos ou suítes de benchmark de GPU, o desempenho de concorrência pode diferir significativamente entre GPUs, tornando essencial que consumidores e compradores comparem os resultados de testes em diferentes configurações de sistema e faixas de preço.
O que é vLLM?
vLLM é uma biblioteca de código aberto rápida e fácil de usar para inferência e disponibilização de grandes modelos de linguagem (LLM), apoiada por uma comunidade de colaboradores. Ela gerencia tanto implantações de LLM na nuvem quanto auto-hospedadas LLM gerenciando memória, processando requisições concorrentes e disponibilizando modelos como gpt-oss-20b de forma eficiente. Para LLMs auto-hospedadas, o vLLM simplifica a implantação com recursos como PagedAttention1 para gerenciamento de memória, batching contínuo e suporte para NVIDIA e AMD GPUs, permitindo múltiplas requisições concorrentes em hardware local.
Metodologia do benchmark de concorrência
Testamos as mais recentes arquiteturas de GPU de alto desempenho da NVIDIA e da AMD para avaliar suas capacidades de escalabilidade de concorrência para cargas de trabalho de inferência de IA. Nosso benchmark testou as NVIDIA H100, H200 e B200 GPUs ao lado da AMD’s MI300X, executando o modelo OpenAI gpt-oss-20b via vLLM sob condições variáveis de carga concorrente. Através da medição de métricas de vazão, distribuições de latência e padrões de utilização de recursos, esta análise visa fornecer insights para implantações de inferência de IA.
Infraestrutura de testes
Implementamos nossos testes na infraestrutura de nuvem da Runpod, utilizando as mais avançadas arquiteturas de GPU da NVIDIA e o framework vLLM.
- GPU plataforma: infraestrutura de nuvem da Runpod (H100, H200, B200 e MI300X)
- Modelo: OpenAI GPT-OSS-20B via framework vLLM
Ambiente de software
NVIDIA GPUs (H100, H200, B200):
- Template RunPod:
runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404 - instalação vLLM:
vllm[flashinfer]==0.11.0
AMD GPU (MI300X):
- Imagem Docker:
rocm/vllm-dev:open-mi300-08052025
Configuração do servidor vLLM
Diferentes configurações do vLLM foram usadas para otimizar o desempenho para cada arquitetura de hardware.
- Para as NVIDIA H100, H200 e B200 GPUs, o servidor foi iniciado com o seguinte comando:
- Para a AMD MI300X GPU, foi utilizada uma compilação vLLM otimizada para ROCm com configurações específicas para a arquitetura:
Observação: Este benchmark foi realizado utilizando vLLM v0.11.0. O vLLM v1.0, lançado no início de 2025, introduz mudanças arquiteturais que podem produzir resultados de vazão diferentes.
Configuração do benchmark
Cada GPU foi testada em 9 níveis diferentes de concorrência com parâmetros padronizados para garantir resultados consistentes.
- Níveis de concorrência: 1, 4, 8, 16, 32, 64, 128, 256, 512 requisições concorrentes
- Duração do teste: 180 segundos de fase de medição com 30s de aquecimento/resfriamento
- Tamanho da requisição: 1.000 tokens de entrada/saída por requisição
Observação sobre validação de resultados: Antes de registrar as métricas finais, realizamos inúmeros testes para determinar a configuração ideal para cada GPU. Uma vez identificada, o benchmark foi executado três vezes consecutivas para verificar a estabilidade. Os resultados de vazão foram consistentes nessas execuções, com uma variação inferior a 0.1%. Os números relatados nesta análise são baseados na última dessas três execuções consecutivas.
Métricas principais
Acompanhamos o desempenho em várias dimensões para fornecer uma visão abrangente das capacidades da GPU sob carga.
- Vazão: Tokens de saída do sistema por segundo, requisições bem-sucedidas por segundo e velocidade de geração de tokens por requisição individual
- Latência: Tempo até o Primeiro Token (TTFT), latência de ponta a ponta com percentis P50/P95/P99, latência média por requisição
- Confiabilidade: Percentual de taxa de sucesso, classificação de timeout vs. outros erros
Considerações sobre a pilha de software
O desempenho não é apenas uma função do hardware. Frameworks como o vLLM possuem suporte mais maduro e altamente otimizado para o ecossistema CUDA da NVIDIA em comparação com o ROCm da AMD. As diferenças de desempenho observadas nos resultados da MI300X podem refletir parcialmente o estado atual da otimização de software, em vez do potencial teórico do hardware.
Roteiro de hardware de próxima geração
As GPUs testadas neste benchmark, a B200, H200, H100 e MI300X, representam a geração atual de hardware de inferência de IA. Tanto a NVIDIA quanto a AMD anunciaram seus sucessores, o que é um contexto relevante para equipes que planejam investimentos em infraestrutura para 2026 e além.
Do lado da NVIDIA, Jensen Huang anunciou na CES 2026 que a plataforma Vera Rubin NVL72 entrou em produção total, com os primeiros sistemas previstos para envio no segundo semestre de 2026.2 De acordo com a NVIDIA, a GPU Rubin oferece aproximadamente 50 PFLOPs de desempenho de inferência FP4, cerca de cinco vezes o dos sistemas baseados em Blackwell, como o B200 avaliado aqui.2
Do lado da AMD, o Instinct MI400, baseado na arquitetura CDNA 5, está planejado para 2026 e espera-se que duplique aproximadamente o desempenho de computação do MI350, introduzindo 432 GB de memória HBM4.3 A AMD também anunciou que a Meta implantará servidores Instinct personalizados baseados no MI450 com até 6 gigawatts de capacidade, com embarques começando no segundo semestre de 2026.4 A Oracle também oferecerá um supercluster de IA publicamente disponível, alimentado por aproximadamente 50.000 GPUs da série MI450 a partir do terceiro trimestre de 2026.5
Para equipes que avaliam as GPUs neste benchmark para implantações de curto prazo, a B200 e a MI300X permanecem como as opções de maior desempenho atualmente disponíveis. Para horizontes de planejamento mais longos, o roteiro de 2026 sugere uma mudança significativa tanto na vazão quanto na eficiência de custo de ambos os fornecedores.
Conclusão
A B200 lidera em vazão e escala bem para inferência em lote. A MI300X oferece os tempos de resposta mais rápidos em baixa concorrência, sendo mais adequada para aplicações em tempo real, como chatbots. A H100 e a H200 ficam no meio, cobrindo cargas de trabalho de uso geral sem se destacar em nenhuma das dimensões.
O compromisso central se mantém em todo o hardware: maior concorrência aumenta a vazão do sistema, mas eleva a latência por requisição. Escolha com base em se sua carga de trabalho prioriza volume ou tempo de resposta.
Leitura adicional
Explore outras pesquisas sobre hardware de IA, como:
- Top 20 Fabricantes de Chips de IA: NVIDIA e Seus Concorrentes
- GPUs na Nuvem para Deep Learning: Disponibilidade e Preço / Desempenho
- Melhores 10 Nuvens GPU Serverless e 14 GPUs com Custo-Benefício
- Benchmark Multi-GPU
Cite este benchmark
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{dogan2026,
author = {Dogan, Sedat and Sarı, Ekrem},
title = {{GPU Benchmark de Concorrência: H100 vs H200 vs B200 vs MI300X}},
year = {2026},
month = mar,
howpublished = {\url{https://aimultiple.com/gpu-benchmark}},
note = {AIMultiple. Acessado em 12 Março 2026}
}
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.