Passei os últimos 20 anos focado em otimização de desempenho computacional em nível de sistema. Realizamos benchmark das mais recentes GPUs da NVIDIA, incluindo a NVIDIA H100, H200 e B200, e a AMD MI300X, para análise de escalonamento de simultaneidade. Usando a framework vLLM com o modelo gpt-oss-20b, testamos como estas GPUs lidam com solicitações simultâneas, de 1 a 512. Medindo a taxa de saída do sistema, velocidade de saída por consulta e latência ponta a ponta, compartilhamos descobertas para ajudar a entender o desempenho das GPUs para cargas de trabalho de IA.
Resultados do benchmark de simultaneidade
Taxa de saída do sistema vs simultaneidade
Este gráfico mostra o número total de tokens de saída gerados por segundo pelo sistema em cada nível de simultaneidade.
Velocidade de saída por consulta vs simultaneidade
Esta métrica ilustra a rapidez com que uma consulta individual é processada (em tokens por segundo) à medida que o sistema fica mais ocupado. É calculada com base na latência ponta a ponta para uma saída de 1.000 tokens.
Latência ponta a ponta vs simultaneidade
Este gráfico exibe o tempo médio (em milissegundos) necessário para concluir uma solicitação do início ao fim em diferentes níveis de simultaneidade.
Tokens por segundo por dólar vs. Simultaneidade
Este gráfico avalia a eficiência de custo de cada GPU medindo quantos tokens são gerados por segundo para cada dólar gasto em aluguel por hora. Esta métrica é crucial para entender o retorno sobre o investimento de cada opção de hardware, especialmente para implantações com orçamento limitado.
Nota: Os preços baseiam-se nas taxas horárias sob demanda da plataforma de nuvem Runpod em março de 2026. Os preços estão sujeitos a alterações e podem variar conforme a disponibilidade e o tipo de instância.
Você pode ler mais sobre nossa metodologia de benchmark de simultaneidade.
O que é simultaneidade?
Simultaneidade refere-se à capacidade de uma GPU de processar várias solicitações simultaneamente, um fator-chave para cargas de trabalho de IA, como inferência de grandes modelos de linguagem. Em nossa avaliação de desempenho, os níveis de simultaneidade representam o número de solicitações simultâneas (de 1 a 512) enviadas à GPU durante as execuções de teste. Uma simultaneidade mais alta testa a capacidade da GPU de gerenciar tarefas paralelas sem degradar o desempenho, equilibrando taxa de saída e latência.
Entender a simultaneidade ajuda os usuários a determinar a GPU certa para cargas de trabalho com demanda variável ou necessidades de processamento em lote. Ao executar testes gráficos ou conjuntos de benchmark de GPU, o desempenho da simultaneidade pode diferir significativamente entre GPUs, tornando essencial que consumidores e compradores comparem os resultados de teste em diferentes configurações de sistema e faixas de preço.
O que é vLLM?
vLLM é uma biblioteca de código aberto rápida e fácil de usar para inferência e serviço de grandes modelos de linguagem (LLM), apoiada por uma comunidade de contribuidores. Ela lida com implantações em nuvem e auto-hospedadas LLM através da gestão de memória, processamento de solicitações simultâneas e servindo modelos como gpt-oss-20b de forma eficiente. Para LLMs auto-hospedadas, o vLLM simplifica a implantação com recursos como PagedAttention1 para gerenciamento de memória, agrupamento contínuo e suporte para GPUs NVIDIA e AMD, permitindo várias solicitações simultâneas no hardware local.
Metodologia do benchmark de simultaneidade
Testamos as mais recentes arquiteturas de GPU de alto desempenho da NVIDIA e da AMD para avaliar suas capacidades de escalonamento de simultaneidade para cargas de trabalho de inferência de IA. Nosso benchmark testou as GPUs NVIDIA H100, H200 e B200, juntamente com a MI300X da AMD, executando o modelo OpenAI gpt-oss-20b via vLLM sob condições variáveis de carga simultânea. Através da medição de métricas de taxa de saída, distribuições de latência e padrões de utilização de recursos, esta análise visa fornecer insights para implantações de inferência de IA.
Infraestrutura de teste
Implementamos nossos testes na infraestrutura de nuvem do Runpod, utilizando as arquiteturas de GPU mais avançadas da NVIDIA e a framework vLLM.
- GPU plataforma: infraestrutura de nuvem Runpod (H100, H200, B200 e MI300X)
- Modelo: OpenAI GPT-OSS-20B via framework vLLM
Ambiente de software
NVIDIA GPUs (H100, H200, B200):
- RunPod template:
runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404 - vLLM installation:
vllm[flashinfer]==0.11.0
AMD GPU (MI300X):
- Docker image:
rocm/vllm-dev:open-mi300-08052025
Configuração do servidor vLLM
Diferentes configurações do vLLM foram usadas para otimizar o desempenho para cada arquitetura de hardware.
- Para NVIDIA H100, H200 e B200 GPUs, o servidor foi iniciado com o seguinte comando:
- Para a AMD MI300X GPU, foi utilizada uma compilação vLLM otimizada para ROCm com configurações específicas para a arquitetura:
Nota: Este benchmark foi conduzido usando vLLM v0.11.0. O vLLM v1.0, lançado no início de 2025, introduz mudanças arquiteturais que podem produzir resultados de taxa de saída diferentes.
Configuração do benchmark
Cada GPU foi testada em 9 níveis de simultaneidade diferentes com parâmetros padronizados para garantir resultados consistentes.
- Níveis de simultaneidade: 1, 4, 8, 16, 32, 64, 128, 256, 512 solicitações simultâneas
- Duração do teste: 180 segundos de fase de medição com 30s de aquecimento/arrefecimento
- Tamanho da solicitação: 1.000 tokens de entrada/saída por solicitação
Nota sobre a validação dos resultados: Antes de registrar as métricas finais, realizamos inúmeros testes para determinar a configuração ideal para cada GPU. Uma vez identificada, o benchmark foi executado três vezes consecutivas para verificar a estabilidade. Os resultados de taxa de saída foram consistentes nessas execuções, com uma variação inferior a 0,1%. Os números relatados nesta análise baseiam-se na última dessas três execuções consecutivas.
Principais métricas
Acompanhamos o desempenho em várias dimensões para fornecer uma visão abrangente das capacidades das GPUs sob carga.
- Taxa de saída: Tokens de saída do sistema por segundo, solicitações bem-sucedidas por segundo e velocidade de geração de tokens por solicitação individual
- Latência: Tempo até o primeiro token (TTFT), latência ponta a ponta com percentis P50/P95/P99, latência média por solicitação
- Confiabilidade: Percentagem de taxa de sucesso, classificação de timeout vs. outros erros
Considerações sobre a pilha de software
O desempenho não é apenas uma função do hardware. Frameworks como vLLM têm suporte mais maduro e altamente otimizado para o ecossistema CUDA da NVIDIA em comparação com o ROCm da AMD. As diferenças de desempenho observadas nos resultados do MI300X podem refletir parcialmente o estado atual da otimização do software, em vez do potencial teórico do hardware.
Roteiro de hardware de próxima geração
As GPUs testadas neste benchmark, a B200, H200, H100 e MI300X, representam a geração atual de hardware de inferência de IA. Tanto a NVIDIA como a AMD anunciaram suas sucessoras, o que é um contexto relevante para equipes que planeiam investimentos em infraestrutura para 2026 e além.
Pelo lado da NVIDIA, Jensen Huang anunciou na CES 2026 que a plataforma Vera Rubin NVL72 entrou em produção total, com os primeiros sistemas previstos para envio na segunda metade de 2026.2 De acordo com a NVIDIA, a GPU Rubin oferece aproximadamente 50 PFLOPs de desempenho de inferência FP4, cerca de cinco vezes mais do que sistemas baseados em Blackwell, como o B200 aqui testado.3
Pelo lado da AMD, a Instinct MI400, baseada na arquitetura CDNA 5, está planeada para 2026 e espera-se que dobre aproximadamente o desempenho de computação do MI350, ao mesmo tempo que introduz 432 GB de memória HBM4.4 A AMD também anunciou que a Meta implantará servidores Instinct personalizados baseados no MI450 com até 6 gigawatts de capacidade, com envios a partir da segunda metade de 2026.5 A Oracle oferecerá adicionalmente um supercluster de IA público alimentado por aproximadamente 50.000 GPUs da série MI450 a partir do terceiro trimestre de 2026.6
Para equipes que avaliam as GPUs neste benchmark para implantações de curto prazo, a B200 e a MI300X continuam sendo as opções de melhor desempenho atualmente disponíveis. Para horizontes de planejamento mais longos, o roteiro de 2026 sugere uma mudança significativa tanto na taxa de saída quanto na eficiência de custo de ambos os fornecedores.
Conclusão
A B200 lidera em taxa de saída e escala bem para inferência em lote. A MI300X oferece os tempos de resposta mais rápidos em baixa simultaneidade, tornando-a uma melhor opção para aplicações em tempo real, como chatbots. A H100 e a H200 situam-se no meio, cobrindo cargas de trabalho de uso geral sem se destacarem em nenhuma das dimensões.
A troca fundamental mantém-se em todo o hardware: maior simultaneidade aumenta a taxa de saída do sistema, mas aumenta a latência por solicitação. Escolha com base em se a sua carga de trabalho prioriza o volume ou o tempo de resposta.
Leitura adicional
Explore outras pesquisas sobre hardware de IA, como:
- Top 20 Fabricantes de Chips de IA: NVIDIA e Seus Concorrentes
- GPUs em Nuvem para Aprendizado Profundo: Disponibilidade & Preço / Desempenho
- Melhores 10 Nuvens de GPU Serverless & 14 GPUs com Custo-Efetivo
- Multi-GPU Benchmark
Cite este benchmark
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{dogan2026,
author = {Dogan, Sedat and Sarı, Ekrem},
title = {{GPU Benchmark de Simultaneidade: H100 vs H200 vs B200 vs MI300X}},
year = {2026},
month = mar,
howpublished = {\url{https://aimultiple.com/gpu-benchmark}},
note = {AIMultiple. Acessado em 12 Março 2026}
}
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.