He pasado los últimos 20 años centrado en la optimización del rendimiento computacional a nivel de sistema. Evaluamos las NVIDIA GPU más recientes, incluidas las H100, H200 y B200 de NVIDIA, y la MI300X de AMD, para el análisis de escalado de concurrencia. Utilizando el framework vLLM con el gpt-oss-20b model, probamos cómo estas GPU gestionan solicitudes concurrentes, desde 1 hasta 512. Al medir el rendimiento de salida del sistema, la velocidad de salida por consulta y la latencia de extremo a extremo, compartimos hallazgos para ayudar a comprender el rendimiento de las GPU para cargas de trabajo de IA.
Resultados del benchmark de concurrencia
Rendimiento de salida del sistema vs concurrencia
Este gráfico muestra el número total de tokens de salida generados por segundo por el sistema en cada nivel de concurrencia.
Velocidad de salida por consulta vs concurrencia
Esta métrica ilustra la rapidez con la que se procesa una consulta individual (en tokens por segundo) a medida que el sistema se ocupa más. Se calcula en función de la latencia de extremo a extremo para una salida de 1.000 tokens.
Latencia de extremo a extremo vs concurrencia
Este gráfico muestra el tiempo promedio (en milisegundos) que tarda en completarse una solicitud de principio a fin en diferentes niveles de concurrencia.
Tokens por segundo por dólar vs. concurrencia
Este gráfico evalúa la rentabilidad de cada GPU midiendo cuántos tokens se generan por segundo por cada dólar gastado en alquiler por hora. Esta métrica es crucial para comprender el retorno de la inversión de cada opción de hardware, especialmente para implementaciones con presupuesto ajustado.
Nota: Los precios se basan en tarifas por hora bajo demanda de la plataforma en la nube Runpod a marzo de 2026. Los precios están sujetos a cambios y pueden variar según la disponibilidad y el tipo de instancia.
Puede leer más sobre nuestra metodología del benchmark de concurrencia.
¿Qué es la concurrencia?
La concurrencia se refiere a la capacidad de una GPU para procesar múltiples solicitudes simultáneamente, un factor clave para cargas de trabajo de IA como la inferencia de LLM. En nuestra evaluación del rendimiento, los niveles de concurrencia representan el número de solicitudes simultáneas (de 1 a 512) enviadas a la GPU durante las ejecuciones de prueba. Una mayor concurrencia pone a prueba la capacidad de la GPU para gestionar tareas paralelas sin degradar el rendimiento, equilibrando el rendimiento y la latencia.
Comprender la concurrencia ayuda a los usuarios a determinar la GPU adecuada para cargas de trabajo con demanda variable o necesidades de procesamiento por lotes. Al ejecutar pruebas de gráficos o suites de benchmark de GPU, el rendimiento de concurrencia puede diferir significativamente entre GPU, lo que hace esencial que los consumidores y compradores comparen los resultados de las pruebas en diferentes configuraciones de sistema y puntos de precio.
¿Qué es vLLM?
vLLM es una biblioteca de código abierto rápida y fácil de usar para la inferencia y el servicio de LLM, respaldada por una comunidad de colaboradores. Gestiona implementaciones tanto en la nube como autogestionado LLM mediante la administración de memoria, el procesamiento de solicitudes concurrentes y el servicio de models como gpt-oss-20b de manera eficiente. Para LLMs autogestionados, vLLM simplifica la implementación con funciones como PagedAttention1 para la gestión de memoria, el procesamiento por lotes continuo y el soporte para NVIDIA y AMD GPUs, lo que permite múltiples solicitudes concurrentes en hardware local.
Metodología del benchmark de concurrencia
Probamos las últimas arquitecturas de GPU de alto rendimiento de NVIDIA y AMD para evaluar sus capacidades de escalado de concurrencia para cargas de trabajo de inferencia de IA. Nuestro benchmark probó las NVIDIA H100, H200 y B200 GPUs junto con la MI300X de AMD, ejecutando el OpenAI gpt-oss-20b model a través de vLLM en condiciones de carga concurrente variables. Mediante la medición de métricas de rendimiento, distribuciones de latencia y patrones de utilización de recursos, este análisis tiene como objetivo proporcionar información para implementaciones de inferencia de IA.
Infraestructura de prueba
Desplegamos nuestras pruebas en la infraestructura en la nube de Runpod, utilizando las arquitecturas de NVIDIA GPU más avanzadas y el framework vLLM.
- Plataforma de GPU: infraestructura en la nube de Runpod (H100, H200, B200 y MI300X)
- Model: OpenAI GPT-OSS-20B a través del framework vLLM
Entorno de software
NVIDIA GPUs (H100, H200, B200):
- Plantilla RunPod:
runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404 - Instalación de vLLM:
vllm[flashinfer]==0.11.0
AMD GPU (MI300X):
- Imagen Docker:
rocm/vllm-dev:open-mi300-08052025
Configuración del servidor vLLM
Se utilizaron diferentes configuraciones de vLLM para optimizar el rendimiento de cada arquitectura de hardware.
- Para las NVIDIA H100, H200 y B200 GPUs, el servidor se inició con el siguiente comando:
- Para la AMD MI300X GPU, se utilizó una compilación de vLLM optimizada para ROCm con configuraciones específicas para la arquitectura:
Nota: Este benchmark se realizó utilizando vLLM v0.11.0. vLLM v1.0, lanzada a principios de 2025, introduce cambios arquitectónicos que pueden producir resultados de rendimiento diferentes.
Configuración del benchmark
Cada GPU se probó en 9 niveles de concurrencia diferentes con parámetros estandarizados para garantizar resultados consistentes.
- Niveles de concurrencia: 1, 4, 8, 16, 32, 64, 128, 256, 512 solicitudes concurrentes
- Duración de la prueba: fase de medición de 180 segundos con 30s de calentamiento/enfriamiento
- Tamaño de la solicitud: 1.000 tokens de entrada/salida por solicitud
Nota sobre la validación de resultados: Antes de registrar las métricas finales, ejecutamos numerosas pruebas para determinar la configuración óptima de cada GPU. Una vez identificada, el benchmark se ejecutó tres veces consecutivas para verificar la estabilidad. Los resultados de rendimiento fueron consistentes en todas las ejecuciones, con una variación inferior al 0.1 %. Las cifras presentadas en este análisis se basan en la ejecución final de estas tres consecutivas.
Métricas clave
Realizamos un seguimiento del rendimiento en múltiples dimensiones para proporcionar una visión completa de las capacidades de la GPU bajo carga.
- Rendimiento: tokens de salida del sistema por segundo, solicitudes exitosas por segundo y velocidad de generación de tokens por solicitud individual
- Latencia: tiempo hasta el primer token (TTFT), latencia de extremo a extremo con percentiles P50/P95/P99, latencia promedio por solicitud
- Fiabilidad: porcentaje de tasa de éxito, tiempo de espera frente a otra clasificación de errores
Consideraciones sobre la pila de software
El rendimiento no es únicamente una función del hardware. Frameworks como vLLM tienen un soporte más maduro y altamente optimizado para NVIDIA y su ecosistema CUDA en comparación con AMD y su ROCm. Las diferencias de rendimiento observadas en los resultados de MI300X pueden reflejar en parte el estado actual de la optimización del software y no el potencial teórico del hardware.
Hoja de ruta del hardware de próxima generación
Las GPU probadas en este benchmark, la B200, H200, H100 y MI300X, representan la generación actual de hardware de inferencia de IA. Tanto NVIDIA como AMD han anunciado sus sucesores, lo que constituye un contexto relevante para los equipos que planifican inversiones en infraestructura para 2026 y más allá.
Por el lado de NVIDIA, Jensen Huang anunció en CES 2026 que la plataforma Vera Rubin NVL72 ha entrado en producción total, y se espera que los primeros sistemas se envíen la segunda mitad de 2026.2 Según NVIDIA, la GPU Rubin ofrece aproximadamente 50 PFLOPs de rendimiento de inferencia FP4, aproximadamente cinco veces el de los sistemas basados en Blackwell como el B200 evaluado aquí.2
Por el lado de AMD, el Instinct MI400, basado en la arquitectura CDNA 5, está previsto para 2026 y se espera que aproximadamente duplique el rendimiento de cómputo del MI350, al tiempo que introduce 432 GB de memoria HBM4.3 AMD también ha anunciado que Meta desplegará servidores Instinct personalizados basados en MI450 con una capacidad de hasta 6 gigavatios, cuyos envíos comenzarán en la segunda mitad de 2026.4 Oracle ofrecerá además un supercluster de IA disponible públicamente impulsado por aproximadamente 50.000 GPUs de la serie MI450 a partir del tercer trimestre de 2026.5
Para los equipos que evalúan las GPU de este benchmark para implementaciones a corto plazo, la B200 y la MI300X siguen siendo las opciones de mayor rendimiento disponibles actualmente. Para horizontes de planificación más largos, la hoja de ruta de 2026 sugiere un cambio significativo tanto en rendimiento como en eficiencia de costes por parte de ambos proveedores.
Conclusión
La B200 lidera en rendimiento y escala bien para la inferencia por lotes. La MI300X ofrece los tiempos de respuesta más rápidos a baja concurrencia, lo que la hace más adecuada para aplicaciones en tiempo real como los chatbots. La H100 y la H200 se sitúan en un punto intermedio, cubriendo cargas de trabajo de propósito general sin destacar en ninguna de las dos dimensiones.
La disyuntiva principal se mantiene en todo el hardware: una mayor concurrencia aumenta el rendimiento del sistema, pero incrementa la latencia por solicitud. Elija en función de si su carga de trabajo prioriza el volumen o el tiempo de respuesta.
Lecturas adicionales
Explore otras investigaciones sobre hardware de IA, como:
- Los 20 principales fabricantes de chips de IA: 20 NVIDIA y sus competidores
- Nube GPUs para aprendizaje profundo: disponibilidad y precio/rendimiento
- Mejores 10 nubes Serverless GPU y 14 GPUs rentables
- Multi-GPU Benchmark
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dogan2026,
author = {Dogan, Sedat and Sarı, Ekrem},
title = {{GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X}},
year = {2026},
month = mar,
howpublished = {\url{https://aimultiple.com/gpu-benchmark}},
note = {AIMultiple. Recuperado el 12 de Marzo de 2026}
}Registro de cambios
4 actualizaciones- 2026
Se eliminó la sección 'Desafíos y limitaciones en las pruebas de concurrencia'.
- 2025
Se reemplazó la sección de conclusión.
Se añadió AMD MI300X a la lista de GPUs comparadas.
Se amplió la sección de metodología de evaluación comparativa de concurrencia para incluir la GPU MI300X de AMD.
Enlaces de referencia
- Tiene 20 años de experiencia como hacker de sombrero blanco y gurú del desarrollo, con amplia experiencia en lenguajes de programación y arquitecturas de servidores.
- Es asesor de la junta directiva en un capital de riesgo que invierte en empresas tecnológicas en etapas tempranas y en Ödeal, una plataforma regional de pagos digitales que atiende a 125.000 comercios.
- Ha dirigido la infraestructura tecnológica y la ciberseguridad de siete elecciones nacionales y ha sido reconocido en el Salón de la Fama de la ciberseguridad por líderes tecnológicos globales, incluido Twitter.
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.