Servicios
Contáctanos

GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X

Sedat Dogan
Sedat Dogan
actualizado el 12 de mar. de 2026

He pasado los últimos 20 años centrado en la optimización del rendimiento computacional a nivel de sistema. Hemos comparado las últimas GPUs de NVIDIA, incluyendo la H100 de NVIDIA, la H200, la B200 y la MI300X de AMD, para analizar el escalado de concurrencia. Utilizando el framework vLLM con el gpt-oss-20b modelo, comprobamos cómo estas GPUs gestionan las solicitudes concurrentes, desde 1 hasta 512. Mediante la medición de la tasa de transferencia total del sistema, la velocidad de salida por consulta y la latencia de extremo a extremo, compartimos los hallazgos para ayudar a entender el rendimiento de las GPU en cargas de trabajo de IA.

Resultados del benchmark de concurrencia

Throughput de salida del sistema vs concurrencia

Loading Chart

Este gráfico muestra el número total de tokens de salida generados por segundo por el sistema en cada nivel de concurrencia.

Velocidad de salida por consulta vs concurrencia

Esta métrica ilustra la rapidez con la que se procesa una consulta individual (en tokens por segundo) a medida que el sistema se satura más. Se calcula en base a la latencia de extremo a extremo para una salida de 1.000 tokens.

Latencia de extremo a extremo vs concurrencia

Este gráfico muestra el tiempo medio (en milisegundos) que tarda en completarse una solicitud de principio a fin en diferentes niveles de concurrencia.

Tokens por segundo por dólar vs. Concurrencia

Este gráfico evalúa la eficiencia de costes de cada GPU midiendo cuántos tokens se generan por segundo por cada dólar gastado en alquiler por hora. Esta métrica es crucial para entender el retorno de la inversión de cada opción de hardware, especialmente para implementaciones con presupuesto ajustado.

Nota: Los precios se basan en las tarifas por hora bajo demanda de la plataforma en la nube Runpod a fecha de marzo de 2026. Los precios están sujetos a cambios y pueden variar según la disponibilidad y el tipo de instancia.

Puede leer más sobre nuestra metodología de benchmark de concurrencia.

¿Qué es la concurrencia?

La concurrencia se refiere a la capacidad de una GPU para procesar múltiples solicitudes simultáneamente, un factor clave para cargas de trabajo de IA como la inferencia de modelos de lenguaje extensos. En nuestra evaluación de rendimiento, los niveles de concurrencia representan el número de solicitudes simultáneas (de 1 a 512) enviadas a la GPU durante las ejecuciones de prueba. Una mayor concurrencia pone a prueba la capacidad de la GPU para gestionar tareas paralelas sin degradar el rendimiento, equilibrando el throughput y la latencia.

Entender la concurrencia ayuda a los usuarios a determinar la GPU adecuada para cargas de trabajo con demandas variables o necesidades de procesamiento por lotes. Al ejecutar pruebas gráficas o suites de benchmark de GPU, el rendimiento de concurrencia puede diferir significativamente entre GPUs, siendo esencial para consumidores y compradores comparar los resultados de las pruebas en diferentes configuraciones de sistema y puntos de precio.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

¿Qué es vLLM?

vLLM es una biblioteca de código abierto rápida y fácil de usar para la inferencia y el servicio de modelos de lenguaje extensos (LLM), respaldada por una comunidad de colaboradores. Gestiona implementaciones tanto en la nube como autohospedadas LLM administrando la memoria, procesando solicitudes concurrentes y sirviendo modelos como gpt-oss-20b de manera eficiente. Para LLMs autohospedadas, vLLM simplifica el despliegue con características como PagedAttention1 para la gestión de memoria, el procesamiento por lotes continuo y la compatibilidad tanto con GPUs de NVIDIA como de AMD, lo que permite múltiples solicitudes concurrentes en hardware local.

Metodología del benchmark de concurrencia

Probamos las últimas arquitecturas de GPU de alto rendimiento tanto de NVIDIA como de AMD para evaluar sus capacidades de escalado de concurrencia para cargas de trabajo de inferencia de IA. Nuestro benchmark probó las GPUs NVIDIA H100, H200 y B200 junto con la MI300X de AMD, ejecutando el OpenAI gpt-oss-20b modelo a través de vLLM bajo condiciones de carga concurrente variables. Mediante la medición de métricas de throughput, distribuciones de latencia y patrones de utilización de recursos, este análisis pretende ofrecer información para despliegues de inferencia de IA.

Infraestructura de pruebas

Desplegamos nuestras pruebas en la infraestructura en la nube de Runpod, utilizando las arquitecturas de GPU más avanzadas de NVIDIA y el framework vLLM.

  • Plataforma de GPU: infraestructura en la nube Runpod (H100, H200, B200 y MI300X)
  • Modelo: OpenAI GPT-OSS-20B a través del framework vLLM

Entorno de software

GPUs NVIDIA (H100, H200, B200):

  • RunPod template: runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404
  • vLLM installation: vllm[flashinfer]==0.11.0

GPU AMD (MI300X):

  • Docker image: rocm/vllm-dev:open-mi300-08052025

Configuración del servidor vLLM

Se utilizaron diferentes configuraciones de vLLM para optimizar el rendimiento de cada arquitectura de hardware.

  • Para las GPUs NVIDIA H100, H200 y B200, el servidor se inició con el siguiente comando:
  • Para la GPU AMD MI300X, se utilizó una compilación de vLLM optimizada para ROCm con ajustes específicos para la arquitectura:

Nota: Este benchmark se realizó utilizando vLLM v0.11.0. vLLM v1.0, lanzado a principios de 2025, introduce cambios arquitectónicos que pueden producir resultados de throughput diferentes.

Configuración del benchmark

Cada GPU se probó en 9 niveles de concurrencia diferentes con parámetros estandarizados para garantizar resultados consistentes.

  • Niveles de concurrencia: 1, 4, 8, 16, 32, 64, 128, 256, 512 solicitudes concurrentes
  • Duración de la prueba: fase de medición de 180 segundos con 30s de calentamiento y enfriamiento
  • Tamaño de la solicitud: 1.000 tokens de entrada/salida por solicitud

Nota sobre la validación de resultados: Antes de registrar las métricas finales, realizamos numerosas pruebas para determinar la configuración óptima para cada GPU. Una vez identificada, el benchmark se ejecutó tres veces consecutivas para verificar la estabilidad. Los resultados de throughput fueron consistentes en estas ejecuciones, con una variación inferior al 0.1 %. Las cifras presentadas en este análisis se basan en la última de estas tres ejecuciones consecutivas.

Métricas clave

Monitorizamos el rendimiento en múltiples dimensiones para ofrecer una visión completa de las capacidades de la GPU bajo carga.

  • Throughput: tokens de salida del sistema por segundo, solicitudes exitosas por segundo y velocidad de generación de tokens por solicitud individual
  • Latencia: tiempo hasta el primer token (TTFT), latencia de extremo a extremo con percentiles P50/P95/P99, latencia media por solicitud
  • Fiabilidad: porcentaje de tasa de éxito, tiempo de espera agotado vs. otra clasificación de errores

Consideraciones sobre la pila de software

El rendimiento no depende únicamente del hardware. Frameworks como vLLM tienen un soporte más maduro y altamente optimizado para el ecosistema CUDA de NVIDIA en comparación con el ROCm de AMD. Las diferencias de rendimiento observadas en los resultados del MI300X pueden reflejar en parte el estado actual de la optimización del software más que el potencial teórico del hardware.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Hoja de ruta del hardware de próxima generación

Las GPUs probadas en este benchmark, la B200, H200, H100 y MI300X, representan la generación actual de hardware de inferencia de IA. Tanto NVIDIA como AMD han anunciado sus sucesoras, lo cual es un contexto relevante para los equipos que planifican inversiones en infraestructura para 2026 y más allá.

En el lado de NVIDIA, Jensen Huang anunció en el CES 2026 que la plataforma Vera Rubin NVL72 ha entrado en producción en serie, y se espera que los primeros sistemas se envíen la segunda mitad de 2026.2 Según NVIDIA, la GPU Rubin ofrece aproximadamente 50 PFLOPs de rendimiento de inferencia FP4, aproximadamente cinco veces el de los sistemas basados en Blackwell como el B200 evaluado aquí.2

En el lado de AMD, la Instinct MI400, basada en la arquitectura CDNA 5, está prevista para 2026 y se espera que duplique aproximadamente el rendimiento de la MI350, introduciendo 432 GB de memoria HBM4.3 AMD también ha anunciado que Meta desplegará servidores Instinct personalizados basados en MI450 con una capacidad de hasta 6 gigavatios, y los envíos comenzarán en la segunda mitad de 2026.4 Oracle además ofrecerá un supercluster de IA públicamente disponible alimentado por aproximadamente 50.000 GPUs de la serie MI450 a partir del tercer trimestre de 2026.5

Para los equipos que evalúan las GPUs de este benchmark para implementaciones a corto plazo, la B200 y la MI300X siguen siendo las opciones de mayor rendimiento disponibles actualmente. Para horizontes de planificación más largos, la hoja de ruta de 2026 sugiere un cambio significativo tanto en el throughput como en la eficiencia de costes de ambos fabricantes.

Conclusión

La B200 lidera en throughput y escala bien para la inferencia por lotes. La MI300X ofrece los tiempos de respuesta más rápidos a baja concurrencia, lo que la hace más adecuada para aplicaciones en tiempo real como los chatbots. La H100 y la H200 se sitúan en un punto intermedio, cubriendo cargas de trabajo de propósito general sin destacar en ninguna de las dos dimensiones.

El equilibrio fundamental se mantiene en todo el hardware: una mayor concurrencia aumenta el throughput del sistema pero incrementa la latencia por solicitud. Elija en función de si su carga de trabajo prioriza el volumen o el tiempo de respuesta.

Lecturas adicionales

Explore otras investigaciones sobre hardware de IA, como:

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Sedat Dogan and Ekrem Sarı (2026) - "GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X". Publicado en línea en AIMultiple.com. Recuperado el 12 de Marzo de 2026, de: https://aimultiple.com/gpu-benchmark [Recurso en línea]

Dogan, S., & Sarı, E. (2026, 12 de Marzo). GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X. AIMultiple. https://aimultiple.com/gpu-benchmark

@misc{dogan2026,
  author = {Dogan, Sedat and Sarı, Ekrem},
  title  = {{GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X}},
  year   = {2026},
  month  = mar,
  howpublished    = {\url{https://aimultiple.com/gpu-benchmark}},
  note   = {AIMultiple. Recuperado el 12 de Marzo de 2026}
}
Sedat Dogan
Sedat Dogan
CTO
Sedat es un líder en tecnología y seguridad de la información con experiencia en desarrollo de software, recopilación de datos web y ciberseguridad. Sedat: - Cuenta con 20 años de experiencia como hacker ético y experto en desarrollo, con amplia experiencia en lenguajes de programación y arquitecturas de servidores. - Asesora a ejecutivos de alto nivel y miembros de juntas directivas de corporaciones con operaciones tecnológicas críticas y de alto tráfico, como la infraestructura de pagos. - Posee una sólida visión para los negocios, además de su experiencia técnica.
Ver perfil completo
Investigado por
Ekrem Sarı
Ekrem Sarı
Investigador de IA
Ekrem es investigador de IA y analista de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450