Servicios
Contáctanos

GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X

Sedat Dogan
Sedat Dogan
actualizado el 12 de mar. de 2026

He pasado los últimos 20 años centrado en la optimización del rendimiento computacional a nivel de sistema. Evaluamos las NVIDIA GPU más recientes, incluidas las H100, H200 y B200 de NVIDIA, y la MI300X de AMD, para el análisis de escalado de concurrencia. Utilizando el framework vLLM con el gpt-oss-20b model, probamos cómo estas GPU gestionan solicitudes concurrentes, desde 1 hasta 512. Al medir el rendimiento de salida del sistema, la velocidad de salida por consulta y la latencia de extremo a extremo, compartimos hallazgos para ayudar a comprender el rendimiento de las GPU para cargas de trabajo de IA.

Resultados del benchmark de concurrencia

Rendimiento de salida del sistema vs concurrencia

Loading Chart

Este gráfico muestra el número total de tokens de salida generados por segundo por el sistema en cada nivel de concurrencia.

Velocidad de salida por consulta vs concurrencia

Esta métrica ilustra la rapidez con la que se procesa una consulta individual (en tokens por segundo) a medida que el sistema se ocupa más. Se calcula en función de la latencia de extremo a extremo para una salida de 1.000 tokens.

Latencia de extremo a extremo vs concurrencia

Este gráfico muestra el tiempo promedio (en milisegundos) que tarda en completarse una solicitud de principio a fin en diferentes niveles de concurrencia.

Tokens por segundo por dólar vs. concurrencia

Este gráfico evalúa la rentabilidad de cada GPU midiendo cuántos tokens se generan por segundo por cada dólar gastado en alquiler por hora. Esta métrica es crucial para comprender el retorno de la inversión de cada opción de hardware, especialmente para implementaciones con presupuesto ajustado.

Nota: Los precios se basan en tarifas por hora bajo demanda de la plataforma en la nube Runpod a marzo de 2026. Los precios están sujetos a cambios y pueden variar según la disponibilidad y el tipo de instancia.

Puede leer más sobre nuestra metodología del benchmark de concurrencia.

¿Qué es la concurrencia?

La concurrencia se refiere a la capacidad de una GPU para procesar múltiples solicitudes simultáneamente, un factor clave para cargas de trabajo de IA como la inferencia de LLM. En nuestra evaluación del rendimiento, los niveles de concurrencia representan el número de solicitudes simultáneas (de 1 a 512) enviadas a la GPU durante las ejecuciones de prueba. Una mayor concurrencia pone a prueba la capacidad de la GPU para gestionar tareas paralelas sin degradar el rendimiento, equilibrando el rendimiento y la latencia.

Comprender la concurrencia ayuda a los usuarios a determinar la GPU adecuada para cargas de trabajo con demanda variable o necesidades de procesamiento por lotes. Al ejecutar pruebas de gráficos o suites de benchmark de GPU, el rendimiento de concurrencia puede diferir significativamente entre GPU, lo que hace esencial que los consumidores y compradores comparen los resultados de las pruebas en diferentes configuraciones de sistema y puntos de precio.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

¿Qué es vLLM?

vLLM es una biblioteca de código abierto rápida y fácil de usar para la inferencia y el servicio de LLM, respaldada por una comunidad de colaboradores. Gestiona implementaciones tanto en la nube como autogestionado LLM mediante la administración de memoria, el procesamiento de solicitudes concurrentes y el servicio de models como gpt-oss-20b de manera eficiente. Para LLMs autogestionados, vLLM simplifica la implementación con funciones como PagedAttention1 para la gestión de memoria, el procesamiento por lotes continuo y el soporte para NVIDIA y AMD GPUs, lo que permite múltiples solicitudes concurrentes en hardware local.

Metodología del benchmark de concurrencia

Probamos las últimas arquitecturas de GPU de alto rendimiento de NVIDIA y AMD para evaluar sus capacidades de escalado de concurrencia para cargas de trabajo de inferencia de IA. Nuestro benchmark probó las NVIDIA H100, H200 y B200 GPUs junto con la MI300X de AMD, ejecutando el OpenAI gpt-oss-20b model a través de vLLM en condiciones de carga concurrente variables. Mediante la medición de métricas de rendimiento, distribuciones de latencia y patrones de utilización de recursos, este análisis tiene como objetivo proporcionar información para implementaciones de inferencia de IA.

Infraestructura de prueba

Desplegamos nuestras pruebas en la infraestructura en la nube de Runpod, utilizando las arquitecturas de NVIDIA GPU más avanzadas y el framework vLLM.

  • Plataforma de GPU: infraestructura en la nube de Runpod (H100, H200, B200 y MI300X)
  • Model: OpenAI GPT-OSS-20B a través del framework vLLM

Entorno de software

NVIDIA GPUs (H100, H200, B200):

  • Plantilla RunPod: runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404
  • Instalación de vLLM: vllm[flashinfer]==0.11.0

AMD GPU (MI300X):

  • Imagen Docker: rocm/vllm-dev:open-mi300-08052025

Configuración del servidor vLLM

Se utilizaron diferentes configuraciones de vLLM para optimizar el rendimiento de cada arquitectura de hardware.

  • Para las NVIDIA H100, H200 y B200 GPUs, el servidor se inició con el siguiente comando:
  • Para la AMD MI300X GPU, se utilizó una compilación de vLLM optimizada para ROCm con configuraciones específicas para la arquitectura:

Nota: Este benchmark se realizó utilizando vLLM v0.11.0. vLLM v1.0, lanzada a principios de 2025, introduce cambios arquitectónicos que pueden producir resultados de rendimiento diferentes.

Configuración del benchmark

Cada GPU se probó en 9 niveles de concurrencia diferentes con parámetros estandarizados para garantizar resultados consistentes.

  • Niveles de concurrencia: 1, 4, 8, 16, 32, 64, 128, 256, 512 solicitudes concurrentes
  • Duración de la prueba: fase de medición de 180 segundos con 30s de calentamiento/enfriamiento
  • Tamaño de la solicitud: 1.000 tokens de entrada/salida por solicitud

Nota sobre la validación de resultados: Antes de registrar las métricas finales, ejecutamos numerosas pruebas para determinar la configuración óptima de cada GPU. Una vez identificada, el benchmark se ejecutó tres veces consecutivas para verificar la estabilidad. Los resultados de rendimiento fueron consistentes en todas las ejecuciones, con una variación inferior al 0.1 %. Las cifras presentadas en este análisis se basan en la ejecución final de estas tres consecutivas.

Métricas clave

Realizamos un seguimiento del rendimiento en múltiples dimensiones para proporcionar una visión completa de las capacidades de la GPU bajo carga.

  • Rendimiento: tokens de salida del sistema por segundo, solicitudes exitosas por segundo y velocidad de generación de tokens por solicitud individual
  • Latencia: tiempo hasta el primer token (TTFT), latencia de extremo a extremo con percentiles P50/P95/P99, latencia promedio por solicitud
  • Fiabilidad: porcentaje de tasa de éxito, tiempo de espera frente a otra clasificación de errores

Consideraciones sobre la pila de software

El rendimiento no es únicamente una función del hardware. Frameworks como vLLM tienen un soporte más maduro y altamente optimizado para NVIDIA y su ecosistema CUDA en comparación con AMD y su ROCm. Las diferencias de rendimiento observadas en los resultados de MI300X pueden reflejar en parte el estado actual de la optimización del software y no el potencial teórico del hardware.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Hoja de ruta del hardware de próxima generación

Las GPU probadas en este benchmark, la B200, H200, H100 y MI300X, representan la generación actual de hardware de inferencia de IA. Tanto NVIDIA como AMD han anunciado sus sucesores, lo que constituye un contexto relevante para los equipos que planifican inversiones en infraestructura para 2026 y más allá.

Por el lado de NVIDIA, Jensen Huang anunció en CES 2026 que la plataforma Vera Rubin NVL72 ha entrado en producción total, y se espera que los primeros sistemas se envíen la segunda mitad de 2026.2 Según NVIDIA, la GPU Rubin ofrece aproximadamente 50 PFLOPs de rendimiento de inferencia FP4, aproximadamente cinco veces el de los sistemas basados en Blackwell como el B200 evaluado aquí.2

Por el lado de AMD, el Instinct MI400, basado en la arquitectura CDNA 5, está previsto para 2026 y se espera que aproximadamente duplique el rendimiento de cómputo del MI350, al tiempo que introduce 432 GB de memoria HBM4.3 AMD también ha anunciado que Meta desplegará servidores Instinct personalizados basados en MI450 con una capacidad de hasta 6 gigavatios, cuyos envíos comenzarán en la segunda mitad de 2026.4 Oracle ofrecerá además un supercluster de IA disponible públicamente impulsado por aproximadamente 50.000 GPUs de la serie MI450 a partir del tercer trimestre de 2026.5

Para los equipos que evalúan las GPU de este benchmark para implementaciones a corto plazo, la B200 y la MI300X siguen siendo las opciones de mayor rendimiento disponibles actualmente. Para horizontes de planificación más largos, la hoja de ruta de 2026 sugiere un cambio significativo tanto en rendimiento como en eficiencia de costes por parte de ambos proveedores.

Conclusión

La B200 lidera en rendimiento y escala bien para la inferencia por lotes. La MI300X ofrece los tiempos de respuesta más rápidos a baja concurrencia, lo que la hace más adecuada para aplicaciones en tiempo real como los chatbots. La H100 y la H200 se sitúan en un punto intermedio, cubriendo cargas de trabajo de propósito general sin destacar en ninguna de las dos dimensiones.

La disyuntiva principal se mantiene en todo el hardware: una mayor concurrencia aumenta el rendimiento del sistema, pero incrementa la latencia por solicitud. Elija en función de si su carga de trabajo prioriza el volumen o el tiempo de respuesta.

Lecturas adicionales

Explore otras investigaciones sobre hardware de IA, como:

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Sedat Dogan and Ekrem Sarı (2026) - "GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X". Publicado en línea en AIMultiple.com. Recuperado el 12 de Marzo de 2026, de: https://aimultiple.com/gpu-benchmark [Recurso en línea]

Dogan, S., & Sarı, E. (2026, 12 de Marzo). GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X. AIMultiple. https://aimultiple.com/gpu-benchmark

@misc{dogan2026,
  author = {Dogan, Sedat and Sarı, Ekrem},
  title  = {{GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X}},
  year   = {2026},
  month  = mar,
  howpublished    = {\url{https://aimultiple.com/gpu-benchmark}},
  note   = {AIMultiple. Recuperado el 12 de Marzo de 2026}
}

Registro de cambios

4 actualizaciones
  1. 2026

    Se eliminó la sección 'Desafíos y limitaciones en las pruebas de concurrencia'.

  2. 2025

    Se reemplazó la sección de conclusión.

  3. Se añadió AMD MI300X a la lista de GPUs comparadas.

  4. Se amplió la sección de metodología de evaluación comparativa de concurrencia para incluir la GPU MI300X de AMD.

Sedat Dogan
Sedat Dogan
CTO
Sedat es un líder en tecnología y seguridad de la información con 20 años de experiencia en desarrollo de software, infraestructura de redes y ciberseguridad. Sedat:
- Tiene 20 años de experiencia como hacker de sombrero blanco y gurú del desarrollo, con amplia experiencia en lenguajes de programación y arquitecturas de servidores.
- Es asesor de la junta directiva en un capital de riesgo que invierte en empresas tecnológicas en etapas tempranas y en Ödeal, una plataforma regional de pagos digitales que atiende a 125.000 comercios.
- Ha dirigido la infraestructura tecnológica y la ciberseguridad de siete elecciones nacionales y ha sido reconocido en el Salón de la Fama de la ciberseguridad por líderes tecnológicos globales, incluido Twitter.
Ver perfil completo
Investigado por
Ekrem Sarı
Ekrem Sarı
Investigador de IA
Ekrem es investigador de IA y científico de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450