Servicios
Contáctanos

GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X

Sedat Dogan
Sedat Dogan
actualizado el 12 de mar. de 2026

He pasado los últimos 20 años centrándome en la optimización del rendimiento computacional a nivel de sistema. Realizamos un benchmark de las últimas NVIDIA GPUs, incluida la H100 de NVIDIA, H200 y B200, y la MI300X de AMD, para análisis de escalado de concurrencia. Usando el framework vLLM con el gpt-oss-20b model, probamos cómo estas GPUs manejan solicitudes concurrentes, desde 1 hasta 512. Midiendo el rendimiento de salida del sistema, la velocidad de salida por consulta y la latencia de extremo a extremo, compartimos los hallazgos para ayudar a comprender el rendimiento de las GPUs para cargas de trabajo de IA.

Resultados del benchmark de concurrencia

Rendimiento de salida del sistema vs concurrencia

Loading Chart

Este gráfico muestra el número total de tokens de salida generados por segundo por el sistema en cada nivel de concurrencia.

Velocidad de salida por consulta vs concurrencia

Esta métrica ilustra qué tan rápido se procesa una consulta individual (en tokens por segundo) a medida que el sistema se vuelve más ocupado. Se calcula en función de la latencia de extremo a extremo para una salida de 1,000 tokens.

Latencia de extremo a extremo vs concurrencia

Este gráfico muestra el tiempo promedio (en milisegundos) que toma completar una solicitud de principio a fin en diferentes niveles de concurrencia.

Tokens por segundo por dólar vs. Concurrencia

Este gráfico evalúa la eficiencia de costos de cada GPU midiendo cuántos tokens se generan por segundo por cada dólar gastado en alquiler por hora. Esta métrica es crucial para comprender el retorno de inversión de cada opción de hardware, especialmente para implementaciones con presupuesto ajustado.

Nota: Los precios se basan en tarifas por hora bajo demanda de la plataforma cloud Runpod a partir de marzo de 2026. Los precios están sujetos a cambios y pueden variar según la disponibilidad y el tipo de instancia.

Puede leer más sobre nuestra metodología de benchmark de concurrencia.

¿Qué es la concurrencia?

La concurrencia se refiere a la capacidad de una GPU para procesar múltiples solicitudes simultáneamente, un factor clave para cargas de trabajo de IA como la inferencia de modelos de lenguaje grandes. En nuestra evaluación de rendimiento, los niveles de concurrencia representan el número de solicitudes simultáneas (desde 1 hasta 512) enviadas a la GPU durante las pruebas. Una mayor concurrencia prueba la capacidad de la GPU para gestionar tareas paralelas sin degradar el rendimiento, equilibrando el rendimiento y la latencia.

Comprender la concurrencia ayuda a los usuarios a determinar la GPU adecuada para cargas de trabajo con demanda variable o necesidades de procesamiento por lotes. Al ejecutar pruebas gráficas o suites de benchmark de GPU, el rendimiento de concurrencia puede diferir significativamente entre GPUs, por lo que es esencial que los consumidores y compradores comparen los resultados de las pruebas en diferentes configuraciones de sistema y puntos de precio.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

¿Qué es vLLM?

vLLM es una biblioteca de código abierto rápida y fácil de usar para inferencia y servicio de modelos de lenguaje grandes (LLM), respaldada por una comunidad de colaboradores. Maneja tanto implementaciones en la nube como LLM autohospedadas gestionando la memoria, procesando solicitudes concurrentes y sirviendo modelos como gpt-oss-20b de manera eficiente. Para LLMs autohospedadas, vLLM simplifica la implementación con características como PagedAttention1 para gestión de memoria, agrupamiento continuo y soporte para GPUs de NVIDIA y AMD, permitiendo múltiples solicitudes concurrentes en hardware local.

Metodología del benchmark de concurrencia

Probamos las últimas arquitecturas de GPU de alto rendimiento de NVIDIA y AMD para evaluar sus capacidades de escalado de concurrencia para cargas de trabajo de inferencia de IA. Nuestro benchmark probó las GPUs NVIDIA H100, H200 y B200 junto con la MI300X de AMD, ejecutando el modelo OpenAI gpt-oss-20b a través de vLLM bajo condiciones de carga concurrente variables. Mediante la medición de métricas de rendimiento, distribuciones de latencia y patrones de utilización de recursos, este análisis tiene como objetivo proporcionar información para implementaciones de inferencia de IA.

Infraestructura de prueba

Implementamos nuestras pruebas en la infraestructura cloud de Runpod, utilizando las arquitecturas de GPU más avanzadas de NVIDIA y el framework vLLM.

  • Plataforma de GPU: infraestructura cloud de Runpod (H100, H200, B200 y MI300X)
  • Modelo: OpenAI GPT-OSS-20B a través del framework vLLM

Entorno de software

NVIDIA GPUs (H100, H200, B200):

  • Plantilla de RunPod: runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404
  • instalación de vLLM: vllm[flashinfer]==0.11.0

AMD GPU (MI300X):

  • Imagen Docker: rocm/vllm-dev:open-mi300-08052025

Configuración del servidor vLLM

Se utilizaron diferentes configuraciones de vLLM para optimizar el rendimiento para cada arquitectura de hardware.

  • Para las NVIDIA H100, H200 y B200 GPUs, el servidor se lanzó con el siguiente comando:
  • Para la AMD MI300X GPU, se utilizó una compilación de vLLM optimizada para ROCm con configuraciones específicas para la arquitectura:

Nota: Este benchmark se realizó utilizando vLLM v0.11.0. vLLM v1.0, lanzado a principios de 2025, introduce cambios arquitectónicos que pueden producir diferentes resultados de rendimiento.

Configuración del benchmark

Cada GPU se probó en 9 niveles de concurrencia diferentes con parámetros estandarizados para garantizar resultados consistentes.

  • Niveles de concurrencia: 1, 4, 8, 16, 32, 64, 128, 256, 512 solicitudes concurrentes
  • Duración de la prueba: 180 segundos de fase de medición con 30s de calentamiento/enfriamiento
  • Tamaño de solicitud: 1,000 tokens de entrada/salida por solicitud

Nota sobre la validación de resultados: Antes de registrar las métricas finales, realizamos numerosas pruebas para determinar la configuración óptima para cada GPU. Una vez identificada, el benchmark se ejecutó tres veces consecutivas para verificar la estabilidad. Los resultados de rendimiento fueron consistentes en todas estas ejecuciones, con una variación inferior al 0.1%. Las cifras reportadas en este análisis se basan en la última de estas tres ejecuciones consecutivas.

Métricas clave

Realizamos un seguimiento del rendimiento en múltiples dimensiones para proporcionar una visión integral de las capacidades de la GPU bajo carga.

  • Rendimiento: tokens de salida del sistema por segundo, solicitudes exitosas por segundo y velocidad de generación de tokens por solicitud individual
  • Latencia: Tiempo hasta el primer token (TTFT), latencia de extremo a extremo con percentiles P50/P95/P99, latencia promedio por solicitud
  • Fiabilidad: Porcentaje de tasa de éxito, tiempo de espera vs. otra clasificación de errores

Consideraciones sobre la pila de software

El rendimiento no es únicamente una función del hardware. Frameworks como vLLM tienen un soporte más maduro y altamente optimizado para el ecosistema CUDA de NVIDIA en comparación con ROCm de AMD. Las diferencias de rendimiento observadas en los resultados de MI300X pueden reflejar en parte el estado actual de la optimización del software en lugar del potencial teórico del hardware.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Hoja de ruta de hardware de próxima generación

Las GPUs probadas en este benchmark, la B200, H200, H100 y MI300X, representan la generación actual de hardware de inferencia de IA. Tanto NVIDIA como AMD han anunciado sus sucesores, lo que es un contexto relevante para los equipos que planifican inversiones en infraestructura para 2026 y más allá.

Por parte de NVIDIA, Jensen Huang anunció en el CES 2026 que la plataforma Vera Rubin NVL72 ha entrado en producción completa, con los primeros sistemas que se espera que se envíen la segunda mitad de 2026.2 Según NVIDIA, la GPU Rubin ofrece aproximadamente 50 PFLOPs de rendimiento de inferencia FP4, aproximadamente cinco veces más que los sistemas basados en Blackwell como el B200 evaluado aquí.3

Por parte de AMD, la Instinct MI400, basada en la arquitectura CDNA 5, está prevista para 2026 y se espera que duplique aproximadamente el rendimiento de cómputo de la MI350, introduciendo 432 GB de memoria HBM4.4 AMD también ha anunciado que Meta implementará servidores Instinct personalizados basados en MI450 con hasta 6 gigavatios de capacidad, con envíos a partir de la segunda mitad de 2026.5 Oracle ofrecerá además un supercluster de IA de acceso público impulsado por aproximadamente 50,000 GPUs de la serie MI450 a partir del tercer trimestre de 2026.6

Para los equipos que evalúan las GPUs de este benchmark para implementaciones a corto plazo, la B200 y la MI300X siguen siendo las opciones de mayor rendimiento disponibles actualmente. Para horizontes de planificación más largos, la hoja de ruta de 2026 sugiere un cambio significativo tanto en el rendimiento como en la eficiencia de costos de ambos proveedores.

Conclusión

La B200 lidera en rendimiento y escala bien para inferencia por lotes. La MI300X ofrece los tiempos de respuesta más rápidos en baja concurrencia, lo que la hace más adecuada para aplicaciones en tiempo real como chatbots. La H100 y la H200 se sitúan en un punto intermedio, cubriendo cargas de trabajo de propósito general sin destacar en ninguna de las dos dimensiones.

El compromiso fundamental se mantiene en todo el hardware: una mayor concurrencia aumenta el rendimiento del sistema pero incrementa la latencia por solicitud. Elija en función de si su carga de trabajo prioriza el volumen o el tiempo de respuesta.

Lecturas adicionales

Explore otras investigaciones de hardware de IA, como:

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Sedat Dogan and Ekrem Sarı (2026) - "GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X". Publicado en línea en AIMultiple.com. Recuperado el 12 de Marzo de 2026, de: https://aimultiple.com/gpu-benchmark [Recurso en línea]

Dogan, S., & Sarı, E. (2026, 12 de Marzo). GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X. AIMultiple. https://aimultiple.com/gpu-benchmark

@misc{dogan2026,
  author = {Dogan, Sedat and Sarı, Ekrem},
  title  = {{GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X}},
  year   = {2026},
  month  = mar,
  howpublished    = {\url{https://aimultiple.com/gpu-benchmark}},
  note   = {AIMultiple. Recuperado el 12 de Marzo de 2026}
}
Sedat Dogan
Sedat Dogan
CTO
Sedat es un líder en tecnología y seguridad de la información con experiencia en desarrollo de software, recopilación de datos web y ciberseguridad. Sedat: - Cuenta con 20 años de experiencia como hacker ético y experto en desarrollo, con amplia experiencia en lenguajes de programación y arquitecturas de servidores. - Asesora a ejecutivos de alto nivel y miembros de juntas directivas de corporaciones con operaciones tecnológicas críticas y de alto tráfico, como la infraestructura de pagos. - Posee una sólida visión para los negocios, además de su experiencia técnica.
Ver perfil completo
Investigado por
Ekrem Sarı
Ekrem Sarı
Investigador de IA
Ekrem es investigador de IA en AIMultiple, donde se centra en la automatización inteligente, las GPU, los agentes de IA y los marcos de trabajo RAG.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450