Premium
Servicios
Premium

Alternativas a DGX Spark: RTX, Ryzen IA Halo y Mac Studio

Cem Dilmegani
Cem Dilmegani
actualizado el 17 de sept. de 2026

Comparamos los benchmarks de inference publicados de DGX Spark, RTX y Ryzen IA Halo, cubriendo el procesamiento de prompt, la generación de tokens y contextos más largos. Las alternativas incluyen Framework Desktop, Mac Studio y sistemas GB10 de otros fabricantes.

Cargando gráfico

La velocidad de decodificación mide los tokens de salida generados por segundo. Valores más altos significan una generación de respuestas más rápida. Los seis resultados usan GPT-OSS 20B MXFP4 en Ollama en batch uno, de la hoja de cálculo enlazada por la revisión de DGX Spark de LMSYS.1

La velocidad de prefill mide los tokens de entrada procesados por segundo antes de la generación de respuestas. Afecta a la rapidez con la que un modelo procesa un prompt, mientras que la decodificación mide la fase de salida posterior.

Benchmarks de inference de DGX Spark

La RTX 5090 generó tokens 3.4 veces más rápido que Spark

La RTX 5090 generó 205.5 tokens/s, frente a 60.9 en DGX Spark, en la hoja de cálculo de LMSYS. La RTX PRO 6000 Blackwell alcanzó 215.2 tokens/s y la RTX 5080 alcanzó 140.9. Spark superó las dos configuraciones de Apple en el mismo dataset, que registraron 52.7 tokens/s en el Mac Studio M1 Max y 46.9 en el Mac mini M4 Pro.1

La hoja de cálculo se recuperó el 17 de septiembre de 2026. No proporciona fechas de prueba, longitudes de prompt ni versiones exactas de Ollama para estas filas. El cuerpo de la revisión informa de un valor de Spark de 49.7 tokens/s, mientras que la hoja enlazada informa de 60.906. Las seis barras usan la hoja para mantener la fuente coherente. Estos resultados no cubren el M3 Ultra ni los modelos M5 Studio anunciados.2

La decodificación de GPT-OSS 120B cayó un 27 % con 32.768 tokens de contexto previo

DGX Spark generó 58.72 tokens/s con GPT-OSS 120B MXFP4 con una profundidad de contexto añadido de cero en los resultados de llama.cpp de febrero de 2026. Con 32.768 tokens de contexto previo, el rendimiento cayó a 42.76 tokens/s, una disminución del 27 %. GPT-OSS 20B cayó de 83.43 a 61.65 tokens/s en el mismo rango.3

El contexto previo es el número de tokens ya contenidos en el contexto de prueba. Ambos modelos generaron la salida más lentamente a medida que aumentaba esa profundidad, por lo que la tasa de contexto corto sobrestima el rendimiento en una sesión larga para estas configuraciones.

El mismo archivo informa de un prefill de GPT-OSS 120B de 2.443.91 tokens/s para un prompt de 2.048 tokens sin profundidad añadida. Una prueba separada con 32 secuencias y 4.096 tokens de entrada cada una alcanzó 262.20 tokens/s de decodificación agregada. Esta es la tasa de salida combinada en todo el batch.3

AMD informa de una ventaja de Halo del 4–14 % en sus pruebas de mayo

AMD informa de un mayor rendimiento de tokens para Ryzen IA Halo que para DGX Spark en cuatro modelos: 14 % para GLM 4.7 Flash-30B-A3B, 12 % para Qwen 3.5-122B-A10B, 7 % para GPT-OSS 120B y 4 % para Qwen 3.6-35B-A3B. La nota al pie describe tres ejecuciones, un contexto de 100 tokens y el software de Spark disponible a fecha 6 de mayo de 2026.4

Se trata de una comparación del fabricante que utiliza un Halo de preproducción con Ryzen IA Max+ 395 y 128 GB de memoria. La página pública no proporciona las tasas absolutas ni suficientes detalles de cuantización y tiempo de ejecución para reproducir una prueba equivalente. Los porcentajes no se pueden aplicar a las puntuaciones de llama.cpp de febrero para calcular los tokens/s de Halo.4

Alternativas a DGX Spark

Spark combina el chip GB10 de NVIDIA, 128 GB de memoria unificada coherente y 273 GB/s de ancho de banda de memoria. Está orientado al desarrollo de IA local utilizando la pila de software de NVIDIA. Sus límites anunciados de tamaño de modelo describen los escenarios compatibles. El encaje real también depende de la precisión de los pesos, el contexto, los búferes de runtime y la memoria del sistema operativo.5

La disponibilidad varía según la región y la configuración.6478

1. Framework Desktop

El configurador actual de Framework incluye la configuración de 128 GB con Ryzen IA Max+ 395 por $3,449 antes de almacenamiento opcional y otras selecciones. Su opción de 32 GB utiliza Max 385. La memoria no es ampliable después de la compra.6

El desarrollador lhl probó GPT-OSS 120B en Framework Desktop usando Vulkan y ROCm, dos rutas de software para ejecutar inference en la GPU. La comparación de octubre con los resultados publicados de Spark utilizó compilaciones diferentes de llama.cpp y tamaños de microbatch de AMD ajustados. Esos ajustes limitan en qué medida los resultados aíslan la diferencia de hardware.9

2. AMD Ryzen IA Halo

Ryzen IA Halo integra Max+ 395, 128 GB de memoria unificada y soporte ROCm como plataforma para desarrolladores. La página actual de AMD ofrece el producto para comprar y usar en Estados Unidos. Su comparación de mayo usó un precio de venta de Halo de $3,999 y $4,699 para Spark. Esos son precios de referencia antiguos, no una comparación verificada de precios de compra en septiembre.4

AMD también incluye un Halo de 192 GB próximo basado en Ryzen IA Max+ PRO 495. El benchmark de mayo cubre la configuración de 128 GB Max+ 395. El rendimiento de la versión anunciada de 192 GB sigue sin verificar en esta comparación.4

3. Apple Mac Studio

Apple anunció el Mac Studio con M5 Max y M5 Ultra el 25 de agosto de 2026. Los precios iniciales en EE. UU. son de $2,499 y $5,499, respectivamente. Las primeras entregas están programadas para el 22 de septiembre, mientras que la configuración de 512 GB está programada para finales de octubre. Estos son precios iniciales, no cotizaciones para la memoria máxima.7

Apple especifica hasta 128 GB para el M5 Max y 512 GB para el M5 Ultra, con hasta 1.2 TB/s de ancho de banda de memoria en el Ultra. Sus propias afirmaciones de aceleración de IA comparan sistemas y cargas de trabajo de Apple seleccionados. No establecen una comparación con Spark. Ningún resultado reproducible de M5 Studio frente a Spark fue aceptado en el dataset de benchmarks de este artículo.7

Las mediciones existentes del M3 Ultra describen la generación anterior. Las comparaciones de compra del M5 requieren resultados del nuevo hardware y de su configuración de memoria específica.

4. ASUS Ascent GX10 y otros sistemas GB10

Los sistemas OEM con GB10 ofrecen alternativas a la carcasa de NVIDIA manteniendo la misma plataforma de chip. StorageReview comparó el ASUS Ascent GX10 con la Founders Edition de NVIDIA y con sistemas de Dell, Acer y GIGABYTE. Sus pruebas con vLLM encontraron que ASUS está en general cerca de los otros sistemas en los modelos probados, mientras que sus pruebas térmicas examinaron las diferencias entre implementaciones.8

La refrigeración, el almacenamiento, las condiciones de soporte y el precio del sistema completo distinguen estas implementaciones. Los resultados térmicos siguen siendo específicos de la carcasa y la carga probadas.

5. Una estación de trabajo RTX dedicada

El estudio de LMSYS proporciona evidencia para considerar la RTX 5090 o la RTX PRO 6000 Blackwell cuando la carga de trabajo cabe en su memoria de GPU. Ambas generaron GPT-OSS 20B más rápido que Spark en la prueba histórica.2 NVIDIA especifica 32 GB de memoria GDDR7 dedicada para la RTX 5090.10

Un presupuesto de estación de trabajo debe incluir el host, la fuente de alimentación, la refrigeración y cualquier GPU adicional. Añadir varias tarjetas aumenta la VRAM total instalada, pero la ejecución sigue dependiendo del particionado del modelo y del comportamiento de la interconexión. El ancho de banda por tarjeta no debe presentarse como una única cifra de ancho de banda de memoria agregada.

La estimación de memoria de LLM incluye los pesos, la caché KV y la sobrecarga de runtime. La descarga a CPU cambia la ruta de ejecución cuando una carga de trabajo supera la memoria de la GPU.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Metodología de benchmark

El artículo utiliza mediciones de hardware publicadas de tres fuentes. Cada comparación conserva el modelo y la carga de trabajo indicados, con las fechas de prueba incluidas cuando se proporcionaron. No se realizó ninguna prueba nueva de hardware ni de calidad de modelo para este artículo.

El barrido de Spark utiliza pruebas de generación de 32 tokens (tg32) y pruebas de procesamiento de prompt de 2.048 tokens (pp2048). Las cinco profundidades de contexto previo van de cero a 32.768 tokens. El resultado de 32 secuencias proviene del benchmark por lotes independiente y mide el rendimiento de salida combinado.

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Cem Dilmegani and Ekrem Sarı (2026) - "Alternativas a DGX Spark: RTX, Ryzen IA Halo y Mac Studio". Publicado en línea en AIMultiple.com. Recuperado el 17 de septiembre de 2026, de: https://aimultiple.com/dgx-spark-alternatives [Recurso en línea]

Dilmegani, C., & Sarı, E. (2026, 17 de septiembre). Alternativas a DGX Spark: RTX, Ryzen IA Halo y Mac Studio. AIMultiple. https://aimultiple.com/dgx-spark-alternatives

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Sarı, Ekrem},
  title  = {{Alternativas a DGX Spark: RTX, Ryzen IA Halo y Mac Studio}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/dgx-spark-alternatives}},
  note   = {AIMultiple. Recuperado el 17 de septiembre de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 19 puntos de datos. Descargue los datos resumidos que se muestran en los gráficos y las tablas de este artículo como un archivo ZIP que contiene 4 archivos CSV.

Última actualización: 26 de septiembre de 2026
Descargar

¿Quieres los datos granulares que hay detrás? Únete a Premium

Registro de cambios

3 actualizaciones
  1. Se añadió una sección sobre el AMD Ryzen AI Halo Mini-PC a la comparación de alternativas.

  2. Eliminada la sección Comparación directa (modelo GPT-OSS 120B).

Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem ha sido el analista principal en AIMultiple desde 2017.

El trabajo de Cem en AIMultiple ha sido citado por publicaciones líderes mundiales como Business Insider, Forbes, Morning Brew y Washington Post, empresas globales como Deloitte y HPE, ONG como World Economic Forum y organizaciones supranacionales como European Commission. [1], [2], [3], [4], [5]

A lo largo de su carrera, Cem trabajó como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.

Dirigió la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando al CEO. También lideró el crecimiento comercial de la empresa de deep tech Hypatos, que alcanzó unos ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.

Cem participa habitualmente en conferencias internacionales de tecnología. Se graduó en Bogazici University como ingeniero informático y tiene un MBA de Columbia Business School.
Ver perfil completo
Revisado técnicamente por
Ekrem Sarı
Ekrem Sarı
Investigador de IA
Ekrem es investigador de IA y científico de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450