Nous comparons les benchmarks d’inference publiés pour DGX Spark, RTX et Ryzen IA Halo, couvrant le traitement des prompts, la génération de tokens et les contextes plus longs. Les alternatives incluent le Framework Desktop, le Mac Studio et les systèmes GB10 d’autres fabricants.
La vitesse de décodage mesure les tokens de sortie générés par seconde. Des valeurs plus élevées signifient une génération de réponse plus rapide. Les six résultats utilisent GPT-OSS 20B MXFP4 dans Ollama avec un batch de un, à partir du tableur lié par la revue DGX Spark de LMSYS.1
La vitesse de prefill mesure les tokens d’entrée traités par seconde avant la génération de la réponse. Elle affecte la rapidité avec laquelle un model traite un prompt, tandis que le décodage mesure la phase de sortie suivante.
Benchmarks d’inference du DGX Spark
La RTX 5090 a généré des tokens 3.4 fois plus vite que la Spark
La RTX 5090 a généré 205.5 tokens/s, contre 60.9 sur la DGX Spark, dans le tableur LMSYS. La RTX PRO 6000 Blackwell a atteint 215.2 tokens/s et la RTX 5080 a atteint 140.9. La Spark a dépassé les deux configurations Apple du même dataset, qui ont enregistré 52.7 tokens/s sur le Mac Studio M1 Max et 46.9 sur le Mac mini M4 Pro.1
Le tableur a été consulté le 17 septembre 2026. Il n’indique pas les dates de test, les longueurs de prompt ni les versions exactes d’Ollama pour ces lignes. Le corps de la revue rapporte une valeur de 49.7 tokens/s pour la Spark, tandis que la feuille liée rapporte 60.906. Les six barres utilisent la feuille afin de garder la source cohérente. Ces résultats ne couvrent pas les models M3 Ultra ni les models M5 Studio annoncés.2
Le décodage de GPT-OSS 120B a chuté de 27 % à 32 768 tokens de contexte antérieur
La DGX Spark a généré 58.72 tokens/s avec GPT-OSS 120B MXFP4 à une profondeur de contexte ajouté nulle dans les résultats llama.cpp de février 2026. À 32 768 tokens de contexte antérieur, le débit est tombé à 42.76 tokens/s, soit une baisse de 27 %. GPT-OSS 20B est tombé de 83.43 à 61.65 tokens/s sur la même plage.3
Le contexte antérieur est le nombre de tokens déjà présents dans le contexte de test. Les deux models ont généré la sortie plus lentement à mesure que cette profondeur augmentait, de sorte que le débit en contexte court surestime les performances plus tard dans une longue session pour ces configurations.
Le même fichier rapporte un prefill de GPT-OSS 120B à 2 443.91 tokens/s pour un prompt de 2 048 tokens sans profondeur ajoutée. Un test séparé avec 32 séquences et 4 096 tokens d’entrée chacune a atteint 262.20 tokens/s de décodage agrégés. Il s’agit du débit de sortie combiné sur le batch.3
AMD rapporte un avantage Halo de 4 à 14 % dans ses tests de mai
AMD rapporte un débit de tokens plus élevé pour le Ryzen IA Halo que pour la DGX Spark sur quatre models : 14 % pour GLM 4.7 Flash-30B-A3B, 12 % pour Qwen 3.5-122B-A10B, 7 % pour GPT-OSS 120B et 4 % pour Qwen 3.6-35B-A3B. La note de bas de page décrit trois exécutions, un contexte de 100 tokens et le logiciel Spark disponible au 6 mai 2026.4
Il s’agit d’une comparaison constructeur utilisant un Halo de préproduction avec Ryzen IA Max+ 395 et 128 Go de mémoire. La page publique ne fournit pas les débits absolus ni suffisamment de détails sur la quantification et l’environnement d’exécution pour reproduire un test équivalent. Les pourcentages ne peuvent pas être appliqués aux scores llama.cpp de février pour calculer les tokens/s du Halo.4
Alternatives au DGX Spark
La Spark combine la puce GB10 de NVIDIA, 128 Go de mémoire unifiée cohérente et une bande passante mémoire de 273 Go/s. Elle vise le développement local d’IA à l’aide de la pile logicielle de NVIDIA. Ses limites annoncées de taille de model décrivent les scénarios pris en charge. L’adéquation réelle dépend également de la précision des poids, du contexte, des tampons d’exécution et de la mémoire du système d’exploitation.5
La disponibilité varie selon la région et la configuration.6478
1. Framework Desktop
Le configurateur actuel de Framework répertorie la configuration 128 Go avec Ryzen IA Max+ 395 à 3 449 $ avant stockage optionnel et autres sélections. Son option 32 Go utilise le Max 385. La mémoire n’est pas évolutive après l’achat.6
Le développeur lhl a testé GPT-OSS 120B sur le Framework Desktop en utilisant Vulkan et ROCm, deux chemins logiciels pour exécuter l’inference sur le GPU. La comparaison d’octobre avec les résultats publiés de la Spark utilisait différentes builds de llama.cpp et des tailles de micro-batch AMD ajustées. Ces paramètres limitent la mesure dans laquelle les résultats isolent la différence matérielle.9
2. AMD Ryzen IA Halo
Le Ryzen IA Halo associe Max+ 395, 128 Go de mémoire unifiée et le support ROCm en tant que plateforme développeur. La page actuelle d’AMD propose le produit à l’achat et à l’utilisation aux États-Unis. Sa comparaison de mai utilisait un prix de détail Halo de 3 999 $ et 4 699 $ pour la Spark. Il s’agit de données de prix datées, et non d’une comparaison de panier vérifiée en septembre.4
AMD liste également un Halo 192 Go à venir basé sur Ryzen IA Max+ PRO 495. Le benchmark de mai couvre la configuration 128 Go Max+ 395. Les performances de la version 192 Go annoncée restent non vérifiées dans cette comparaison.4
3. Apple Mac Studio
Apple a annoncé le Mac Studio M5 Max et M5 Ultra le 25 août 2026. Les prix de départ aux États-Unis sont de 2 499 $ et 5 499 $ respectivement. Les premières livraisons sont prévues pour le 22 septembre, tandis que la configuration 512 Go est prévue pour fin octobre. Il s’agit de prix de départ, pas de devis pour la mémoire maximale.7
Apple indique jusqu’à 128 Go pour le M5 Max et 512 Go pour le M5 Ultra, avec jusqu’à 1.2 To/s de bande passante mémoire sur l’Ultra. Ses propres affirmations d’accélération de l’IA comparent des systèmes et des charges de travail Apple sélectionnés. Elles n’établissent pas de comparaison avec la Spark. Aucun résultat reproductible M5 Studio contre Spark n’a été accepté dans le jeu de données de benchmarks de cet article.7
Les mesures existantes du M3 Ultra décrivent la génération précédente. Les comparaisons d’achat du M5 nécessitent des résultats pour le nouveau matériel et sa configuration mémoire spécifique.
4. ASUS Ascent GX10 et autres systèmes GB10
Les systèmes GB10 OEM offrent des alternatives au boîtier de NVIDIA tout en conservant la même plateforme de puce. StorageReview a comparé l’ASUS Ascent GX10 avec l’édition Founders de NVIDIA et des systèmes de Dell, Acer et GIGABYTE. Ses tests vLLM ont montré qu’ASUS était globalement proche des autres systèmes sur les models testés, tandis que ses tests thermiques ont examiné les différences entre les implémentations.8
Le refroidissement, le stockage, les conditions de support et le prix du système complet distinguent ces implémentations. Les résultats thermiques restent spécifiques au boîtier et à la charge testés.
5. Une station de travail RTX dédiée
L’étude LMSYS fournit des éléments pour envisager la RTX 5090 ou la RTX PRO 6000 Blackwell lorsque la charge de travail tient dans leur mémoire GPU. Les deux ont généré GPT-OSS 20B plus rapidement que la Spark lors du test historique.2 NVIDIA spécifie 32 Go de mémoire GDDR7 dédiée pour la RTX 5090.10
Un budget de station de travail doit inclure l’hôte, l’alimentation, le refroidissement et tout GPU supplémentaire. L’ajout de plusieurs cartes augmente la VRAM totale installée, mais l’exécution dépend toujours du partitionnement du model et du comportement de l’interconnexion. La bande passante par carte ne doit pas être présentée comme un chiffre unique de bande passante mémoire mutualisée.
L’LLM estimation de mémoire inclut les poids, le cache KV et la surcharge d’exécution. Le déchargement CPU modifie le chemin d’exécution lorsqu’une charge de travail dépasse la mémoire GPU.
Méthodologie des benchmarks
L’article utilise des mesures matérielles publiées provenant de trois sources. Chaque comparaison conserve le model et la charge de travail rapportés, avec les dates de test incluses lorsqu’elles sont fournies. Aucun nouveau test de matériel ou de qualité de model n’a été effectué pour cet article.
Le balayage Spark utilise des tests de génération de 32 tokens (tg32) et des tests de traitement de prompt de 2 048 tokens (pp2048). Les cinq profondeurs de contexte antérieur vont de zéro à 32 768 tokens. Le résultat sur 32 séquences provient du benchmark par lots séparé et mesure le débit de sortie combiné.3
La gestion simultanée des requêtes nécessite également des mesures de latence pour évaluer l’effet des requêtes supplémentaires. Le GPU benchmark de concurrence séparé couvre ce compromis sur les GPU de centre de données.
Limites des benchmarks
Le graphique d’ouverture utilise le tableur lié provenant de la revue d’octobre 2025 de LMSYS. Ses lignes Ollama omettent les longueurs de prompt/sortie et les versions d’exécution, de sorte qu’une comparaison entièrement contrôlée ne peut pas être établie. La feuille diffère du corps de la revue, et sa dernière date de mesure est inconnue. NVIDIA a fourni un accès anticipé à la Spark pour la revue.2
Les mesures Spark de février utilisent un environnement d’exécution et une date de test différents. Elles ne peuvent pas établir un ratio RTX contre Spark actualisé sans mesures homologues équivalentes. Les pourcentages de mai d’AMD sont fournis par le fabricant, avec des débits absolus et des quantifications exactes non divulgués. Les trois sources ne forment pas un classement contrôlé unique.
Aucune matrice de test complète de septembre 2026 couvrant la Spark, le matériel Apple actuel, le Halo et les RTX n’a satisfait aux exigences de comparaison dans les sources examinées. La parité de qualité des models, l’efficacité énergétique et le coût total de possession n’ont pas été mesurés dans cette recherche.
Sélection de matériel IA local
La RTX 5090 a généré GPT-OSS 20B environ 3.4 fois plus rapidement que la Spark dans le dataset LMSYS lié. La configuration à mémoire partagée de 128 Go de la Spark répond à une exigence de capacité différente des 32 Go de mémoire dédiée de la RTX 5090. L’adéquation du model et la compatibilité logicielle déterminent quel benchmark s’applique à un déploiement.
Framework et Halo offrent des alternatives AMD, tandis que le Mac Studio utilise la pile logicielle Apple pour GPU. Les systèmes GB10 OEM conservent la plateforme Spark avec des boîtiers et des modalités de support différents. Pour les charges de travail intermittentes, les options de location de GPU cloud ajoutent des coûts d’utilisation et de transfert à la comparaison local contre cloud.
Lectures complémentaires
- LLM calculateur de VRAM pour l’auto-hébergement
- GPU benchmark de concurrence : H100 vs H200 vs B200 vs MI300X
- Top 70+ fournisseurs cloud de GPU en 2026
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sarı, Ekrem},
title = {{Alternatives au DGX Spark: RTX, Ryzen IA Halo et Mac Studio}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/dgx-spark-alternatives}},
note = {AIMultiple. Consulté le 17 septembre 2026}
}Résultats et horodatages de 19 points de données. Téléchargez les données de synthèse présentées dans les graphiques et les tableaux de cet article sous forme de fichier ZIP contenant 4 fichiers CSV.
Vous voulez les données détaillées derrière ? Rejoindre Premium
Journal des modifications
3 mises à jourAjout d'une section sur l'AMD Ryzen AI Halo Mini-PC dans la comparaison des alternatives.
Suppression de la section Comparaison directe (modèle GPT-OSS 120B).
Liens de référence
Le travail de Cem chez AIMultiple a été cité par des publications mondiales de premier plan, notamment Business Insider, Forbes, Morning Brew et Washington Post, par des entreprises mondiales comme Deloitte et HPE, par des ONG comme World Economic Forum et par des organisations supranationales comme European Commission. [1], [2], [3], [4], [5]
Tout au long de sa carrière, Cem a été consultant en technologies, acheteur de technologies et entrepreneur technologique. Il a conseillé des entreprises sur leurs décisions technologiques chez McKinsey & Company et Altman Solon pendant plus de dix ans. Il a également publié un rapport McKinsey sur la digitalisation.
Il a dirigé la stratégie technologique et les achats d'un opérateur télécom, sous la responsabilité du PDG. Il a également dirigé la croissance commerciale de l'entreprise de technologie profonde Hypatos, qui a atteint un revenu récurrent annuel à 7 chiffres et une valorisation à 9 chiffres, passant de 0 à ce résultat en deux ans. Le travail de Cem chez Hypatos a été couvert par des publications technologiques de premier plan comme TechCrunch et Business Insider.
Cem intervient régulièrement lors de conférences technologiques internationales. Il est diplômé de Bogazici University en tant qu'ingénieur informatique et titulaire d'un MBA de la Columbia Business School.
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.