Wir vergleichen veröffentlichte Inference-Benchmarks für DGX Spark, RTX und Ryzen KI Halo, einschließlich Prompt-Verarbeitung, Token-Generierung und längeren Kontexten. Zu den Alternativen gehören Framework Desktop, Mac Studio und GB10-Systeme anderer Hersteller.
Die Decode-Geschwindigkeit misst die pro Sekunde generierten Output-Tokens. Höhere Werte bedeuten eine schnellere Antwortgenerierung. Alle sechs Ergebnisse verwenden GPT-OSS 20B MXFP4 in Ollama bei Batchgröße eins aus der Tabelle, die im DGX Spark-Review von LMSYS verlinkt ist.1
Die Prefill-Geschwindigkeit misst die pro Sekunde verarbeiteten Input-Tokens vor der Antwortgenerierung. Sie beeinflusst, wie schnell ein Model einen Prompt verarbeitet, während die Decode-Geschwindigkeit die anschließende Ausgabephase misst.
DGX Spark Inference-Benchmarks
RTX 5090 generierte Tokens 3.4-mal schneller als Spark
RTX 5090 erreichte in der LMSYS-Tabelle 205.5 Tokens/s, verglichen mit 60.9 auf dem DGX Spark. RTX PRO 6000 Blackwell erreichte 215.2 Tokens/s und RTX 5080 erreichte 140.9. Spark übertraf die beiden Apple-Konfigurationen im selben Dataset, die 52.7 Tokens/s auf dem Mac Studio M1 Max und 46.9 auf dem Mac mini M4 Pro verzeichneten.1
Die Tabelle wurde am 17. September 2026 abgerufen. Sie enthält keine Testtermine, Prompt-Längen oder genauen Ollama-Versionen für diese Zeilen. Der Review-Text meldet einen Spark-Wert von 49.7 Tokens/s, während die verlinkte Tabelle 60.906 meldet. Alle sechs Balken verwenden die Tabelle, um die Quelle konsistent zu halten. Diese Ergebnisse decken M3 Ultra oder die angekündigten M5 Studio-Models nicht ab.2
GPT-OSS 120B Decode fiel bei 32.768 Tokens vorherigen Kontexts um 27 %
DGX Spark erreichte mit GPT-OSS 120B MXFP4 bei null zusätzlicher Kontexttiefe in den llama.cpp-Ergebnissen vom Februar 2026 58.72 Tokens/s. Bei 32.768 Tokens vorherigem Kontext sank der Durchsatz auf 42.76 Tokens/s, ein Rückgang von 27 %. GPT-OSS 20B fiel im selben Bereich von 83.43 auf 61.65 Tokens/s.3
Der vorherige Kontext ist die Anzahl der Tokens, die bereits im Testkontext gehalten werden. Beide Models erzeugten bei zunehmender Tiefe langsamer Output, sodass die Kurzkontext-Rate die Leistung später in einer langen Sitzung für diese Konfigurationen überschätzt.
Dieselbe Datei meldet für GPT-OSS 120B ein Prefill von 2.443.91 Tokens/s für einen Prompt mit 2.048 Tokens ohne zusätzliche Tiefe. Ein separater Test mit 32 Sequenzen und jeweils 4.096 Input-Tokens erreichte 262.20 aggregierte Decode-Tokens/s. Dies ist die kombinierte Output-Rate über den Batch hinweg.3
AMD meldet in seinen Mai-Tests einen Halo-Vorteil von 4–14 %
AMD meldet für Ryzen KI Halo einen höheren Token-Durchsatz als für DGX Spark bei vier Models: 14 % für GLM 4.7 Flash-30B-A3B, 12 % für Qwen 3.5-122B-A10B, 7 % für GPT-OSS 120B und 4 % für Qwen 3.6-35B-A3B. Die Fußnote beschreibt drei Durchläufe, einen 100-Token-Kontext und die ab dem 6. Mai 2026 verfügbare Spark-Software.4
Dies ist ein Herstellervergleich mit einem Vorproduktions-Halo mit Ryzen KI Max+ 395 und 128 GB Arbeitsspeicher. Die öffentliche Seite liefert keine absoluten Raten und nicht genügend Details zu Quantisierung und Laufzeit, um einen gleichwertigen Test zu reproduzieren. Die Prozentwerte können nicht auf die llama.cpp-Werte vom Februar angewendet werden, um Halo-Tokens/s zu berechnen.4
DGX Spark Alternativen
Spark kombiniert den GB10-Chip von NVIDIA, 128 GB kohärenten Unified Memory und 273 GB/s Speicherbandbreite. Er zielt auf lokale KI-Entwicklung mit dem Software-Stack von NVIDIA ab. Die angegebenen Größenlimits für Models beschreiben unterstützte Szenarien. Die tatsächliche Eignung hängt auch von Gewichtspräzision, Kontext, Laufzeitpuffern und Betriebssystem-Speicher ab.5
Die Verfügbarkeit variiert je nach Region und Konfiguration.6478
1. Framework Desktop
Der aktuelle Konfigurator von Framework listet die 128-GB-Konfiguration mit Ryzen KI Max+ 395 für $3,449 vor optionalem Speicher und weiteren Optionen. Die 32-GB-Option verwendet Max 385. Der Arbeitsspeicher kann nach dem Kauf nicht aufgerüstet werden.6
Entwickler lhl testete GPT-OSS 120B auf dem Framework Desktop mit Vulkan und ROCm, zwei Software-Pfaden für die Ausführung von Inference auf der GPU. Der Oktobervergleich mit veröffentlichten Spark-Ergebnissen verwendete unterschiedliche llama.cpp-Builds und abgestimmte AMD-Microbatch-Größen. Diese Einstellungen schränken ein, wie genau die Ergebnisse den Hardware-Unterschied isolieren.9
2. AMD Ryzen KI Halo
Ryzen KI Halo bündelt Max+ 395, 128 GB Unified Memory und ROCm-Unterstützung als Entwicklerplattform. Die aktuelle Seite von AMD bietet das Produkt zum Kauf und zur Nutzung in den Vereinigten Staaten an. Der Mai-Vergleich verwendete einen Halo-Verkaufspreis von $3,999 und $4,699 für Spark. Dabei handelt es sich um veraltete Preisangaben und nicht um einen verifizierten Preisvergleich im September.4
AMD listet außerdem ein kommendes Halo mit 192 GB auf Basis von Ryzen KI Max+ PRO 495. Der Mai-Benchmark betrifft die 128-GB-Konfiguration mit Max+ 395. Die Leistung der angekündigten 192-GB-Version bleibt in diesem Vergleich unbestätigt.4
3. Apple Mac Studio
Apple kündigte Mac Studio mit M5 Max und M5 Ultra am 25. August 2026 an. Die US-Startpreise betragen $2,499 bzw. $5.499. Die ersten Auslieferungen sind für den 22. September geplant, während die 512-GB-Konfiguration für Ende Oktober geplant ist. Dies sind Startpreise und keine Angebote für maximale Speicherausstattung.7
Apple gibt bis zu 128 GB für M5 Max und 512 GB für M5 Ultra an, mit bis zu 1.2 TB/s Speicherbandbreite bei Ultra. Die eigenen KI-Beschleunigungsangaben vergleichen ausgewählte Apple-Systeme und Workloads. Sie stellen keinen Spark-Vergleich her. Kein reproduzierbares Ergebnis für M5 Studio gegen Spark wurde in das Benchmark-Dataset dieses Artikels aufgenommen.7
Bestehende M3-Ultra-Messungen beschreiben die vorherige Generation. M5-Kaufvergleiche erfordern Ergebnisse für die neue Hardware und ihre spezifische Speicherkonfiguration.
4. ASUS Ascent GX10 und andere GB10-Systeme
GB10-OEM-Systeme bieten Alternativen zum Gehäuse von NVIDIA, während sie dieselbe Chip-Plattform beibehalten. StorageReview verglich ASUS Ascent GX10 mit der Founders Edition von NVIDIA und Systemen von Dell, Acer und GIGABYTE. Die vLLM-Tests ergaben, dass ASUS bei den getesteten Models weitgehend nahe an den anderen Systemen liegt, während die thermischen Tests Unterschiede zwischen den Implementierungen untersuchten.8
Kühlung, Speicher, Support-Bedingungen und der Komplettsystempreis unterscheiden diese Implementierungen. Die thermischen Ergebnisse bleiben spezifisch für das getestete Gehäuse und die getestete Last.
5. Eine diskrete RTX-Workstation
Die LMSYS-Studie liefert Anhaltspunkte dafür, RTX 5090 oder RTX PRO 6000 Blackwell in Betracht zu ziehen, wenn die Workload in ihren GPU-Speicher passt. Beide erzeugten GPT-OSS 20B im historischen Test schneller als Spark.2 NVIDIA gibt für die RTX 5090 32 GB dedizierten GDDR7-Speicher an.10
Ein Workstation-Budget muss Host, Netzteil, Kühlung und jede zusätzliche GPU umfassen. Das Hinzufügen mehrerer Karten erhöht den insgesamt installierten VRAM, aber die Ausführung hängt weiterhin von der Model-Partitionierung und dem Interconnect-Verhalten ab. Die Bandbreite pro Karte sollte nicht als eine einzige gebündelte Speicherbandbreite angegeben werden.
Die LLM-Speicherschätzung umfasst Gewichte, KV-Cache und Laufzeit-Overhead. CPU-Offload ändert den Ausführungspfad, wenn eine Workload den GPU-Speicher überschreitet.
Benchmark-Methodik
Der Artikel verwendet veröffentlichte Hardware-Messungen aus drei Quellen. Jeder Vergleich behält das angegebene Model und die Workload bei, einschließlich der Testtermine, sofern angegeben. Für diesen Artikel wurden keine neuen Hardware- oder Model-Qualitätstests durchgeführt.
Der Spark-Durchlauf verwendet 32-Token-Generierungstests (tg32) und 2.048-Token-Prompt-Verarbeitungstests (pp2048). Die fünf Tiefen des vorherigen Kontexts reichen von null bis 32.768 Tokens. Das 32-Sequenz-Ergebnis stammt aus dem separaten Batch-Benchmark und misst den kombinierten Output-Durchsatz.
Zitieren Sie diesen Benchmark
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sarı, Ekrem},
title = {{DGX Spark Alternativen: RTX, Ryzen KI Halo und Mac Studio}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/dgx-spark-alternatives}},
note = {AIMultiple. Abgerufen am 17. September 2026}
}Ergebnisse und Zeitstempel von 19 Datenpunkten. Laden Sie die Zusammenfassungsdaten aus den Diagrammen und Tabellen dieses Artikels als ZIP-Datei herunter, die 4 CSV-Dateien enthält.
Möchten Sie die granularen Daten dahinter? Premium beitreten
Änderungsprotokoll
3 AktualisierungenEin Abschnitt zum AMD Ryzen AI Halo Mini-PC wurde im Alternativenvergleich hinzugefügt.
Der Abschnitt „Kopf-an-Kopf-Vergleich (GPT-OSS 120B Modell)“ wurde entfernt.
Referenzlinks
Cems Arbeit bei AIMultiple wurde von führenden globalen Publikationen wie Business Insider, Forbes, Morning Brew und Washington Post, von globalen Unternehmen wie Deloitte und HPE, von NGOs wie dem World Economic Forum und von supranationalen Organisationen wie der European Commission zitiert. [1], [2], [3], [4], [5]
Im Laufe seiner Karriere war Cem als Tech-Berater, Tech-Einkäufer und Tech-Unternehmer tätig. Er beriet Unternehmen bei ihren Technologieentscheidungen bei McKinsey & Company und Altman Solon über mehr als ein Jahrzehnt. Er veröffentlichte außerdem einen McKinsey-Bericht zur Digitalisierung.
Er leitete Technologiestrategie und -beschaffung eines Telekommunikationsunternehmens und berichtete dabei direkt an den CEO. Außerdem verantwortete er das kommerzielle Wachstum des Deep-Tech-Unternehmens Hypatos, das innerhalb von zwei Jahren von 0 einen siebenstelligen jährlich wiederkehrenden Umsatz und eine neunstellige Bewertung erreichte. Cems Arbeit bei Hypatos wurde von führenden Technologiepublikationen wie TechCrunch und Business Insider aufgegriffen.
Cem spricht regelmäßig auf internationalen Technologiekonferenzen. Er absolvierte die Bogazici University als Computeringenieur und hat einen MBA von der Columbia Business School.
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.