Premium
Servizi
Premium

Alternative a DGX Spark: RTX, Ryzen IA Halo e Mac Studio

Cem Dilmegani
Cem Dilmegani
aggiornato il 17 set. 2026

Confrontiamo i benchmark di inferenza pubblicati di DGX Spark, RTX e Ryzen IA Halo, coprendo l'elaborazione dei prompt, la generazione di token e i contesti più lunghi. Le alternative includono Framework Desktop, Mac Studio e i sistemi GB10 di altri produttori.

Caricamento del grafico

La velocità di decodifica misura i token in output generati al secondo. Valori più alti indicano una generazione della risposta più rapida. Tutti e sei i risultati utilizzano GPT-OSS 20B MXFP4 in Ollama con batch singolo, dal foglio di calcolo collegato nella recensione del DGX Spark di LMSYS.1

La velocità di prefill misura i token di input elaborati al secondo prima della generazione della risposta. Influisce sulla rapidità con cui un modello elabora un prompt, mentre la decodifica misura la successiva fase di output.

Benchmark di inferenza di DGX Spark

RTX 5090 ha generato token 3.4 volte più velocemente di Spark

RTX 5090 ha generato 205.5 token/s, rispetto a 60.9 su DGX Spark, nel foglio di calcolo LMSYS. RTX PRO 6000 Blackwell ha raggiunto 215.2 token/s e RTX 5080 ha raggiunto 140.9. Spark ha superato le due configurazioni Apple nello stesso dataset, che hanno registrato 52.7 token/s su Mac Studio M1 Max e 46.9 su Mac mini M4 Pro.1

Il foglio di calcolo è stato recuperato il 17 settembre 2026. Non fornisce date dei test, lunghezze dei prompt o versioni esatte di Ollama per queste righe. Il corpo della recensione riporta un valore di Spark di 49.7 token/s, mentre il foglio collegato riporta 60.906. Tutte e sei le barre utilizzano il foglio per mantenere coerente la fonte. Questi risultati non coprono M3 Ultra né i modelli M5 Studio annunciati.2

La decodifica di GPT-OSS 120B è diminuita del 27% a 32.768 token di contesto precedente

DGX Spark ha generato 58.72 token/s con GPT-OSS 120B MXFP4 a profondità di contesto aggiunta pari a zero nei risultati di llama.cpp di febbraio 2026. A 32.768 token di contesto precedente, il throughput è sceso a 42.76 token/s, un calo del 27%. GPT-OSS 20B è sceso da 83.43 a 61.65 token/s nello stesso intervallo.3

Il contesto precedente è il numero di token già presenti nel contesto del test. Entrambi i modelli hanno generato output più lentamente all'aumentare di tale profondità, quindi la velocità in contesti brevi sovrastima le prestazioni nelle fasi avanzate di una sessione lunga per queste configurazioni.

Lo stesso file riporta un prefill di GPT-OSS 120B a 2.443.91 token/s per un prompt da 2.048 token senza profondità aggiunta. Un test separato con 32 sequenze e 4.096 token di input ciascuna ha raggiunto 262.20 token/s di decodifica aggregata. Questa è la velocità di output combinata nell'intero batch.3

AMD segnala un vantaggio di Halo del 4–14% nei suoi test di maggio

AMD segnala un throughput di token superiore per Ryzen IA Halo rispetto a DGX Spark su quattro modelli: 14% per GLM 4.7 Flash-30B-A3B, 12% per Qwen 3.5-122B-A10B, 7% per GPT-OSS 120B e 4% per Qwen 3.6-35B-A3B. La nota descrive tre esecuzioni, un contesto da 100 token e il software Spark disponibile al 6 maggio 2026.4

Si tratta di un confronto del produttore che utilizza un Halo pre-produzione con Ryzen IA Max+ 395 e 128 GB di memoria. La pagina pubblica non fornisce i tassi assoluti né dettagli sufficienti su quantizzazione e runtime per riprodurre un test equivalente. Le percentuali non possono essere applicate ai punteggi di llama.cpp di febbraio per calcolare i token/s di Halo.4

Alternative a DGX Spark

Spark combina il chip GB10 di NVIDIA, 128 GB di memoria unificata coerente e una larghezza di banda della memoria di 273 GB/s. È destinato allo sviluppo locale di IA utilizzando lo stack software di NVIDIA. I limiti dichiarati sulle dimensioni dei modelli descrivono gli scenari supportati. L'adattamento effettivo dipende anche dalla precisione dei pesi, dal contesto, dai buffer di runtime e dalla memoria del sistema operativo.5

La disponibilità varia in base a regione e configurazione.6478

1. Framework Desktop

Il configuratore attuale di Framework elenca la configurazione da 128 GB con Ryzen IA Max+ 395 a $3,449 prima di storage opzionale e altre selezioni. La sua opzione da 32 GB utilizza Max 385. La memoria non è aggiornabile dopo l'acquisto.6

Lo sviluppatore lhl ha testato GPT-OSS 120B su Framework Desktop utilizzando Vulkan e ROCm, due percorsi software per eseguire l'inferenza sulla GPU. Il confronto di ottobre con i risultati pubblicati di Spark ha utilizzato build diverse di llama.cpp e dimensioni dei microbatch AMD ottimizzate. Queste impostazioni limitano quanto i risultati isolino la differenza hardware.9

2. AMD Ryzen IA Halo

Ryzen IA Halo racchiude Max+ 395, 128 GB di memoria unificata e supporto ROCm come piattaforma per sviluppatori. La pagina attuale di AMD offre il prodotto per l'acquisto e l'uso negli Stati Uniti. Il suo confronto di maggio ha utilizzato un prezzo al dettaglio di $3,999 per Halo e di $4,699 per Spark. Si tratta di dati di prezzo datati, non di un confronto verificato al checkout di settembre.4

AMD elenca anche un Halo in arrivo da 192 GB basato su Ryzen IA Max+ PRO 495. Il benchmark di maggio riguarda la configurazione Max+ 395 da 128 GB. Le prestazioni della versione annunciata da 192 GB restano non verificate in questo confronto.4

3. Apple Mac Studio

Apple ha annunciato Mac Studio con M5 Max e M5 Ultra il 25 agosto 2026. I prezzi di partenza negli Stati Uniti sono rispettivamente $2,499 e $5.499. Le prime consegne sono previste per il 22 settembre, mentre la configurazione da 512 GB è prevista per fine ottobre. Si tratta di prezzi di partenza, non di quotazioni per la memoria massima.7

Apple specifica fino a 128 GB per M5 Max e 512 GB per M5 Ultra, con una larghezza di banda della memoria fino a 1.2 TB/s su Ultra. Le sue affermazioni sull'accelerazione dell'IA confrontano sistemi e carichi di lavoro Apple selezionati. Non stabiliscono un confronto con Spark. Nessun risultato riproducibile M5 Studio contro Spark è stato accettato nel dataset di benchmark di questo articolo.7

Le misurazioni esistenti di M3 Ultra descrivono la generazione precedente. I confronti di acquisto con M5 richiedono risultati per il nuovo hardware e la sua specifica configurazione di memoria.

4. ASUS Ascent GX10 e altri sistemi GB10

I sistemi OEM GB10 offrono alternative all'involucro di NVIDIA mantenendo la stessa piattaforma chip. StorageReview ha confrontato ASUS Ascent GX10 con la Founders Edition di NVIDIA e sistemi di Dell, Acer e GIGABYTE. I suoi test vLLM hanno rilevato che ASUS è generalmente vicino agli altri sistemi nei modelli testati, mentre i test termici hanno esaminato le differenze tra le implementazioni.8

Il raffreddamento, lo storage, i termini di supporto e il prezzo del sistema completo distinguono queste implementazioni. I risultati termici restano specifici per l'involucro e il carico testati.

5. Una workstation RTX discreta

Lo studio LMSYS fornisce elementi per considerare RTX 5090 o RTX PRO 6000 Blackwell quando il carico di lavoro rientra nella memoria della GPU. Entrambe hanno generato GPT-OSS 20B più velocemente di Spark nel test storico.2 NVIDIA specifica 32 GB di memoria GDDR7 dedicata per RTX 5090.10

Il budget di una workstation deve includere l'host, l'alimentatore, il raffreddamento e qualsiasi GPU aggiuntiva. L'aggiunta di più schede aumenta la VRAM totale installata, ma l'esecuzione dipende ancora dal partizionamento dei modelli e dal comportamento dell'interconnessione. La larghezza di banda per singola scheda non deve essere presentata come un'unica cifra di larghezza di banda della memoria aggregata.

La stima della memoria per LLM include pesi, cache KV e overhead di runtime. L'offload su CPU modifica il percorso di esecuzione quando un carico di lavoro supera la memoria della GPU.

Metodologia dei benchmark

L'articolo utilizza misurazioni hardware pubblicate provenienti da tre fonti. Ogni confronto mantiene il modello e il carico di lavoro riportati, con le date dei test incluse dove fornite. Nessun nuovo test hardware o sulla qualità dei modelli è stato condotto per questo articolo.

Lo sweep di Spark utilizza test di generazione da 32 token (tg32) e test di elaborazione di prompt da 2.048 token (pp2048). Le cinque profondità di contesto precedente vanno da zero a 32.768 token. Il risultato con 32 sequenze proviene dal benchmark batch separato e misura il throughput di output combinato.3

La gestione concorrente delle richieste richiede anche misurazioni della latenza per valutare l'effetto di richieste aggiuntive. Il GPU benchmark di concorrenza separato copre questo compromesso sulle GPU dei data center.

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Limitazioni dei benchmark

Il grafico iniziale utilizza il foglio di calcolo collegato dalla recensione di LMSYS di ottobre 2025. Le sue righe Ollama omettono lunghezze di prompt/output e versioni di runtime, quindi non è possibile stabilire un confronto completamente controllato. Il foglio differisce dal corpo della recensione e la data dell'ultima misurazione è sconosciuta. NVIDIA ha fornito accesso anticipato a Spark per la recensione.2

Le misurazioni di Spark di febbraio utilizzano un runtime e una data di test diversi. Non possono stabilire un rapporto RTX contro Spark aggiornato senza misurazioni equivalenti tra pari. Le percentuali di maggio di AMD sono dichiarate dal fornitore, con tassi assoluti e quantizzazioni esatte non divulgati. Le tre fonti non formano una singola classifica controllata.

Nessuna matrice di test completa di settembre 2026 che coprisse Spark, l'hardware Apple attuale, Halo e RTX ha soddisfatto i requisiti di confronto nelle fonti esaminate. La parità di qualità dei modelli, l'efficienza energetica e il costo totale di proprietà non sono stati misurati in questa ricerca.

Selezione dell'hardware locale per l'IA

RTX 5090 ha generato GPT-OSS 20B circa 3.4 volte più velocemente di Spark nel dataset LMSYS collegato. La configurazione con memoria condivisa da 128 GB di Spark supporta un requisito di capacità diverso rispetto ai 32 GB di memoria dedicata di RTX 5090. L'adattamento dei modelli e la compatibilità software determinano quale benchmark si applica a una distribuzione.

Framework e Halo offrono alternative AMD, mentre Mac Studio utilizza il software stack Apple GPU. I sistemi OEM GB10 mantengono la piattaforma Spark con involucri e accordi di supporto diversi. Per carichi di lavoro intermittenti, le cloud GPU opzioni di noleggio aggiungono costi di utilizzo e trasferimento al confronto locale rispetto al cloud.

Non perderti i nostri benchmark e approfondimenti basati sui dati. Il pulsante apre Google; selezionare AIMultiple conferma che desideri vedere AIMultiple più spesso nei risultati di ricerca di Google.
GoogleAggiungi come fonte preferita

Ulteriori letture

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Cem Dilmegani and Ekrem Sarı (2026) - "Alternative a DGX Spark: RTX, Ryzen IA Halo e Mac Studio". Pubblicato online su AIMultiple.com. Consultato il 17 settembre 2026, da: https://aimultiple.com/dgx-spark-alternatives [Risorsa online]

Dilmegani, C., & Sarı, E. (2026, 17 settembre). Alternative a DGX Spark: RTX, Ryzen IA Halo e Mac Studio. AIMultiple. https://aimultiple.com/dgx-spark-alternatives

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Sarı, Ekrem},
  title  = {{Alternative a DGX Spark: RTX, Ryzen IA Halo e Mac Studio}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/dgx-spark-alternatives}},
  note   = {AIMultiple. Consultato il 17 settembre 2026}
}
Scarica tutti i dati

Risultati e timestamp di 19 punti dati. Scarica i dati di sintesi mostrati nei grafici e nelle tabelle di questo articolo come file ZIP contenente 4 file CSV.

Ultimo aggiornamento: 26 settembre 2026
Scarica

Vuoi i dati granulari che ci stanno dietro? Passa a Premium

Registro delle modifiche

3 aggiornamenti
  1. Aggiunta una sezione sull'AMD Ryzen AI Halo Mini-PC nel confronto delle alternative.

  2. Rimossa la sezione Confronto diretto (modello GPT-OSS 120B).

Cem Dilmegani
Cem Dilmegani
Analista principale
Cem è analista principale presso AIMultiple dal 2017.

Il lavoro di Cem presso AIMultiple è stato citato da importanti testate internazionali tra cui Business Insider, Forbes, Morning Brew e Washington Post, da aziende globali come Deloitte e HPE, da ONG come il World Economic Forum e da organizzazioni sovranazionali come la Commissione europea. [1], [2], [3], [4], [5]

Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente tecnologico e imprenditore tecnologico. Ha consigliato le aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per più di un decennio. Ha inoltre pubblicato un report McKinsey sulla digitalizzazione.

Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha inoltre guidato la crescita commerciale dell'azienda deep tech Hypatos, che ha raggiunto ricavi ricorrenti annuali a 7 cifre e una valutazione a 9 cifre partendo da zero in 2 anni. Il lavoro di Cem in Hypatos è stato ripreso da importanti testate tecnologiche come TechCrunch e Business Insider.

Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato come ingegnere informatico presso l'Università di Bogazici e possiede un MBA della Columbia Business School.
Visualizza il profilo completo
Revisionato tecnicamente da
Ekrem Sarı
Ekrem Sarı
Ricercatore IA
Ekrem è un Ricercatore IA e Data Scientist presso AIMultiple. Progetta ed esegue benchmark pratici per sistemi di IA e LLM.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450