Comparamos benchmarks de inference publicados do DGX Spark, RTX e Ryzen IA Halo, cobrindo processamento de prompt, geração de tokens e contextos mais longos. As alternativas incluem Framework Desktop, Mac Studio e sistemas GB10 de outros fabricantes.
A velocidade de decodificação mede os tokens de saída gerados por segundo. Valores mais altos significam geração de resposta mais rápida. Todos os seis resultados usam GPT-OSS 20B MXFP4 no Ollama em lote um, da planilha vinculada pela análise do DGX Spark do LMSYS.1
A velocidade de pré-preenchimento mede os tokens de entrada processados por segundo antes da geração da resposta. Ela afeta a rapidez com que um model processa um prompt, enquanto a decodificação mede a fase de saída subsequente.
Benchmarks de inference do DGX Spark
RTX 5090 gerou tokens 3.4 vezes mais rápido que o Spark
A RTX 5090 gerou 205.5 tokens/s, em comparação com 60.9 no DGX Spark, na planilha do LMSYS. A RTX PRO 6000 Blackwell atingiu 215.2 tokens/s e a RTX 5080 atingiu 140.9. O Spark superou as duas configurações Apple no mesmo dataset, que registraram 52.7 tokens/s no Mac Studio M1 Max e 46.9 no Mac mini M4 Pro.1
A planilha foi recuperada em 17 de setembro de 2026. Ela não fornece datas de teste, comprimentos de prompt ou versões exatas do Ollama para essas linhas. O corpo da análise relata um valor do Spark de 49.7 tokens/s, enquanto a planilha vinculada relata 60.906. Todas as seis barras usam a planilha para manter a fonte consistente. Esses resultados não cobrem o M3 Ultra nem os modelos M5 Studio anunciados.2
A decodificação do GPT-OSS 120B caiu 27% com 32.768 tokens de contexto anterior
O DGX Spark gerou 58.72 tokens/s com GPT-OSS 120B MXFP4 em profundidade de contexto adicionada zero nos resultados do llama.cpp de fevereiro de 2026. Com 32.768 tokens de contexto anterior, a vazão caiu para 42.76 tokens/s, uma queda de 27%. O GPT-OSS 20B caiu de 83.43 para 61.65 tokens/s na mesma faixa.3
O contexto anterior é o número de tokens já mantidos no contexto do teste. Ambos os models geraram saída mais lentamente à medida que essa profundidade aumentou, portanto a taxa de contexto curto superestima o desempenho posterior em uma sessão longa para essas configurações.
O mesmo arquivo relata o pré-preenchimento do GPT-OSS 120B a 2.443.91 tokens/s para um prompt de 2.048 tokens sem profundidade adicionada. Um teste separado com 32 sequências e 4.096 tokens de entrada cada atingiu 262.20 tokens/s agregados de decodificação. Essa é a taxa de saída combinada ao longo do lote.3
AMD relata uma vantagem do Halo de 4–14% em seus testes de maio
AMD relata maior vazão de tokens para o Ryzen IA Halo do que para o DGX Spark em quatro models: 14% para GLM 4.7 Flash-30B-A3B, 12% para Qwen 3.5-122B-A10B, 7% para GPT-OSS 120B e 4% para Qwen 3.6-35B-A3B. A nota de rodapé descreve três execuções, um contexto de 100 tokens e o software do Spark disponível em 6 de maio de 2026.4
Esta é uma comparação do fabricante usando um Halo de pré-produção com Ryzen IA Max+ 395 e 128 GB de memória. A página pública não fornece as taxas absolutas nem detalhes suficientes de quantização e ambiente de execução para reproduzir um teste equivalente. As porcentagens não podem ser aplicadas às pontuações do llama.cpp de fevereiro para calcular os tokens/s do Halo.4
Alternativas ao DGX Spark
O Spark combina o chip GB10 da NVIDIA, 128 GB de memória unificada coerente e 273 GB/s de largura de banda de memória. Ele é voltado para o desenvolvimento local de IA usando a pilha de software da NVIDIA. Seus limites anunciados de tamanho de model descrevem cenários suportados. O ajuste real também depende da precisão dos pesos, do contexto, dos buffers do ambiente de execução e da memória do sistema operacional.5
A disponibilidade varia por região e configuração.6478
1. Framework Desktop
O configurador atual da Framework lista a configuração de 128 GB com Ryzen IA Max+ 395 por US$ 3.449 antes de armazenamento opcional e outras seleções. Sua opção de 32 GB usa o Max 385. A memória não pode ser atualizada após a compra.6
O desenvolvedor lhl testou o GPT-OSS 120B no Framework Desktop usando Vulkan e ROCm, dois caminhos de software para executar inference na GPU. A comparação de outubro com os resultados publicados do Spark usou builds diferentes do llama.cpp e tamanhos de microlote ajustados da AMD. Essas configurações limitam o quão de perto os resultados isolam a diferença de hardware.9
2. AMD Ryzen IA Halo
O Ryzen IA Halo empacota o Max+ 395, 128 GB de memória unificada e suporte a ROCm como plataforma de desenvolvedor. A página atual da AMD oferece o produto para compra e uso nos Estados Unidos. Sua comparação de maio usou um preço de varejo do Halo de US$ 3.999 e US$ 4.699 para o Spark. Esses são dados de preço datados, não uma comparação verificada de checkout de setembro.4
AMD também lista um Halo de 192 GB que está por vir baseado no Ryzen IA Max+ PRO 495. O benchmark de maio cobre a configuração Max+ 395 de 128 GB. O desempenho da versão anunciada de 192 GB permanece não verificado nesta comparação.4
3. Apple Mac Studio
Apple anunciou o Mac Studio com M5 Max e M5 Ultra em 25 de agosto de 2026. Os preços iniciais nos EUA são US$ 2.499 e US$ 5.499, respectivamente. As primeiras entregas estão programadas para 22 de setembro, enquanto a configuração de 512 GB está programada para o final de outubro. Esses são preços iniciais, não cotações para memória máxima.7
Apple especifica até 128 GB para o M5 Max e 512 GB para o M5 Ultra, com até 1.2 TB/s de largura de banda de memória no Ultra. Suas próprias alegações de aceleração de IA comparam sistemas e cargas de trabalho selecionados da Apple. Elas não estabelecem uma comparação com o Spark. Nenhum resultado reproduzível de M5 Studio versus Spark foi aceito no dataset de benchmarks deste artigo.7
As medições existentes do M3 Ultra descrevem a geração anterior. As comparações de compra do M5 exigem resultados para o novo hardware e sua configuração específica de memória.
4. ASUS Ascent GX10 e outros sistemas GB10
Os sistemas GB10 OEM oferecem alternativas ao gabinete da NVIDIA, mantendo a mesma plataforma de chip. O StorageReview comparou o ASUS Ascent GX10 com a Founders Edition da NVIDIA e sistemas da Dell, Acer e GIGABYTE. Seus testes com vLLM consideraram a ASUS amplamente próxima dos outros sistemas nos models testados, enquanto seus testes térmicos examinaram diferenças entre as implementações.8
Refrigeração, armazenamento, termos de suporte e preço do sistema completo distinguem essas implementações. Os resultados térmicos permanecem específicos para o gabinete e a carga testados.
5. Uma workstation RTX discreta
O estudo do LMSYS fornece evidências para considerar a RTX 5090 ou a RTX PRO 6000 Blackwell quando a carga de trabalho cabe na memória da GPU. Ambas geraram GPT-OSS 20B mais rápido que o Spark no teste histórico.2 NVIDIA especifica 32 GB de memória GDDR7 dedicada para a RTX 5090.10
Um orçamento de workstation deve incluir o host, a fonte de alimentação, a refrigeração e qualquer GPU adicional. Adicionar várias placas aumenta a VRAM total instalada, mas a execução ainda depende do particionamento de model e do comportamento da interconexão. A largura de banda por placa não deve ser apresentada como um único valor agregado de largura de banda de memória.
A LLM estimativa de memória inclui pesos, cache KV e overhead do ambiente de execução. O offload de CPU altera o caminho de execução quando uma carga de trabalho excede a memória da GPU.
Metodologia de benchmark
O artigo usa medições de hardware publicadas de três fontes. Cada comparação mantém o model e a carga de trabalho relatados, com datas de teste incluídas quando fornecidas. Nenhum teste novo de hardware ou de qualidade de model foi conduzido para este artigo.
A varredura do Spark usa testes de geração de 32 tokens (tg32) e testes de processamento de prompt de 2.048 tokens (pp2048). As cinco profundidades de contexto anterior vão de zero a 32.768 tokens. O resultado de 32 sequências vem do benchmark em lote separado e mede a vazão de saída combinada.2
As medições do Spark de fevereiro usam um ambiente de execução e uma data de teste diferentes. Elas não podem estabelecer uma relação RTX versus Spark atualizada sem medições equivalentes de pares. As porcentagens de maio da AMD são relatadas pelo fornecedor, com taxas absolutas e quantizações exatas não divulgadas. As três fontes não formam uma única classificação controlada.
Nenhuma matriz de testes completa de setembro de 2026 cobrindo Spark, hardware atual da Apple, Halo e RTX atendeu aos requisitos de comparação nas fontes revisadas. A paridade de qualidade de model, a eficiência energética e o custo total de propriedade não foram medidos nesta pesquisa.
Seleção de hardware local para IA
A RTX 5090 gerou GPT-OSS 20B cerca de 3.4 vezes mais rápido que o Spark no dataset vinculado do LMSYS. A configuração de memória compartilhada de 128 GB do Spark suporta um requisito de capacidade diferente dos 32 GB de memória dedicada da RTX 5090. O ajuste do model e a compatibilidade de software determinam qual benchmark se aplica a uma implantação.
Framework e Halo oferecem alternativas da AMD, enquanto o Mac Studio usa a pilha de software de GPU da Apple. Os sistemas GB10 OEM mantêm a plataforma Spark com gabinetes e arranjos de suporte diferentes. Para cargas de trabalho intermitentes, as opções de aluguel de GPU na nuvem adicionam custos de utilização e transferência à comparação local versus nuvem.
Leitura adicional
- Calculadora de VRAM de LLM para self-hosting
- Benchmark de Concorrência de GPU: H100 vs H200 vs B200 vs MI300X
- Principais 70+ provedores de GPU na nuvem em 2026
Cite este benchmark
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sarı, Ekrem},
title = {{Alternativas ao DGX Spark: RTX, Ryzen IA Halo e Mac Studio}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/dgx-spark-alternatives}},
note = {AIMultiple. Acessado em 17 setembro 2026}
}Resultados e carimbos de data/hora de 19 pontos de dados. Baixe os dados resumidos exibidos nos gráficos e tabelas deste artigo como um arquivo ZIP contendo 4 arquivos CSV.
Quer os dados granulares por trás disso? Assine o Premium
Registro de alterações
3 atualizaçõesAdicionada uma seção sobre o AMD Ryzen AI Halo Mini-PC na comparação de alternativas.
Removida a seção Comparação Direta (Modelo GPT-OSS 120B).
Links de referência
O trabalho de Cem na AIMultiple foi citado por publicações globais líderes, incluindo Business Insider, Forbes, Morning Brew e Washington Post, por empresas globais como Deloitte e HPE, ONGs como o World Economic Forum e organizações supranacionais como a European Commission. [1], [2], [3], [4], [5]
Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas sobre suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.
Ele liderou a estratégia de tecnologia e as compras de uma operadora de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de deep tech Hypatos, que atingiu uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia líderes como TechCrunch e Business Insider.
Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou como engenheiro da computação pela Bogazici University e possui um MBA pela Columbia Business School.
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.