Intermediário 14 minComparativo

Strix Halo vs DGX Spark: o duelo das máquinas 128 GB

Em 2026, duas máquinas com 128 GB de memória unificada disputam espaço na mesa dos entusiastas de LLMs locais: o Ryzen AI Max+ 395 da AMD (codinome Strix Halo) e o DGX Spark da NVIDIA. No papel, a mesma capacidade de memória, a mesma promessa — carregar modelos de 70B e grandes MoE sem múltiplas GPUs. Na prática, o duelo Strix Halo vs DGX Spark depende menos da geração de tokens e mais do processamento de prompts, em que a diferença chega a um fator de 5. Este comparativo apresenta os números, o preço e indica a melhor escolha conforme seu uso real.

Você está escolhendo uma máquina? Nossas escolhas por orçamento → · Nossa ficha NVIDIA DGX Spark →

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#Duas máquinas de 128 GB, duas filosofias

O Ryzen AI Max+ 395 é uma APU x86: CPU Zen 5 (16 núcleos), iGPU Radeon 8060S (RDNA 3.5, 40 CU) e NPU XDNA 2, todos compartilhando até 128 GB de LPDDR5X em um barramento de 256 bits. Ele está presente em mini-PCs (Framework Desktop, GMKtec EVO-X2, Beelink GTR9) e alguns laptops. É uma plataforma voltada ao consumidor, com Windows ou Linux, que executa Ollama e LM Studio como qualquer PC.

O DGX Spark é um dispositivo diferente: um chip GB10 (arquitetura Grace Blackwell) com uma CPU ARM de 20 núcleos e uma GPU Blackwell com Tensor Cores, ambos também acoplados a 128 GB de memória LPDDR5X unificada. É um dispositivo voltado prioritariamente para o ecossistema NVIDIA, fornecido com o DGX OS (um Ubuntu personalizado) e toda a stack CUDA. Preço oficial anunciado: 4.699 dólares.

i
Mesma memória, objetivos opostos
O Strix Halo prioriza o preço e a versatilidade x86; o DGX Spark prioriza o desempenho computacional e o ecossistema CUDA. Os dois carregam os mesmos modelos grandes, mas não os servem à mesma velocidade nem com o mesmo orçamento.

#1. Especificações lado a lado

O ponto que mais surpreende à primeira vista: a largura de banda da memória é quase idêntica. E é ela que determina a velocidade de geração de tokens. Isso explica por que, em conversas por chat, as duas máquinas têm desempenho muito próximo.

Memória
128 GB de LPDDR5X unificada dos dois lados. Suficiente para um modelo de 70B Q4 (~40 GB) com contexto ou um MoE como Qwen3-235B em quantização agressiva.
Largura de banda
Strix Halo: ~256 GB/s teóricos (256 bits, LPDDR5X-8000). DGX Spark: ~273 GB/s. Diferença real desprezível para a geração.
Cálculo com GPU
Radeon 8060S RDNA 3.5, 40 CU, sem núcleos Tensor dedicados. No Spark: GPU Blackwell com núcleos Tensor e suporte nativo a FP4 — uma ordem de grandeza acima em capacidade bruta de cálculo.
CPU
AMD: Zen 5, 16 núcleos x86. NVIDIA: ARM Grace, 20 núcleos. O x86 continua sendo mais simples para softwares voltados ao público em geral.
OS
Strix Halo: Windows 11 ou Linux, à sua escolha. DGX Spark: DGX OS (Ubuntu) com drivers e CUDA pré-instalados.
Consumo
Strix Halo: faixa de potência de 55 a 120 W conforme o chassi. DGX Spark: ~240 W medidos na tomada sob carga, fonte de alimentação dedicada.

#2. Tokens/segundo: uma disputa acirrada

Na geração pura (decodificação), as duas máquinas são limitadas pela largura de banda da memória, não pelo cálculo. Resultado: números próximos, com uma leve vantagem para o Spark devido à sua largura de banda ligeiramente superior e a kernels CUDA muito otimizados. Aqui estão medidas representativas publicadas pela comunidade em 2026, em quantização Q4 equivalente, com prompt curto.

Qwen3-30B-A3B (MoE) — Strix Halo
~100 tok/s na geração. O MoE ativa apenas 3B de parâmetros, o que explica a velocidade elevada apesar do tamanho.
Qwen3-30B-A3B (MoE) — DGX Spark
~100-115 tok/s. Diferença pequena: ambos são limitados pela memória neste MoE leve.
Modelo denso 70B Q4 — Strix Halo
~4-5 tok/s. Um modelo 70B denso satura a largura de banda; a experiência continua utilizável, mas lenta.
Modelo denso 70B Q4 — DGX Spark
~5-6 tok/s. Idem, limitado por memória. A diferença é em frações de token/s.
Modelo 8B Q4 — os dois
50-70 tok/s, uma velocidade mais do que confortável para conversas interativas.
→
O MoE é amigo dos 128 GB
Um modelo Mixture-of-Experts como Qwen3-30B-A3B calcula apenas seus especialistas ativos a cada token. Nessas duas máquinas, esse é o ponto ideal: um modelo grande carregado na memória, mas com a velocidade de um modelo pequeno. Prefira os MoE se você quer qualidade E taxa de geração.

A conclusão desta seção é contraintuitiva: se você olhar apenas para tokens por segundo no chat, as duas máquinas são quase equivalentes, e o Strix Halo — bem mais barato — parece ganhar. Mas esse número conta apenas metade da história.

#3. Processamento de prompt: a verdadeira diferença

O processamento de prompt (ou prefill) é a fase em que o modelo lê e codifica seu prompt de entrada antes de gerar o primeiro token. Diferentemente da geração, essa fase é limitada pelo cálculo, não pela memória. É aqui que os Tensor Cores do DGX Spark fazem toda a diferença.

Strix Halo — prefill
~340 tok/s de processamento de prompt em um modelo típico de 30B. A iGPU RDNA 3.5 não possui unidades matriciais dedicadas, atinge rapidamente o limite.
DGX Spark — prefill
cerca de 5 vezes mais rápido nos mesmos modelos, devido aos Tensor Cores Blackwell e ao suporte FP4. Em contextos grandes, a diferença pode aumentar ainda mais.

Por que isso importa? Porque, assim que você vai além de conversas curtas, o prefill domina o tempo de resposta percebido. Um sistema RAG que injeta 8.000 tokens de contexto, um agente que relê todo o seu histórico a cada turno, uma análise de um documento longo, processamento em lote: em todos esses casos, você espera pelo prefill antes de ver qualquer coisa.

!
A armadilha do benchmark com prompt curto
Muitos testes publicam apenas os tokens por segundo na geração com um prompt de 20 tokens e concluem que o Strix Halo está à altura. Isso é verdade no bate-papo, mas falso no RAG ou no uso de agentes. Se o seu uso envolve o envio de contextos longos, o processamento do prompt no DGX Spark muda radicalmente a experiência — meça essa fase separadamente antes de comprar.

Exemplo concreto: um prompt de 4.000 tokens. A 340 tok/s, o Strix Halo leva cerca de 12 segundos apenas para o prefill antes de começar a responder. O DGX Spark, cerca de 5 vezes mais rápido, conclui a mesma fase em 2 a 3 segundos. Em uma sessão RAG intensa com dezenas de requisições, essa diferença passa a dominar a experiência de uso.

#4. Preço e disponibilidade

É nessa área que o Strix Halo recupera a vantagem, e por uma boa margem. A relação preço/memória é seu grande trunfo.

DGX Spark
4.699 dólares, preço oficial da NVIDIA. Disponível pela NVIDIA e por parceiros (Dell, Asus, HP, Lenovo). Voltado a profissionais e desenvolvedores.
Strix Halo — mini-PC
Framework Desktop, GMKtec EVO-X2, Beelink GTR9: dependendo da configuração com 128 GB, o preço geralmente fica entre ~1.700 e ~2.500 dólares/euros. Aproximadamente metade do preço do Spark para a mesma quantidade de memória.
Strix Halo — laptop
Alguns notebooks (por exemplo, HP ZBook Ultra e Asus ROG Flow Z13) vêm com essa APU, uma vantagem rara para executar LLMs com 128 GB de memória em mobilidade.
Disponibilidade
O Strix Halo está à venda ao público em várias montadoras de computadores desde meados de 2026. O DGX Spark segue um cronograma da NVIDIA com mais restrições, dependendo da região.
i
A verdadeira escolha em termos de preço
Por aproximadamente o preço de um DGX Spark, você pode comprar um mini-PC Strix Halo de 128 GB E, separadamente, uma RTX 4090 de 24 GB. Se sua necessidade for principalmente chat e modelos que cabem em 24 GB, essa combinação pode superar o Spark em quase todos os aspectos — exceto no processamento de prompts com modelos muito grandes.

#5. Ecossistema de software

Além do hardware, a stack de software pesa muito no conforto de uso diário — e é aí que a NVIDIA aproveita os anos de vantagem acumulados com CUDA.

DGX Spark — CUDA
Todo o ecossistema NVIDIA funciona nativamente: vLLM, TensorRT-LLM, PyTorch, os containers NGC. Para fine-tuning, serving em lote ou pesquisa, é o ambiente mais bem estruturado.
Strix Halo — ROCm / Vulkan
A inferência funciona bem via Ollama e llama.cpp (backend Vulkan ou ROCm). O fine-tuning e o uso de frameworks avançados ainda exigem mais trabalho manual em RDNA 3.5 do que em CUDA.
Simplicidade para o público em geral
Vantagem do Strix Halo para o usuário comum: Windows, Ollama com um único comando, LM Studio com um clique. O Spark pressupõe familiaridade com Linux/Ubuntu.
Atendimento a múltiplos clientes
Vantagem do DGX Spark: vLLM e TensorRT-LLM oferecem batching e uma taxa de processamento agregada muito superiores para atender uma equipe ou uma aplicação.

#6. Qual perfil para qual máquina

  1. 01
    Você usa principalmente chat local e modelos MoE
    Strix Halo. A quantidade de tokens por segundo na geração está no nível do Spark, o preço é metade, e Windows + Ollama torna o uso trivial. Um Qwen3-30B-A3B a ~100 t/s é uma excelente opção para uso diário.
  2. 02
    Você está montando um RAG ou agentes de longo contexto
    DGX Spark. O processamento de prompts 5 vezes mais rápido transforma a experiência quando você fornece contextos extensos repetidamente. Esse é o cenário em que o custo adicional se justifica.
  3. 03
    Você quer fazer fine-tuning ou pesquisa
    DGX Spark. A stack CUDA (PyTorch, TensorRT-LLM, containers NGC) é incomparavelmente melhor equipada do que o ROCm em APU para treinamento.
  4. 04
    Você busca a melhor relação entre memória e preço em euros
    Strix Halo, sem hesitar. 128 GB unificados (preço muito variável, a verificar), geralmente mais barato que o Spark, com a versatilidade x86 de um verdadeiro PC de mesa.
  5. 05
    Você quer 128 GB em uma máquina portátil
    Strix Halo, via um laptop equipado com a APU — uma categoria que o DGX Spark, dispositivo de mesa, não cobre.

i
Dois chips, uma mesma revolução
Pense nisso por um segundo: em 2024, rodar um 70B em casa exigia uma montagem improvisada de entusiasta com várias GPUs. Em 2026, AMD e NVIDIA vendem, cada uma, um chip com 128 GB de memória unificada que faz isso silenciosamente embaixo da sua mesa. Independentemente do lado que você escolher, quem ganhou foi a IA local.

#Veredito

Veredito assumido: empate. Este duelo não tem um único vencedor, e isso não é uma saída evasiva — é o resultado das medições. Os dois chips oferecem 128 GB de memória unificada e uma velocidade de geração comparável; cada um vence metade da disputa. O Strix Halo vence na relação preço/memória, na versatilidade (também é um excelente PC) e no chat interativo; o GB10 vence no processamento de prompts, no fine-tuning, no clustering e no ecossistema CUDA. Duas filosofias, dois vencedores — a única perdedora é a GPU convencional com VRAM limitada.

O número que engana
~100 tok/s de geração dos dois lados no Qwen3-30B → parece um empate, vantagem de preço no Strix Halo.
O número que decide
Processamento de prompt a ~340 tok/s (Strix Halo) contra cerca de 5 vezes mais (DGX Spark). Esse desempenho é decisivo quando você deixa de usar apenas chats curtos.
Regra simples
Contexto curto + orçamento apertado → Strix Halo. Contexto longo, agentes, RAG, fine-tuning → DGX Spark.
→
Teste sua carga de trabalho real, não um benchmark genérico
Antes de comprar, cronometre o processamento do seu prompt típico: comprimento da entrada, frequência das requisições, tamanho do modelo desejado. Se seus prompts ultrapassarem regularmente alguns milhares de tokens, o processamento de prompts do Spark justifica seu preço. Caso contrário, o Strix Halo é a escolha racional.

#Perguntas frequentes

Strix Halo ou DGX Spark: qual escolher em 2026?+
Empate — a escolha depende do seu perfil, não de um ranking. Prompts curtos, chat, assistência de código, orçamento apertado, necessidade de um PC multifuncional: Strix Halo. Prompts longos, fine-tuning, workflow CUDA, planos de montar um cluster: GB10/DGX Spark. Para o mesmo uso, quem escolher uma dessas máquinas não sentirá falta da outra.
Por que um empate e não um vencedor?+
Porque as duas plataformas compartilham a mesma limitação estrutural — uma largura de banda de memória de cerca de 256-273 GB/s que limita a velocidade de geração — e se distinguem por critérios opostos (preço e versatilidade versus capacidade de processamento e ecossistema). Escolher um único vencedor equivaleria a decidir no seu lugar como você vai usar a máquina.
Por que a geração de texto é semelhante nas duas?+
A geração token por token é limitada pela largura de banda da memória, não pela potência de cálculo. A ~256 GB/s (Strix Halo) contra ~273 GB/s (GB10), os dois leem o modelo a uma velocidade semelhante — o que resulta em taxas de tokens/s comparáveis no mesmo modelo quantizado. A diferença explode, no entanto, no processamento do prompt, onde o GPU Blackwell domina.
Qual é a diferença de preço real?+
Com a mesma quantidade de memória, o preço chega a aproximadamente o dobro: as máquinas Strix Halo de 128 GB partem de cerca de $ 1.700–2.000 (Bosgame, Beelink, Framework), enquanto os sistemas GB10 vão de aproximadamente $ 2.999 (Asus Ascent GX10) a aproximadamente $ 3.999 (DGX Spark Founders). Esse é o principal argumento a favor do Strix Halo — e o que você paga a mais pelo GB10 é CUDA e capacidade de processamento.

#Para se aprofundar

Para analisar cada máquina e o contexto de hardware envolvido nesse duelo:

Ryzen AI Max+ 395 (Strix Halo)
Guia dedicado à APU AMD: mini-PCs e laptops disponíveis, modelos 70B+ acessíveis e desempenho real em comparação com as GPUs dedicadas e os Macs.
NVIDIA DGX Spark
O mini-PC para IA com 128 GB analisado em detalhe em comparação com as GPUs convencionais: referências de desempenho, casos de uso e limitações.
Escolher sua quantização (Q4, Q5, Q8, FP16)
Para entender por que um 70B cabe em 40 GB em Q4 e o que cada nível custa em qualidade nessas máquinas com memória unificada.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.