Strix Halo vs DGX Spark: o duelo das máquinas 128 GB
Em 2026, duas máquinas com 128 GB de memória unificada disputam espaço na mesa dos entusiastas de LLMs locais: o Ryzen AI Max+ 395 da AMD (codinome Strix Halo) e o DGX Spark da NVIDIA. No papel, a mesma capacidade de memória, a mesma promessa — carregar modelos de 70B e grandes MoE sem múltiplas GPUs. Na prática, o duelo Strix Halo vs DGX Spark depende menos da geração de tokens e mais do processamento de prompts, em que a diferença chega a um fator de 5. Este comparativo apresenta os números, o preço e indica a melhor escolha conforme seu uso real.
Você está escolhendo uma máquina? Nossas escolhas por orçamento → · Nossa ficha NVIDIA DGX Spark →
Opção de compra para este guia: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#Duas máquinas de 128 GB, duas filosofias
O Ryzen AI Max+ 395 é uma APU x86: CPU Zen 5 (16 núcleos), iGPU Radeon 8060S (RDNA 3.5, 40 CU) e NPU XDNA 2, todos compartilhando até 128 GB de LPDDR5X em um barramento de 256 bits. Ele está presente em mini-PCs (Framework Desktop, GMKtec EVO-X2, Beelink GTR9) e alguns laptops. É uma plataforma voltada ao consumidor, com Windows ou Linux, que executa Ollama e LM Studio como qualquer PC.
O DGX Spark é um dispositivo diferente: um chip GB10 (arquitetura Grace Blackwell) com uma CPU ARM de 20 núcleos e uma GPU Blackwell com Tensor Cores, ambos também acoplados a 128 GB de memória LPDDR5X unificada. É um dispositivo voltado prioritariamente para o ecossistema NVIDIA, fornecido com o DGX OS (um Ubuntu personalizado) e toda a stack CUDA. Preço oficial anunciado: 4.699 dólares.
#1. Especificações lado a lado
O ponto que mais surpreende à primeira vista: a largura de banda da memória é quase idêntica. E é ela que determina a velocidade de geração de tokens. Isso explica por que, em conversas por chat, as duas máquinas têm desempenho muito próximo.
- Memória
- 128 GB de LPDDR5X unificada dos dois lados. Suficiente para um modelo de 70B Q4 (~40 GB) com contexto ou um MoE como Qwen3-235B em quantização agressiva.
- Largura de banda
- Strix Halo: ~256 GB/s teóricos (256 bits, LPDDR5X-8000). DGX Spark: ~273 GB/s. Diferença real desprezível para a geração.
- Cálculo com GPU
- Radeon 8060S RDNA 3.5, 40 CU, sem núcleos Tensor dedicados. No Spark: GPU Blackwell com núcleos Tensor e suporte nativo a FP4 — uma ordem de grandeza acima em capacidade bruta de cálculo.
- CPU
- AMD: Zen 5, 16 núcleos x86. NVIDIA: ARM Grace, 20 núcleos. O x86 continua sendo mais simples para softwares voltados ao público em geral.
- OS
- Strix Halo: Windows 11 ou Linux, à sua escolha. DGX Spark: DGX OS (Ubuntu) com drivers e CUDA pré-instalados.
- Consumo
- Strix Halo: faixa de potência de 55 a 120 W conforme o chassi. DGX Spark: ~240 W medidos na tomada sob carga, fonte de alimentação dedicada.
#2. Tokens/segundo: uma disputa acirrada
Na geração pura (decodificação), as duas máquinas são limitadas pela largura de banda da memória, não pelo cálculo. Resultado: números próximos, com uma leve vantagem para o Spark devido à sua largura de banda ligeiramente superior e a kernels CUDA muito otimizados. Aqui estão medidas representativas publicadas pela comunidade em 2026, em quantização Q4 equivalente, com prompt curto.
- Qwen3-30B-A3B (MoE) — Strix Halo
- ~100 tok/s na geração. O MoE ativa apenas 3B de parâmetros, o que explica a velocidade elevada apesar do tamanho.
- Qwen3-30B-A3B (MoE) — DGX Spark
- ~100-115 tok/s. Diferença pequena: ambos são limitados pela memória neste MoE leve.
- Modelo denso 70B Q4 — Strix Halo
- ~4-5 tok/s. Um modelo 70B denso satura a largura de banda; a experiência continua utilizável, mas lenta.
- Modelo denso 70B Q4 — DGX Spark
- ~5-6 tok/s. Idem, limitado por memória. A diferença é em frações de token/s.
- Modelo 8B Q4 — os dois
- 50-70 tok/s, uma velocidade mais do que confortável para conversas interativas.
A conclusão desta seção é contraintuitiva: se você olhar apenas para tokens por segundo no chat, as duas máquinas são quase equivalentes, e o Strix Halo — bem mais barato — parece ganhar. Mas esse número conta apenas metade da história.
#3. Processamento de prompt: a verdadeira diferença
O processamento de prompt (ou prefill) é a fase em que o modelo lê e codifica seu prompt de entrada antes de gerar o primeiro token. Diferentemente da geração, essa fase é limitada pelo cálculo, não pela memória. É aqui que os Tensor Cores do DGX Spark fazem toda a diferença.
- Strix Halo — prefill
- ~340 tok/s de processamento de prompt em um modelo típico de 30B. A iGPU RDNA 3.5 não possui unidades matriciais dedicadas, atinge rapidamente o limite.
- DGX Spark — prefill
- cerca de 5 vezes mais rápido nos mesmos modelos, devido aos Tensor Cores Blackwell e ao suporte FP4. Em contextos grandes, a diferença pode aumentar ainda mais.
Por que isso importa? Porque, assim que você vai além de conversas curtas, o prefill domina o tempo de resposta percebido. Um sistema RAG que injeta 8.000 tokens de contexto, um agente que relê todo o seu histórico a cada turno, uma análise de um documento longo, processamento em lote: em todos esses casos, você espera pelo prefill antes de ver qualquer coisa.
Exemplo concreto: um prompt de 4.000 tokens. A 340 tok/s, o Strix Halo leva cerca de 12 segundos apenas para o prefill antes de começar a responder. O DGX Spark, cerca de 5 vezes mais rápido, conclui a mesma fase em 2 a 3 segundos. Em uma sessão RAG intensa com dezenas de requisições, essa diferença passa a dominar a experiência de uso.
#4. Preço e disponibilidade
É nessa área que o Strix Halo recupera a vantagem, e por uma boa margem. A relação preço/memória é seu grande trunfo.
- DGX Spark
- 4.699 dólares, preço oficial da NVIDIA. Disponível pela NVIDIA e por parceiros (Dell, Asus, HP, Lenovo). Voltado a profissionais e desenvolvedores.
- Strix Halo — mini-PC
- Framework Desktop, GMKtec EVO-X2, Beelink GTR9: dependendo da configuração com 128 GB, o preço geralmente fica entre ~1.700 e ~2.500 dólares/euros. Aproximadamente metade do preço do Spark para a mesma quantidade de memória.
- Strix Halo — laptop
- Alguns notebooks (por exemplo, HP ZBook Ultra e Asus ROG Flow Z13) vêm com essa APU, uma vantagem rara para executar LLMs com 128 GB de memória em mobilidade.
- Disponibilidade
- O Strix Halo está à venda ao público em várias montadoras de computadores desde meados de 2026. O DGX Spark segue um cronograma da NVIDIA com mais restrições, dependendo da região.
#5. Ecossistema de software
Além do hardware, a stack de software pesa muito no conforto de uso diário — e é aí que a NVIDIA aproveita os anos de vantagem acumulados com CUDA.
- DGX Spark — CUDA
- Todo o ecossistema NVIDIA funciona nativamente: vLLM, TensorRT-LLM, PyTorch, os containers NGC. Para fine-tuning, serving em lote ou pesquisa, é o ambiente mais bem estruturado.
- Strix Halo — ROCm / Vulkan
- A inferência funciona bem via Ollama e llama.cpp (backend Vulkan ou ROCm). O fine-tuning e o uso de frameworks avançados ainda exigem mais trabalho manual em RDNA 3.5 do que em CUDA.
- Simplicidade para o público em geral
- Vantagem do Strix Halo para o usuário comum: Windows, Ollama com um único comando, LM Studio com um clique. O Spark pressupõe familiaridade com Linux/Ubuntu.
- Atendimento a múltiplos clientes
- Vantagem do DGX Spark: vLLM e TensorRT-LLM oferecem batching e uma taxa de processamento agregada muito superiores para atender uma equipe ou uma aplicação.
#6. Qual perfil para qual máquina
- 01Você usa principalmente chat local e modelos MoEStrix Halo. A quantidade de tokens por segundo na geração está no nível do Spark, o preço é metade, e Windows + Ollama torna o uso trivial. Um Qwen3-30B-A3B a ~100 t/s é uma excelente opção para uso diário.
- 02Você está montando um RAG ou agentes de longo contextoDGX Spark. O processamento de prompts 5 vezes mais rápido transforma a experiência quando você fornece contextos extensos repetidamente. Esse é o cenário em que o custo adicional se justifica.
- 03Você quer fazer fine-tuning ou pesquisaDGX Spark. A stack CUDA (PyTorch, TensorRT-LLM, containers NGC) é incomparavelmente melhor equipada do que o ROCm em APU para treinamento.
- 04Você busca a melhor relação entre memória e preço em eurosStrix Halo, sem hesitar. 128 GB unificados (preço muito variável, a verificar), geralmente mais barato que o Spark, com a versatilidade x86 de um verdadeiro PC de mesa.
- 05Você quer 128 GB em uma máquina portátilStrix Halo, via um laptop equipado com a APU — uma categoria que o DGX Spark, dispositivo de mesa, não cobre.
#Veredito
Veredito assumido: empate. Este duelo não tem um único vencedor, e isso não é uma saída evasiva — é o resultado das medições. Os dois chips oferecem 128 GB de memória unificada e uma velocidade de geração comparável; cada um vence metade da disputa. O Strix Halo vence na relação preço/memória, na versatilidade (também é um excelente PC) e no chat interativo; o GB10 vence no processamento de prompts, no fine-tuning, no clustering e no ecossistema CUDA. Duas filosofias, dois vencedores — a única perdedora é a GPU convencional com VRAM limitada.
- O número que engana
- ~100 tok/s de geração dos dois lados no Qwen3-30B → parece um empate, vantagem de preço no Strix Halo.
- O número que decide
- Processamento de prompt a ~340 tok/s (Strix Halo) contra cerca de 5 vezes mais (DGX Spark). Esse desempenho é decisivo quando você deixa de usar apenas chats curtos.
- Regra simples
- Contexto curto + orçamento apertado → Strix Halo. Contexto longo, agentes, RAG, fine-tuning → DGX Spark.
#Perguntas frequentes
Strix Halo ou DGX Spark: qual escolher em 2026?+
Por que um empate e não um vencedor?+
Por que a geração de texto é semelhante nas duas?+
Qual é a diferença de preço real?+
#Para se aprofundar
Para analisar cada máquina e o contexto de hardware envolvido nesse duelo:
- Ryzen AI Max+ 395 (Strix Halo)
- Guia dedicado à APU AMD: mini-PCs e laptops disponíveis, modelos 70B+ acessíveis e desempenho real em comparação com as GPUs dedicadas e os Macs.
- NVIDIA DGX Spark
- O mini-PC para IA com 128 GB analisado em detalhe em comparação com as GPUs convencionais: referências de desempenho, casos de uso e limitações.
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Para entender por que um 70B cabe em 40 GB em Q4 e o que cada nível custa em qualidade nessas máquinas com memória unificada.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.