Intermediário 14 minMini-PC

NVIDIA DGX Spark: o mini-PC de IA de 128 GB frente aos GPU

O DGX Spark é a aposta da NVIDIA na IA local em computadores de mesa: um chip Grace Blackwell, 128 GB de memória unificada e um formato que cabe em um canto da mesa. No papel, ele executa modelos que nenhuma placa voltada ao consumidor consegue carregar sozinha. Este guia analisa o dgx spark llm na prática: o que cabe na memória, as velocidades reais de inferência e a comparação com uma RTX 5090 e um Mac Studio para saber se esse mini-PC merece um lugar na sua casa.

Você está escolhendo uma máquina? Nossas escolhas por orçamento → · Nossa ficha NVIDIA DGX Spark →

Por Samir K.·Atualização 2026-08-27·Testado no Windows, macOS e Linux
Hardware recomendado

Para este setup: NVIDIA DGX Spark.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#O que é o DGX Spark

O DGX Spark é um computador compacto construído em torno do superchip NVIDIA GB10 Grace Blackwell. Ele combina, em um mesmo chip, uma GPU Blackwell e uma CPU ARM Grace (20 núcleos), conectadas a um conjunto único de 128 GB de memória LPDDR5X compartilhada entre as duas. É essa arquitetura de memória unificada — a mesma filosofia do Apple Silicon — que torna a máquina tão interessante para a IA local.

Enquanto uma placa de vídeo tradicional mantém sua VRAM separada (no máximo 24 ou 32 GB nos modelos para consumidores), o DGX Spark permite que a GPU acesse diretamente os 128 GB. Na prática, a restrição que limita todos os usuários de GPU — «o modelo cabe na VRAM?» — quase desaparece. O fator limitante passa a ser a largura de banda da memória, e não a capacidade.

Chip
NVIDIA GB10 Grace Blackwell (GPU Blackwell + CPU ARM de 20 núcleos)
Memória
128 GB LPDDR5X unificada, compartilhada entre CPU e GPU
Largura de banda
~273 GB/s (LPDDR5X), o verdadeiro gargalo
Rede
ConnectX (200 GbE) para interligar dois Spark e viabilizar o uso de modelos muito grandes
Formato
Mini-PC de mesa, ~150 W, silencioso em comparação com um PC em torre com várias GPUs
i
Não é um substituto de datacenter
O DGX Spark é voltado à prototipagem, ao fine-tuning leve e à inferência local de modelos grandes — não ao treinamento em grande escala nem à operação de serviços sob alta carga. A NVIDIA o posiciona como uma estação pessoal de desenvolvimento de IA.

#128 GB unificados: o que isso desbloqueia

Para dar uma referência, esta é a quantidade aproximada de VRAM necessária para um modelo com quantização Q4_K_M, a mais comum para inferência local: um 7B cabe em ~5 GB, um 14B em ~9 GB, um 32B em ~19 GB, um 70B em ~40 GB. Em uma RTX 5090 com seus 32 GB, um 70B Q4 não cabe inteiramente: é necessário transferir parte para a CPU, o que derruba a velocidade.

Com 128 GB de memória unificada, o DGX Spark carrega sem esforço um 70B em Q4, Q5 ou mesmo Q8, mantém uma margem para um contexto longo (32k tokens ou mais) e abre espaço para modelos de 100B+ parâmetros com quantização agressiva. É a classe de modelos que, até agora, exigia um Mac Studio de ponta ou um sistema multi-GPU caro e com alto consumo de energia.

70B Q4 (~40 GB)
Confortável, com grande margem para o contexto
70B Q8 (~75 GB)
Possível — qualidade quase FP16 em um modelo grande
MoE tipo 120B em Q4
Cabe na memória; a largura de banda determina a velocidade
Vários modelos carregados
Um 32B + um 14B em paralelo para roteamento ou multi-agente
→
Memória não é sinônimo de velocidade
Carregar um modelo e executá-lo rapidamente são duas coisas diferentes. Os 128 GB garantem que o modelo caiba na memória; são os ~273 GB/s de largura de banda que determinam os tokens por segundo. Com modelos muito grandes, espere uma inferência com ritmo confortável de leitura, não uma geração em rajadas.

#Quais modelos ele executa

O ponto forte do DGX Spark é a faixa de 30B a 120B, exatamente onde as GPUs de uso doméstico esbarram na falta de VRAM. Veja os usos típicos por família de modelos.

Qwen 3.8 27B
O principal modelo generalista de 2026 (visão, 262k ctx); nessa máquina, ele roda em Q8 com qualidade plena e ampla margem de contexto
Qwen 3.6 35B-A3B / Qwen3-Coder 30B
MoE rápidos para raciocínio e código, que cabem integralmente na memória mesmo em Q8
GLM 4.7 Flash (MoE 30B-A3B, MIT)
Excelente para agentes, carregado com qualidade plena sem malabarismos
Grande MoE 100B+ quantizado
As arquiteturas Mixture-of-Experts aproveitam plenamente a grande capacidade da memória unificada
Modelos multimodais
Gemma 4 e Qwen 3.8 (visão + texto), que exigem muita memória, cabem na memória sem concessões

Para modelos pequenos (7B–14B), o DGX Spark obviamente funciona, mas é um desperdício: uma RTX 4070 ou um Mac mini M4 roda esses modelos mais rápido por muito menos dinheiro. A máquina só se justifica se você pretende rodar modelos grandes regularmente.

i
GB10: um superchip de datacenter em casa
O coração do Spark é o GB10 Grace Blackwell: 20 núcleos ARM (10 Cortex-X925 + 10 A725) ligados a uma GPU Blackwell por uma conexão NVLink-C2C, ~1 petaFLOP em FP4 e 128 GB de memória unificada. É literalmente a arquitetura dos servidores GB200 reduzida ao formato de um livro de bolso — com o ecossistema CUDA completo, o que faz dele a única ponte direta entre “experimentar em casa” e “implantar como em produção”.

#Desempenho real em inferência

Duas medidas contam na inferência local: a velocidade de geração (tokens por segundo, o que vai aparecendo na tela) e o tempo de pré-preenchimento (o intervalo até o primeiro token, que depende do comprimento do prompt). A largura de banda da memória influencia sobretudo a geração.

No DGX Spark, um modelo 70B em Q4 normalmente gera na ordem de dez tokens por segundo — o suficiente para usá-lo confortavelmente como assistente, lendo à medida que o texto é gerado, mas menos adequado para cargas de trabalho em lote que exigem alta taxa de processamento. Modelos menores (14B–32B) atingem velocidades bem mais altas. Esse perfil é coerente com uma largura de banda de aproximadamente 273 GB/s: esse é o limite que separa o DGX Spark das placas GDDR7, muito mais rápidas nesse aspecto.

!
Não compare tokens por segundo fora do contexto
Um valor de tokens por segundo só tem sentido com o modelo exato, a quantização, o tamanho do contexto e o motor de inferência. Os valores acima são ordens de grandeza para se orientar, não garantias. Faça medições com sua própria carga de trabalho antes de decidir sobre uma compra.

#DGX Spark vs RTX 5090

É a comparação mais ilustrativa e contrapõe duas filosofias. A RTX 5090 oferece 32 GB de VRAM GDDR7 com cerca de 1.792 GB/s de largura de banda: aproximadamente seis a sete vezes mais rápida que o DGX Spark no acesso à memória. Para tudo o que cabe nos seus 32 GB, a 5090 pulveriza o Spark em tokens por segundo.

Mas a 5090 esbarra em um limite claro: acima de ~32 GB, ela precisa transferir parte do processamento para a CPU, e seu desempenho despenca. Um 70B Q4 (~40 GB) não cabe inteiramente nela. Já o DGX Spark roda esse mesmo 70B sem dificuldade — mais lentamente, mas com o modelo inteiro na memória. A escolha se resume a uma pergunta: sua carga de trabalho cabe em menos de 32 GB?

Você não ultrapassa 32 GB (até ~32B Q4)
RTX 5090: muito mais rápida e versátil (jogos, renderização, CUDA)
Você busca modelos de 70B ou maiores
DGX Spark: o modelo cabe na memória onde a 5090 não dá conta
Consumo / ruído
DGX Spark: ~150 W e silencioso, em comparação com uma torre com 5090 quente e barulhenta
Ecossistema CUDA completo
Os dois; o Spark adiciona o stack DGX/NVIDIA de ponta a ponta

#DGX Spark vs Mac Studio

O verdadeiro concorrente do DGX Spark não é uma placa de vídeo, é o Mac Studio. Os dois compartilham a mesma ideia — grande quantidade de memória unificada em um gabinete compacto e discreto — e visam o mesmo público: desenvolvedores que querem modelos grandes rodando localmente sem montar uma máquina.

O Mac Studio (M-Ultra) pode atingir até 512 GB de memória unificada com uma largura de banda frequentemente superior nas configurações de alto desempenho, o que o torna poderoso em modelos muito grandes. Seu ponto forte: macOS, Metal e um ecossistema maduro (Ollama, LM Studio, MLX). O ponto forte do DGX Spark: suporte nativo ao CUDA. Se o seu pipeline depende de bibliotecas CUDA, TensorRT ou de ferramentas NVIDIA, o Spark fala nativamente a mesma língua que seus servidores de produção.

Memória máxima
Mac Studio até 512 GB; DGX Spark 128 GB (extensível ao conectar 2 unidades)
Ecossistema de software
Mac: Metal/MLX maduros; Spark: CUDA nativo, continuidade com os servidores NVIDIA
Portabilidade do código de IA
O Spark executa sem dificuldade código escrito para GPUs NVIDIA na nuvem ou em datacenters
Uso em tarefas de escritório
O Mac Studio é um computador de trabalho completo; o Spark é uma estação de IA dedicada
i
O critério que muitas vezes decide
Se você estiver prototipando código destinado a rodar em GPUs NVIDIA em produção, o DGX Spark elimina surpresas de portabilidade. Se você quer principalmente inferência local confortável e uma máquina versátil, o Mac Studio é mais flexível. O resto é uma questão de largura de banda e orçamento.

#Instalar o Ollama nele

O DGX Spark roda sobre uma base Linux (DGX OS, derivado do Ubuntu), com a stack CUDA pré-instalada. O Ollama funciona nele como em qualquer máquina Linux com GPU NVIDIA: o daemon detecta a GPU e disponibiliza os modelos na porta habitual.

  1. 01
    Instalar Ollama
    Script oficial em um único comando. Ele configura o serviço systemd e detecta automaticamente a GPU Blackwell via CUDA.
  2. 02
    Verificar a detecção da GPU
    Confirme que a GPU está sendo detectada antes de iniciar um modelo grande; caso contrário, a inferência seria executada na CPU.
  3. 03
    Baixar um modelo grande
    Baixe um modelo MoE grande de 2026 em qualidade máxima (um Qwen3-Coder 30B em Q8, ou o carro-chefe Qwen 3.8 27B e seu contexto de 262k) para aproveitar a memória — esse é precisamente o caso de uso da máquina.
  4. 04
    Iniciar e conectar uma interface
    O daemon escuta por padrão em http://localhost:11434; configure o Open WebUI ou o LM Studio para apontar para esse endereço.
Terminal — instalação
# Installer Ollama (Linux / DGX OS)
curl -fsSL https://ollama.com/install.sh | sh

# Vérifier que le GPU Blackwell est détecté
nvidia-smi

# Tirer et lancer un gros MoE 2026 en pleine qualité (exploite la mémoire unifiée)
ollama run qwen3-coder:30b-a3b-q8_0

O daemon Ollama expõe uma API compatível na porta 11434. Para explorar a memória, prefira modelos que os GPUs clássicos não conseguem carregar sozinhos e aumente a janela de contexto, já que você tem espaço disponível. Observe que Qwen 3.8 27B tende a refletir demais com sua configuração padrão de raciocínio: mude para o modo baixo (low) para respostas mais diretas.

Terminal — contexto estendido
# Servir Qwen 3.8 27B avec un grand contexte depuis un Modelfile
cat > Modelfile <<'EOF'
FROM qwen3.8:27b
PARAMETER num_ctx 131072
EOF

ollama create qwen38-128k -f Modelfile
ollama run qwen38-128k
→
Interligar dois Spark
A porta de rede ConnectX 200 GbE permite conectar dois DGX Spark para somar a memória e buscar executar modelos que ultrapassem 128 GB. Esse é o caminho de atualização previsto pela NVIDIA se um único gabinete não for mais suficiente.

#Um chip, oito máquinas: clones certificados

A NVIDIA fez do GB10 uma plataforma: além do seu DGX Spark Founders Edition, sete fabricantes vendem a mesma base certificada sob suas próprias marcas. Mesmo chip, mesmos 128 GB — as diferenças estão no armazenamento, no gabinete, no preço e no canal de venda.

8 sistemas GB10 certificados (agosto de 2026)
MáquinaFabricantePara lembrar
DGX Spark Founders EditionNVIDIAA referência, ~$ 3.999
Ascent GX10AsusO melhor em termos de preço (~2 999 $)
Veriton GN100AcerSKU único com 4 TB de armazenamento
AI TOP ATOMGigabyteInclui a suíte de software AI TOP
EdgeXpert MS-C931MSICanal industrial/edge
Pro Max GB10DellCanal empresarial
ThinkStation PGXLenovoCanal de workstation
ZGX NanoHPCanal de workstation

Detalhe que muda tudo para modelos grandes: a porta ConnectX integrada permite conectar duas unidades e executar modelos da classe 400B localmente. Nenhuma outra máquina voltada ao público geral oferece isso.

#Perguntas frequentes

O que é exatamente o GB10 do DGX Spark?+
Um “superchip”: um processador ARM Grace de 20 núcleos e uma GPU Blackwell fabricados para trabalhar juntos, conectados por NVLink-C2C (muito mais rápido que um barramento PCIe), compartilhando 128 GB de memória unificada LPDDR5X. Ele fornece cerca de 1 petaFLOP em FP4 — a arquitetura dos servidores de IA da NVIDIA, na escala de um mini-PC.
Qual a diferença entre o DGX Spark e seus clones da Asus, Acer ou Gigabyte?+
Nenhuma no chip: os 8 sistemas têm o mesmo GB10 e os mesmos 128 GB. As diferenças estão no armazenamento (até 4 TB nos modelos da Acer), no gabinete, no software fornecido, no suporte e, principalmente, no preço — o Asus Ascent GX10 é cerca de US$ 1.000 mais barato que a Founders Edition.
É possível realmente rodar um modelo de 400B com duas máquinas?+
Sim, é um caso de uso oficial: duas unidades conectadas por suas portas ConnectX de 200 Gb/s compartilham sua memória para servir modelos da classe 400B (os modelos MoE muito grandes da classe 400B+ quantizados). Isso é único no mercado de consumo — o próximo patamar é um servidor que custa várias dezenas de milhares de euros.
DGX Spark ou máquina Strix Halo?+
Os dois oferecem 128 GB unificados e uma geração de texto comparável (suas taxas de transferência de memória são próximas). O GB10 tem vantagem no processamento de prompts, no fine-tuning e no ecossistema CUDA; Strix Halo tem vantagem no preço (muitas vezes metade do custo), no Windows e na versatilidade. Nosso comparativo dedicado define a melhor opção para cada perfil — veredito: empate.
Para quem é uma máquina GB10?+
Para desenvolvedores de IA que querem prototipar localmente o que vão implantar em GPUs NVIDIA em produção, para equipes que fazem fine-tuning e para quem busca modelos muito grandes por meio de clustering. Para conversas diárias e assistência em código, uma máquina Strix Halo oferece um serviço semelhante por metade do preço.

#Para quem esse formato faz sentido

O DGX Spark não é uma máquina para o público em geral. Ele é útil sobretudo para perfis específicos para os quais a limitação de VRAM é o verdadeiro problema do dia a dia.

Desenvolvedores de IA com CUDA
Prototipar localmente código destinado às GPUs NVIDIA de produção, sem surpresas de portabilidade
Pesquisadores e equipes de P&D
Fine-tuning leve e inferência de modelos grandes sem reservar tempo de GPU na nuvem
Usuários avançados do 70B+
Quem esbarra constantemente no limite de 24–32 GB de uma placa para o mercado de consumo
Escritórios sensíveis ao ruído/consumo
Uma estação silenciosa e de baixo consumo, em vez de um rig com múltiplas GPUs

Por outro lado, se você joga, se roda principalmente modelos ≤ 32B ou se seu orçamento é apertado, uma RTX 5090 (ou até uma 4070/4080) ou um Mac mini M4 oferecerá uma relação desempenho/preço muito melhor. O DGX Spark se justifica quando a necessidade de uma grande capacidade de memória tem prioridade sobre a taxa de transferência bruta.

!
A armadilha do número mágico
« 128 GB » impressiona, mas não alugue para rodar um 8B. Compre esta máquina por aquilo que realmente desbloqueia — a faixa de 70B a 120B localmente — ou você pagará caro por uma capacidade que nunca usará.

#Para se aprofundar

É mais fácil avaliar o DGX Spark comparando-o com as alternativas já abordadas no site. Estes guias dão continuidade à reflexão:

Qual LLM na RTX 5090 (32 GB)?
O comparativo detalhado da placa mais rápida voltada ao consumidor, para avaliar o equilíbrio entre taxa de processamento e capacidade.
Qual LLM no Mac Studio?
A outra grande máquina com memória unificada, até 512 GB — o verdadeiro concorrente do DGX Spark.
Escolher sua GPU para IA local
Para dimensionar sua necessidade de VRAM antes de gastar e ver onde cada opção se encaixa.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.