NVIDIA DGX Spark: o mini-PC de IA de 128 GB frente aos GPU
O DGX Spark é a aposta da NVIDIA na IA local em computadores de mesa: um chip Grace Blackwell, 128 GB de memória unificada e um formato que cabe em um canto da mesa. No papel, ele executa modelos que nenhuma placa voltada ao consumidor consegue carregar sozinha. Este guia analisa o dgx spark llm na prática: o que cabe na memória, as velocidades reais de inferência e a comparação com uma RTX 5090 e um Mac Studio para saber se esse mini-PC merece um lugar na sua casa.
Você está escolhendo uma máquina? Nossas escolhas por orçamento → · Nossa ficha NVIDIA DGX Spark →
Para este setup: NVIDIA DGX Spark.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#O que é o DGX Spark
O DGX Spark é um computador compacto construído em torno do superchip NVIDIA GB10 Grace Blackwell. Ele combina, em um mesmo chip, uma GPU Blackwell e uma CPU ARM Grace (20 núcleos), conectadas a um conjunto único de 128 GB de memória LPDDR5X compartilhada entre as duas. É essa arquitetura de memória unificada — a mesma filosofia do Apple Silicon — que torna a máquina tão interessante para a IA local.
Enquanto uma placa de vídeo tradicional mantém sua VRAM separada (no máximo 24 ou 32 GB nos modelos para consumidores), o DGX Spark permite que a GPU acesse diretamente os 128 GB. Na prática, a restrição que limita todos os usuários de GPU — «o modelo cabe na VRAM?» — quase desaparece. O fator limitante passa a ser a largura de banda da memória, e não a capacidade.
- Chip
- NVIDIA GB10 Grace Blackwell (GPU Blackwell + CPU ARM de 20 núcleos)
- Memória
- 128 GB LPDDR5X unificada, compartilhada entre CPU e GPU
- Largura de banda
- ~273 GB/s (LPDDR5X), o verdadeiro gargalo
- Rede
- ConnectX (200 GbE) para interligar dois Spark e viabilizar o uso de modelos muito grandes
- Formato
- Mini-PC de mesa, ~150 W, silencioso em comparação com um PC em torre com várias GPUs
#128 GB unificados: o que isso desbloqueia
Para dar uma referência, esta é a quantidade aproximada de VRAM necessária para um modelo com quantização Q4_K_M, a mais comum para inferência local: um 7B cabe em ~5 GB, um 14B em ~9 GB, um 32B em ~19 GB, um 70B em ~40 GB. Em uma RTX 5090 com seus 32 GB, um 70B Q4 não cabe inteiramente: é necessário transferir parte para a CPU, o que derruba a velocidade.
Com 128 GB de memória unificada, o DGX Spark carrega sem esforço um 70B em Q4, Q5 ou mesmo Q8, mantém uma margem para um contexto longo (32k tokens ou mais) e abre espaço para modelos de 100B+ parâmetros com quantização agressiva. É a classe de modelos que, até agora, exigia um Mac Studio de ponta ou um sistema multi-GPU caro e com alto consumo de energia.
- 70B Q4 (~40 GB)
- Confortável, com grande margem para o contexto
- 70B Q8 (~75 GB)
- Possível — qualidade quase FP16 em um modelo grande
- MoE tipo 120B em Q4
- Cabe na memória; a largura de banda determina a velocidade
- Vários modelos carregados
- Um 32B + um 14B em paralelo para roteamento ou multi-agente
#Quais modelos ele executa
O ponto forte do DGX Spark é a faixa de 30B a 120B, exatamente onde as GPUs de uso doméstico esbarram na falta de VRAM. Veja os usos típicos por família de modelos.
- Qwen 3.8 27B
- O principal modelo generalista de 2026 (visão, 262k ctx); nessa máquina, ele roda em Q8 com qualidade plena e ampla margem de contexto
- Qwen 3.6 35B-A3B / Qwen3-Coder 30B
- MoE rápidos para raciocínio e código, que cabem integralmente na memória mesmo em Q8
- GLM 4.7 Flash (MoE 30B-A3B, MIT)
- Excelente para agentes, carregado com qualidade plena sem malabarismos
- Grande MoE 100B+ quantizado
- As arquiteturas Mixture-of-Experts aproveitam plenamente a grande capacidade da memória unificada
- Modelos multimodais
- Gemma 4 e Qwen 3.8 (visão + texto), que exigem muita memória, cabem na memória sem concessões
Para modelos pequenos (7B–14B), o DGX Spark obviamente funciona, mas é um desperdício: uma RTX 4070 ou um Mac mini M4 roda esses modelos mais rápido por muito menos dinheiro. A máquina só se justifica se você pretende rodar modelos grandes regularmente.
#Desempenho real em inferência
Duas medidas contam na inferência local: a velocidade de geração (tokens por segundo, o que vai aparecendo na tela) e o tempo de pré-preenchimento (o intervalo até o primeiro token, que depende do comprimento do prompt). A largura de banda da memória influencia sobretudo a geração.
No DGX Spark, um modelo 70B em Q4 normalmente gera na ordem de dez tokens por segundo — o suficiente para usá-lo confortavelmente como assistente, lendo à medida que o texto é gerado, mas menos adequado para cargas de trabalho em lote que exigem alta taxa de processamento. Modelos menores (14B–32B) atingem velocidades bem mais altas. Esse perfil é coerente com uma largura de banda de aproximadamente 273 GB/s: esse é o limite que separa o DGX Spark das placas GDDR7, muito mais rápidas nesse aspecto.
#DGX Spark vs RTX 5090
É a comparação mais ilustrativa e contrapõe duas filosofias. A RTX 5090 oferece 32 GB de VRAM GDDR7 com cerca de 1.792 GB/s de largura de banda: aproximadamente seis a sete vezes mais rápida que o DGX Spark no acesso à memória. Para tudo o que cabe nos seus 32 GB, a 5090 pulveriza o Spark em tokens por segundo.
Mas a 5090 esbarra em um limite claro: acima de ~32 GB, ela precisa transferir parte do processamento para a CPU, e seu desempenho despenca. Um 70B Q4 (~40 GB) não cabe inteiramente nela. Já o DGX Spark roda esse mesmo 70B sem dificuldade — mais lentamente, mas com o modelo inteiro na memória. A escolha se resume a uma pergunta: sua carga de trabalho cabe em menos de 32 GB?
- Você não ultrapassa 32 GB (até ~32B Q4)
- RTX 5090: muito mais rápida e versátil (jogos, renderização, CUDA)
- Você busca modelos de 70B ou maiores
- DGX Spark: o modelo cabe na memória onde a 5090 não dá conta
- Consumo / ruído
- DGX Spark: ~150 W e silencioso, em comparação com uma torre com 5090 quente e barulhenta
- Ecossistema CUDA completo
- Os dois; o Spark adiciona o stack DGX/NVIDIA de ponta a ponta
#DGX Spark vs Mac Studio
O verdadeiro concorrente do DGX Spark não é uma placa de vídeo, é o Mac Studio. Os dois compartilham a mesma ideia — grande quantidade de memória unificada em um gabinete compacto e discreto — e visam o mesmo público: desenvolvedores que querem modelos grandes rodando localmente sem montar uma máquina.
O Mac Studio (M-Ultra) pode atingir até 512 GB de memória unificada com uma largura de banda frequentemente superior nas configurações de alto desempenho, o que o torna poderoso em modelos muito grandes. Seu ponto forte: macOS, Metal e um ecossistema maduro (Ollama, LM Studio, MLX). O ponto forte do DGX Spark: suporte nativo ao CUDA. Se o seu pipeline depende de bibliotecas CUDA, TensorRT ou de ferramentas NVIDIA, o Spark fala nativamente a mesma língua que seus servidores de produção.
- Memória máxima
- Mac Studio até 512 GB; DGX Spark 128 GB (extensível ao conectar 2 unidades)
- Ecossistema de software
- Mac: Metal/MLX maduros; Spark: CUDA nativo, continuidade com os servidores NVIDIA
- Portabilidade do código de IA
- O Spark executa sem dificuldade código escrito para GPUs NVIDIA na nuvem ou em datacenters
- Uso em tarefas de escritório
- O Mac Studio é um computador de trabalho completo; o Spark é uma estação de IA dedicada
#Instalar o Ollama nele
O DGX Spark roda sobre uma base Linux (DGX OS, derivado do Ubuntu), com a stack CUDA pré-instalada. O Ollama funciona nele como em qualquer máquina Linux com GPU NVIDIA: o daemon detecta a GPU e disponibiliza os modelos na porta habitual.
- 01Instalar OllamaScript oficial em um único comando. Ele configura o serviço systemd e detecta automaticamente a GPU Blackwell via CUDA.
- 02Verificar a detecção da GPUConfirme que a GPU está sendo detectada antes de iniciar um modelo grande; caso contrário, a inferência seria executada na CPU.
- 03Baixar um modelo grandeBaixe um modelo MoE grande de 2026 em qualidade máxima (um Qwen3-Coder 30B em Q8, ou o carro-chefe Qwen 3.8 27B e seu contexto de 262k) para aproveitar a memória — esse é precisamente o caso de uso da máquina.
- 04Iniciar e conectar uma interfaceO daemon escuta por padrão em http://localhost:11434; configure o Open WebUI ou o LM Studio para apontar para esse endereço.
O daemon Ollama expõe uma API compatível na porta 11434. Para explorar a memória, prefira modelos que os GPUs clássicos não conseguem carregar sozinhos e aumente a janela de contexto, já que você tem espaço disponível. Observe que Qwen 3.8 27B tende a refletir demais com sua configuração padrão de raciocínio: mude para o modo baixo (low) para respostas mais diretas.
#Um chip, oito máquinas: clones certificados
A NVIDIA fez do GB10 uma plataforma: além do seu DGX Spark Founders Edition, sete fabricantes vendem a mesma base certificada sob suas próprias marcas. Mesmo chip, mesmos 128 GB — as diferenças estão no armazenamento, no gabinete, no preço e no canal de venda.
| Máquina | Fabricante | Para lembrar |
|---|---|---|
| DGX Spark Founders Edition | NVIDIA | A referência, ~$ 3.999 |
| Ascent GX10 | Asus | O melhor em termos de preço (~2 999 $) |
| Veriton GN100 | Acer | SKU único com 4 TB de armazenamento |
| AI TOP ATOM | Gigabyte | Inclui a suíte de software AI TOP |
| EdgeXpert MS-C931 | MSI | Canal industrial/edge |
| Pro Max GB10 | Dell | Canal empresarial |
| ThinkStation PGX | Lenovo | Canal de workstation |
| ZGX Nano | HP | Canal de workstation |
Detalhe que muda tudo para modelos grandes: a porta ConnectX integrada permite conectar duas unidades e executar modelos da classe 400B localmente. Nenhuma outra máquina voltada ao público geral oferece isso.
#Perguntas frequentes
O que é exatamente o GB10 do DGX Spark?+
Qual a diferença entre o DGX Spark e seus clones da Asus, Acer ou Gigabyte?+
É possível realmente rodar um modelo de 400B com duas máquinas?+
DGX Spark ou máquina Strix Halo?+
Para quem é uma máquina GB10?+
#Para quem esse formato faz sentido
O DGX Spark não é uma máquina para o público em geral. Ele é útil sobretudo para perfis específicos para os quais a limitação de VRAM é o verdadeiro problema do dia a dia.
- Desenvolvedores de IA com CUDA
- Prototipar localmente código destinado às GPUs NVIDIA de produção, sem surpresas de portabilidade
- Pesquisadores e equipes de P&D
- Fine-tuning leve e inferência de modelos grandes sem reservar tempo de GPU na nuvem
- Usuários avançados do 70B+
- Quem esbarra constantemente no limite de 24–32 GB de uma placa para o mercado de consumo
- Escritórios sensíveis ao ruído/consumo
- Uma estação silenciosa e de baixo consumo, em vez de um rig com múltiplas GPUs
Por outro lado, se você joga, se roda principalmente modelos ≤ 32B ou se seu orçamento é apertado, uma RTX 5090 (ou até uma 4070/4080) ou um Mac mini M4 oferecerá uma relação desempenho/preço muito melhor. O DGX Spark se justifica quando a necessidade de uma grande capacidade de memória tem prioridade sobre a taxa de transferência bruta.
#Para se aprofundar
É mais fácil avaliar o DGX Spark comparando-o com as alternativas já abordadas no site. Estes guias dão continuidade à reflexão:
- Qual LLM na RTX 5090 (32 GB)?
- O comparativo detalhado da placa mais rápida voltada ao consumidor, para avaliar o equilíbrio entre taxa de processamento e capacidade.
- Qual LLM no Mac Studio?
- A outra grande máquina com memória unificada, até 512 GB — o verdadeiro concorrente do DGX Spark.
- Escolher sua GPU para IA local
- Para dimensionar sua necessidade de VRAM antes de gastar e ver onde cada opção se encaixa.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.