DeepSeek V4 Pro vs Flash: qual versão para uso local ?
DeepSeek V4 Pro e DeepSeek V4 Flash saíram no mesmo dia, sob a mesma licença MIT, com a mesma arquitetura MoE. E ainda assim: 1,6T de parâmetros contra 284B, 960 GB de VRAM em Q4 contra 170 GB, um cluster H200 contra um Mac Studio. A escolha entre os dois não é uma questão de qualidade — é uma questão de hardware e de uso. Este comparativo para decidir entre DeepSeek V4 Pro e Flash em execução local ajuda você a escolher antes de baixar 960 GB à toa.
#Pro e Flash: o que realmente os diferencia
Os dois modelos compartilham o essencial: arquitetura MoE com atenção híbrida CSA+HCA, contexto nativo de 1M tokens, três modos de raciocínio (Non / High / Max), licença MIT permissiva, pré-treinamento Muon+FP4. A diferença está em um único número: o tamanho do pool de especialistas.
- V4 Pro
- 1,6T de parâmetros totais, 49B ativos por token, 256 especialistas top-8. Modelo de fronteira completo.
- V4 Flash
- 284B parâmetros totais, 13B ativos por token, 64 especialistas top-8. A mesma arquitetura, compactada.
- O que é idêntico
- Vocabulário, tokenizer, template de chat, modos de raciocínio, comprimento do contexto (1M), licença MIT, scripts de instalação do llama.cpp / vLLM.
- O que realmente muda
- VRAM total, taxa de tokens por segundo, pontuação em benchmarks de raciocínio extremo (AIME, GPQA Max). Em tarefas do dia a dia, a diferença é menor do que se esperava.
#1. Patamares de VRAM, versão por versão
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
É esse critério que decide quase tudo. Aqui estão os limites medidos em VRAM total, modelo carregado + cache KV de 32k tokens (não 1M):
#DeepSeek V4 Pro 1.6T
- Q8_0
- ≈ 1 800 GB. Cluster 8× H200 141GB obrigatório. Nenhum cenário local de máquina única.
- Q5_K_M
- ≈ 1 230 GB. 3 Mac Studio 512 GB em swarm RPC, ou 4× H200.
- Q4_K_M (recomendado)
- ≈ 1 040 GB. 8× A100 80GB em paralelismo tensorial, ou 2× Mac Studio 512 GB em swarm de rede com llama.cpp.
- IQ3_M
- ≈ 800 GB. Um único Mac Studio de 512 GB + offload parcial para SSD. Muito lento (~2-4 tok/s), qualidade degradada.
- IQ2_XS
- ≈ 560 GB. Um único Mac Studio de 512 GB. Qualidade fortemente degradada — não recomendado.
#DeepSeek V4 Flash 284B
- FP16
- ≈ 570 GB. Cluster H100/H200 ou Mac Studio 512 + workstation NVIDIA em swarm.
- Q8_0
- ≈ 305 GB. Mac Studio M3 Ultra de 512 GB sozinho, ou 4× RTX 6000 Ada de 48 GB.
- Q5_K_M
- ≈ 210 GB. Mac Studio Ultra 256 GB (no limite), ou 3× RTX 4090 24GB + offload.
- Q4_K_M (recomendado)
- ≈ 170 GB. Um único Mac Studio M2 Ultra de 192 GB, 2× A6000 de 48 GB ou 4× RTX 4090 de 24 GB.
- IQ3_M
- ≈ 130 GB. 2× RTX 4090 de 24 GB + transferência parcial para a RAM, ou Mac Studio de 128 GB.
#2. Custo real de GPU por versão
Os números abaixo são orçamentos de compra de equipamentos, excluindo energia, com base nos preços de maio de 2026.
#Para rodar o V4 Pro (Q4 ~1 040 GB)
- Cluster 8× H200 141GB
- ≈ 280.000 € de equipamento + servidor ≈ 320.000 € instalado. O setup vLLM "limpo" com suporte nativo ao FP8.
- Cluster de 8× A100 80GB usadas
- ≈ 90 000 € em hardware + chassi ≈ 110 000 €. Paralelismo tensorial em 640 GB de VRAM. Mais acessível, mas mais lento.
- Swarm 2× Mac Studio M3 Ultra 512 GB
- ≈ 28.000 € aos preços de maio de 2026 (o M3 Ultra não é mais vendido novo; M5 Ultra de 512 GB anunciado no final de outubro de 2026). A opção local mais barata para Pro Q4. Taxa de geração modesta (5–8 tok/s), mas real, via llama.cpp RPC em 10 GbE.
- Locação equivalente na nuvem
- ≈ 60 €/h na Lambda/Crusoe para 8× H200. Torna-se rentável em comparação com a compra acima de ~5.500 horas acumuladas.
#Para rodar V4 Flash (Q4 ~170 GB)
- Mac Studio M2 Ultra 192 GB
- ≈ 4 200 € recondicionado (não é mais vendido novo). Caminho mais curto sozinho.
- Mac Studio M3 Ultra 256 GB
- Não é mais vendido novo pela Apple (substituído pelo M5 Ultra, disponível em 256 GB); procurar usado, com preço variável. Margem mais confortável para contexto longo e modo thinking Max.
- Estação de trabalho com 4× RTX 4090 de 24 GB
- GPU usada (RTX 4090, preço variável) + ≈ 4.500 € (gabinete/fonte de alimentação/CPU). CUDA puro, vLLM possível.
- 2× RTX 6000 Ada 48GB
- Preço a verificar (placa profissional cujo preço não é acompanhado). Configuração mais organizada que 4× 4090, menos barulhenta.
- Locação equivalente na nuvem
- ≈ 4 €/h no Hyperstack/Lambda para 4× A100 80GB. Rentável em relação ao Mac Studio a partir de ~1 600 horas acumuladas.
#3. Latência e taxa de transferência comparadas
Aqui estão os números medidos em modo thinking, não, contexto 8k, prompt 500 tokens, geração 1000 tokens. Medidas provenientes do paper DeepSeek + benchmarks comunitários de maio de 2026.
#V4 Pro Q4_K_M
- Cluster 8× H200 (vLLM FP8)
- TTFT ~0,8s · taxa 38 tok/s · 1000 tokens em ~27s.
- Cluster com 8× A100 80GB (vLLM Q4)
- TTFT ~1,4s · taxa 22 tok/s · 1000 tokens em ~47s.
- Swarm 2× Mac Studio M3 Ultra 512 (llama.cpp RPC)
- TTFT ~6 s · taxa de geração de 6 tok/s · 1000 tokens em ~3 min. O impacto da rede no RPC predomina.
#V4 Flash Q4_K_M
- Mac Studio M3 Ultra 256 GB (MLX)
- TTFT ~0,4s · taxa 28 tok/s · 1000 tokens em ~36s. O ponto ideal para uso solo.
- Mac Studio M2 Ultra 192 GB (llama.cpp)
- TTFT ~0,6s · taxa 14 tok/s · 1000 tokens em ~72s.
- 4× RTX 4090 24GB (vLLM)
- TTFT ~0,3s · taxa 52 tok/s · 1000 tokens em ~19s. O mais rápido localmente.
- 2× A6000 48GB (vLLM)
- TTFT ~0,4s · taxa 38 tok/s · 1000 tokens em ~26s.
#4. Árvore de decisão com base no seu hardware
Cinco perguntas, um veredito. Leia de cima para baixo e pare na primeira resposta.
- 01Orçamento para GPUs > 200.000 € e necessidade de desempenho de ponta sem concessões?→ DeepSeek V4 Pro Q4 no cluster com 8× H200 ou 8× A100. Se você é um banco, um laboratório ou uma administração soberana, esse é o único cenário em que Pro faz sentido.
- 02Você possui ou planeja adquirir 2× Mac Studio M3 Ultra 512 GB (preço variável, verificar) e aceita 5-8 tok/s?→ V4 Pro Q4 via llama.cpp RPC é possível. Reserve isso para processamento em lote noturno, nunca para uso interativo. Caso contrário, avance para a próxima etapa.
- 03Você tem um Mac Studio Ultra topo de linha (as opções de memória são diferentes hoje; o preço precisa ser verificado)?→ V4 Flash Q4 em MLX ou llama.cpp. 12-28 tok/s conforme a geração. Melhor experiência individual em 2026.
- 04Você tem 2 a 4 GPUs NVIDIA que totalizam mais de 80 GB de VRAM?→ V4 Flash Q4 com vLLM (preferível) ou llama.cpp. Taxa de geração superior à do Mac Studio, mas com mais ruído, maior consumo de eletricidade e mais espaço ocupado.
- 05Você tem menos de 80 GB de VRAM (uma única RTX 4090, por exemplo)?→ Nem Pro nem Flash em Q4. Confira as destilações Flash→32B previstas, ou use DeepSeek V3.5 32B / Qwen3.6 35B-A3B como alternativa enquanto isso.
#5. Para que uso escolher um ou outro?
Os benchmarks públicos não dizem tudo. Aqui está a avaliação honesta por categoria de uso.
- Assistente de chat de uso geral, tradução, resumo
- Flash é mais do que suficiente. A diferença em relação ao Pro nesses casos é de 2 a 4 pontos e é imperceptível na prática. Priorize a velocidade de geração.
- Código (geração, refatoração, depuração)
- Flash no modo High é muito próximo de Pro Non. Para depuração complexa, Pro Max mantém a vantagem — mas você precisa esperar 10 minutos por resposta.
- Matemática, demonstração, AIME/GPQA
- Pro Max supera o Flash Max em 8 a 15 pontos, dependendo da dificuldade. É nesse uso que o Pro realmente se justifica.
- Análise de documentos longos (>200k tokens)
- Empate técnico (ambos suportam 1M de tokens). A diferença é dominada pela atenção CSA, idêntica nos dois. Escolher de acordo com a VRAM disponível para o cache KV.
- Agentes com chamada de ferramenta
- Flash é suficiente. A chamada de ferramentas é controlada pelo template de chat e pelo fine-tune Instruct, não pelo tamanho do modelo.
- Fine-tuning local (LoRA)
- Flash é viável em 2× H100. Pro está fora do alcance para treinamento local com LoRA — é necessário um cluster de treinamento.
#Dicas e armadilhas
- Quantização do cache KV
- Nos dois modelos, --cache-type-k q8_0 --cache-type-v q8_0 (llama.cpp) ou --kv-cache-dtype fp8 (vLLM), dividem por 2 a memória KV com perda de qualidade quase nula. Essencial acima de 64k de contexto.
- Flash Attention obrigatório
- Ative -fa (llama.cpp) ou --enable-flash-attn (vLLM). Sem isso, a taxa de processamento cai 30% e o consumo de memória dispara acima de 32k.
- Modo thinking padrão
- Nos dois modelos, nunca deixe o modo Max ativado por padrão — um agente que entra em loop pode gerar horas de reflexão. Ative ou desative esse modo explicitamente via /think ou /think_max.
- Multi-GPU no Pro: evitar o paralelismo de pipeline
- No cluster H200, paralelismo de tensor em 8 GPUs. O paralelismo de pipeline adiciona latência entre camadas que domina no MoE 1.6T. O vLLM trata isso automaticamente com --tensor-parallel-size 8.
- Swarm Mac Studio: 10 GbE mínimo
- O RPC do llama.cpp transmite muitos tensores intermediários. Em 1 GbE, a taxa de geração do Pro cai abaixo de 1 tok/s. Planeje usar um switch de 10 GbE e cabos SFP+.
- Templates de chat estritamente iguais
- Pro e Flash compartilham o mesmo formato. Um script que funciona para um funciona para o outro — útil para testes A/B sem precisar reescrever o código da sua aplicação.
#Para se aprofundar
Depois de escolher a versão, veja os guias de implementação:
- DeepSeek V4 Pro 1.6T : arquitetura, instalação, benchmarks
- O guia de instalação em cluster para quem decidiu optar pelo Pro.
- DeepSeek V4 Flash 284B: o primeiro modelo de ponta que cabe em um Mac Studio
- Instalação passo a passo no Mac Studio Ultra e benchmarks detalhados.
- Qual LLM no Mac Studio (M2/M3/M4 Ultra, 64–512 GB)?
- Para dimensionar a configuração do Mac Studio de acordo com seu orçamento.
- Configuração multi-GPU com llama.cpp
- Referência para conectar 2 a 4 GPUs NVIDIA localmente sem perder tokens por segundo.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.