Intermediário 14 minDeepSeek

DeepSeek V4 Flash 284B : o 1º frontier que funciona no Mac Studio

DeepSeek V4 Flash 284B foi lançado em 24 de abril de 2026 ao mesmo tempo que o V4 Pro. É a variante "efficient": 284 bilhões de parâmetros totais em MoE (13B ativos por token), licença MIT, contexto de 1M tokens, mesma arquitetura CSA+HCA e os mesmos 3 modos de raciocínio do Pro. Sobretudo, é o primeiro modelo de fronteira que cabe em uma única estação de trabalho: 170 GB em Q4 — um Mac Studio M3 Ultra de 256 GB é suficiente. Este guia explica como instalá-lo e como ele se sai.

Por Mohamed Meguedmi·Atualização 2026-08-11·Testado no Windows, macOS e Linux

#DeepSeek V4 Flash em resumo

Data de lançamento
24 de abril de 2026, com lançamento simultâneo ao do V4 Pro. Disponível no HuggingFace: deepseek-ai/DeepSeek-V4-Flash.
Arquitetura
MoE com 284B no total, 13B ativos por token. 128 especialistas por camada, roteamento top-8. Variantes Base + Instruct disponíveis.
Inovações herdadas do Pro
Atenção CSA+HCA, mHC, otimizador Muon, treinamento misto FP4+FP8.
Contexto
1 milhão de tokens nativos (igual ao Pro).
Modos de pensamento
3 níveis Non / High / Max — alternáveis no prompt.
Licença
MIT, igual ao Pro. Sem restrições ao uso comercial nem restrições geográficas.

#1. Por que isso é um marco

Antes de 24 de abril de 2026, rodar um modelo de fronteira localmente exigia ou um cluster de GPU com custo de 80 k€+, ou aceitar uma qualidade degradada de um modelo de 70B. DeepSeek V4 Flash muda isso: 170 GB em Q4 cabem em configurações de 4 a 8 k€ de segunda mão.

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias
Mac Studio M3 Ultra 256 GB
7.299 € no catálogo até setembro de 2026, agora disponível usado (o M5 Ultra de 256 GB o substitui na Apple). 170 GB para o modelo + 30 GB para o contexto = cabe com folga. ~10-12 tok/s em Q4.
2× RTX 5090 32 GB (64 GB VRAM)
≈ 11 400 €. Insuficiente — faltam ~110 GB. Possível com offload para a CPU, mas lento (3-5 tok/s).
4× RTX A6000 48 GB (192 GB VRAM)
~12.000 € no mercado de usados. O modelo cabe com folga, ~18-25 tok/s.
Workstation 2× Mac Studio Max 64 GB
Insuficiente isoladamente. Com llama.cpp RPC swarm e 4× Mac Studio: possível, ~5 tok/s.
→
A verdadeira singularidade: Mac Studio Ultra
O M3 Ultra 256 GB (7.299 € no catálogo até setembro de 2026, agora disponível de segunda mão) executa DeepSeek V4 Flash Q4 a ~10 tok/s no modo de chat. Nenhuma outra máquina pessoal no mundo, por esse preço, executa um modelo de fronteira. É o Apple Silicon que torna isso possível (memória unificada + largura de banda de 800 GB/s).

#2. Arquitetura (variante eficiente de V4)

V4 Flash é uma redução proporcional do V4 Pro: ~5,7× menos especialistas, ~3,8× menos parâmetros ativos, mas com o mesmo esqueleto CSA+HCA + Muon + FP4/FP8. É essa homogeneidade que permite que o V4 Flash herde a qualidade do Pro com um custo muito menor.

Especialistas por camada
128 (vs 256 para Pro). Roteamento Top-8 idêntico.
Parâmetros ativos
13B (vs 49B para o Pro). Velocidade de inferência ~3,8× maior com o mesmo número total de parâmetros.
Camadas
61 (Pro: 76). Redução moderada para preservar a profundidade de raciocínio.
Cabeças de atenção
Igual ao Pro (CSA+HCA configurados de forma idêntica). Sem reduzir os recursos dedicados à atenção para preservar a qualidade em contextos longos.
Pré-treinamento
Foco em « raciocínio eficiente »: 18T tokens (vs 32T para Pro), com mistura de dados otimizada para matemática + código.

#3. Hardware por quantização

VRAM total necessária (modelo + cache KV de 32k tokens)
QuantizationVRAM do modelo+ KV 32kConfigurações recomendadas
FP16 (referência)568 GB~620 GBDC: 4× H200 141GB. Local impraticável.
Q8_0305 GB~340 GBMac Studio M3 Ultra 512 GB ou 8× RTX 4090 24GB.
Q5_K_M205 GB~235 GBMac Studio Ultra com 256 GB (no limite); 4× RTX A6000 48GB com folga.
Q4_K_M170 GB~200 GBMac Studio Ultra 256 GB, 4× RTX 4090 24GB, 2× RTX 6000 Ada 48GB.
IQ3_M (comprimido)130 GB~160 GBMac Studio M2 Ultra 192 GB, 4× RTX 4090 (offload leve).
IQ2_XS (extremo)85 GB~115 GBRTX 5090 + 64 GB de RAM DDR5 para offload, ou 2× RTX 4090.
i
Ponto ideal 2026
O Mac Studio M3 Ultra 256 GB em Q4_K_M oferece o melhor equilíbrio entre preço, qualidade e velocidade para uso pessoal sério. 7.300 € novo até setembro de 2026 (agora usado, ou M5 Ultra 256 GB novo), ~10 tok/s, qualidade quase FP16 (Q4 perde <2 % nos benchmarks nessa escala). Não há equivalente entre os PCs sem ultrapassar 12.000 €.

#4. Configuração do Mac Studio Ultra com 256/512 GB

Instalação completa no Mac Studio M3 Ultra
# 1. Relever la mémoire GPU allouable
sudo sysctl iogpu.wired_limit_mb=240640    # 256 Go : 235 Go GPU
# Ou pour Mac Studio 512 Go :
# sudo sysctl iogpu.wired_limit_mb=491520

# Persistant
echo "iogpu.wired_limit_mb=240640" | sudo tee -a /etc/sysctl.conf

# 2. llama.cpp avec Metal + Flash Attention
git clone https://github.com/ggerganov/llama.cpp && cd llama.cpp
make GGML_METAL=1 LLAMA_METAL_EMBED_LIBRARY=1

# 3. Téléchargement Q4_K_M (~170 Go split en chunks)
huggingface-cli download deepseek-ai/DeepSeek-V4-Flash-GGUF \
  --include "*Q4_K_M*.gguf" \
  --local-dir ./models

# 4. Lancement avec optimisations max
./build/bin/llama-server \
  -m ./models/DeepSeek-V4-Flash-Q4_K_M-00001-of-00004.gguf \
  -ngl 99 -fa \
  -ctk q8_0 -ctv q8_0 \
  -c 65536 \
  --host 0.0.0.0 --port 8080
→
Depois de iniciado
O servidor expõe uma API compatível com a OpenAI em http://localhost:8080. Conecte a ela Open WebUI, Continue.dev, Aider e Raycast AI — todos funcionarão com seu modelo de fronteira local.

#5. Configuração multi-GPU NVIDIA

#Opção A — vLLM 4× RTX A6000 (48 GB × 4 = 192 GB)

vLLM tensor-parallel
pip install vllm>=0.7

vllm serve deepseek-ai/DeepSeek-V4-Flash \
  --tensor-parallel-size 4 \
  --quantization fp8 \
  --max-model-len 1000000 \
  --enable-prefix-caching \
  --port 8000

#Opção B — llama.cpp com offload parcial

2× RTX 5090 + offload CPU
./build/bin/llama-server \
  -m ./models/DeepSeek-V4-Flash-Q4_K_M-00001-of-00004.gguf \
  -ngl 50 \
  --tensor-split 0.5,0.5 \
  -ctk q8_0 -ctv q8_0 \
  -c 32768
!
Offload = lento
Tudo que não cabe na VRAM passa para a RAM do sistema (DDR5 a ~80 GB/s vs HBM3 a 1 TB/s). Com 50% transferidos para a RAM do sistema, a velocidade cai para 3-5 tok/s. Para uso interativo, procure manter 100% na VRAM.

#6. Benchmarks e tokens por segundo medidos

Benchmarks publicados pela DeepSeek (24 de abril de 2026), valores no modo High
BenchmarkV4 FlashV4 ProLlama 4 Scout 109BMistral Large 2
MMLU-Pro79.484.276.875.3
GPQA Diamond70.178.563.259.4
AIME 202576.587.061.352.1
LiveCodeBench v572.679.865.461.8
LongBench v2 (1M)68.972.6——
Tokens por segundo medidos (chat, contexto 4k, Q4_K_M)
SetupTok/s no modo NonTok/s no modo HighTok/s no modo Max
Mac Studio M3 Ultra 256 GB10-128-105-7
Mac Studio M3 Ultra 512 GB12-1410-127-9
4× RTX A6000 48GB20-2516-2012-15
2× RTX 5090 + 64GB offload3-52-41-2

#7. Modos de raciocínio e contexto longo

O V4 Flash herda os três modos de raciocínio do V4 Pro com qualidade ligeiramente inferior, mas com custo de inferência muito menor. É uma boa escolha para agentes que precisam raciocinar sem monopolizar uma infraestrutura.

Modo Non
Resposta direta. Latência muito baixa (~1s para iniciar o streaming). Para chat conversacional, tradução.
Modo High
200 a 2000 tokens de cadeia de raciocínio antes da resposta. +25% de qualidade em matemática/código. Latência de 5 a 15 segundos antes do primeiro token da resposta final.
Modo Max
Até 16k tokens de reflexão. Latência de 1 a 5 minutos em execução local. Reservar para problemas difíceis (provas matemáticas, depuração complexa).
Contexto longo 1M
Mesmas capacidades do V4 Pro graças ao HCA — Needle-in-Haystack 1M ~95 % (vs 98 % para Pro). Excelente para RAG em grandes bases.

#V4 Flash vs V4 Pro: escolher

Comparação sintética
CritérioV4 Flash 284BV4 Pro 1.6T
Parâmetros totais284 B1 600 B
Parâmetros ativos / token13 B49 B
VRAM Q4_K_M170 GB960 GB
Hardware mínimo localMac Studio Ultra 256 GB (M3 Ultra de segunda mão ou M5 Ultra novo)Cluster ~80.000 €
Tokens por segundo típicos em execução local10-250,5-2
Qualidade MMLU-Pro79.484.2
Qualidade AIME 202576.587.0
Contexto nativo1 M1 M
Modo thinking maxSimSim (melhor qualidade)
LicençaMITMIT
→
Quando escolher Flash, quando escolher Pro
V4 Flash : 95 % dos casos — chat, código, RAG, agentes, contexto longo. O único modelo de fronteira que cabe em uma workstation. V4 Pro: pesquisa pura (matemática, demonstrações, AIME competitivo), workflows onde a qualidade máxima importa mais do que a latência e o custo de hardware.

#Oficializado em 31 de julho de 2026 (build 0731)

A DeepSeek tirou o V4-Flash da fase de prévia no final de julho de 2026 com o build “0731”: API em beta pública e, ao mesmo tempo, o preço dos tokens de saída do V4-Pro cai 75% (US$ 0,87 por milhão de tokens de saída). A Artificial Analysis volta a colocar a família V4 “entre os líderes de pesos abertos”. Quanto aos pesos, nada muda: 284B no total, com 13B ativos — ainda a única variante V4 minimamente viável para execução local em hardware de ponta (Mac de 256 GB, Strix Halo, múltiplas GPUs), com quantização agressiva.

Desde 2 de agosto, o LM Studio também o oferece: localmente, se sua máquina tiver capacidade suficiente, ou pelo app Bionic em servidores americanos com «Zero Data Retention» por padrão — uma concessão que é preciso conhecer, mesmo que a filosofia deste site continue sendo 100% local.

#FAQ

DeepSeek V4 Flash realmente roda no Mac Studio M3 Ultra com 256 GB?+
Sim, em Q4_K_M: 170 GB para o modelo + 30 GB para o contexto de 32k + 8 GB para o sistema = ~210 GB, dentro dos 256 GB. Velocidade medida: 10-12 tok/s no modo Non, 8-10 no High. É o único Mac capaz de fazer isso em uma única máquina em abril de 2026.
Quanto custa uma configuração viável para executar V4 Flash localmente?+
Três orçamentos: (1) Mac Studio Ultra 256 GB — M3 Ultra de segunda mão (7.300 € novo até setembro de 2026) ou M5 Ultra novo. (2) ~12.000 € — 4× RTX A6000 48GB de segunda mão + workstation. (3) ≈ 11.400 € — 2× RTX 5090 + 64 GB DDR5 + offload, mas lento (3-5 tok/s).
É melhor escolher V4 Flash ou esperar uma versão destilada de 70B?+
O DeepSeek anunciou distilações de 70B e 32B em 4 a 6 semanas. Se você não tiver um Mac Studio Ultra ou um cluster de GPUs, esperar faz sentido. Se já tem, a V4 Flash agora >> distilação de 70B em 5 semanas (qualidade superior e contexto de 1M).
O V4 Flash supera o Llama 4 Maverick / Scout?+
Nos benchmarks publicados pela DeepSeek: sim, em todos (MMLU-Pro 79.4 vs 76.8 para o Scout, GPQA 70.1 vs 63.2). Confirmação independente esperada dentro de 2 semanas via Chatbot Arena. Vantagem clara do V4 Flash: contexto nativo de 1M, enquanto o Llama 4 fica em 256k.
Qual é o consumo elétrico de um Mac Studio M3 Ultra em inferência V4 Flash?+
Pico ~150 W durante a geração, ~30 W em repouso após o carregamento. Em 8 horas de uso ativo: ~1,2 kWh = ~0,30 €/dia (FR 2026). Uma lâmpada LED consome mais em modo de espera.
O modo thinking Max vale a pena no V4 Flash?+
No Mac Studio: sim para problemas difíceis (matemática, demonstrações, depuração), mas conte com 1 a 5 minutos por resposta. No uso normal de chat, o modo High é mais do que suficiente (8 a 10 tok/s, qualidade ~Mistral Large × 2).
É possível fazer fine-tuning do V4 Flash localmente?+
LoRA / QLoRA: sim, no Mac Studio Ultra de 512 GB via MLX-LM (suporte a verificar conforme a versão instalada) ou unsloth (NVIDIA, no mínimo 4× A6000). Fine-tuning completo: inviável localmente — custo estimado de treinamento de 200–400 mil dólares na nuvem.
Existe uma versão quantizada Q4 estável em 25 de abril de 2026?+
As versões quantizadas oficiais GGUF Q4_K_M e Q5_K_M serão lançadas neste fim de semana (26-27 de abril) no HuggingFace. Versões quantizadas AWQ para vLLM: já disponíveis (deepseek-ai/DeepSeek-V4-Flash-AWQ). Siga @DeepSeek_AI no X para acompanhar os anúncios.

Os preços mudam rápido: nosso monitoramento registra toda segunda e quinta-feira o menor preço das placas de vídeo para IA local, com o preço por GB de VRAM.

Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.