DeepSeek V4 Flash 284B : o 1º frontier que funciona no Mac Studio
DeepSeek V4 Flash 284B foi lançado em 24 de abril de 2026 ao mesmo tempo que o V4 Pro. É a variante "efficient": 284 bilhões de parâmetros totais em MoE (13B ativos por token), licença MIT, contexto de 1M tokens, mesma arquitetura CSA+HCA e os mesmos 3 modos de raciocínio do Pro. Sobretudo, é o primeiro modelo de fronteira que cabe em uma única estação de trabalho: 170 GB em Q4 — um Mac Studio M3 Ultra de 256 GB é suficiente. Este guia explica como instalá-lo e como ele se sai.
#DeepSeek V4 Flash em resumo
- Data de lançamento
- 24 de abril de 2026, com lançamento simultâneo ao do V4 Pro. Disponível no HuggingFace: deepseek-ai/DeepSeek-V4-Flash.
- Arquitetura
- MoE com 284B no total, 13B ativos por token. 128 especialistas por camada, roteamento top-8. Variantes Base + Instruct disponíveis.
- Inovações herdadas do Pro
- Atenção CSA+HCA, mHC, otimizador Muon, treinamento misto FP4+FP8.
- Contexto
- 1 milhão de tokens nativos (igual ao Pro).
- Modos de pensamento
- 3 níveis Non / High / Max — alternáveis no prompt.
- Licença
- MIT, igual ao Pro. Sem restrições ao uso comercial nem restrições geográficas.
#1. Por que isso é um marco
Antes de 24 de abril de 2026, rodar um modelo de fronteira localmente exigia ou um cluster de GPU com custo de 80 k€+, ou aceitar uma qualidade degradada de um modelo de 70B. DeepSeek V4 Flash muda isso: 170 GB em Q4 cabem em configurações de 4 a 8 k€ de segunda mão.
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
- Mac Studio M3 Ultra 256 GB
- 7.299 € no catálogo até setembro de 2026, agora disponível usado (o M5 Ultra de 256 GB o substitui na Apple). 170 GB para o modelo + 30 GB para o contexto = cabe com folga. ~10-12 tok/s em Q4.
- 2× RTX 5090 32 GB (64 GB VRAM)
- ≈ 11 400 €. Insuficiente — faltam ~110 GB. Possível com offload para a CPU, mas lento (3-5 tok/s).
- 4× RTX A6000 48 GB (192 GB VRAM)
- ~12.000 € no mercado de usados. O modelo cabe com folga, ~18-25 tok/s.
- Workstation 2× Mac Studio Max 64 GB
- Insuficiente isoladamente. Com llama.cpp RPC swarm e 4× Mac Studio: possível, ~5 tok/s.
#2. Arquitetura (variante eficiente de V4)
V4 Flash é uma redução proporcional do V4 Pro: ~5,7× menos especialistas, ~3,8× menos parâmetros ativos, mas com o mesmo esqueleto CSA+HCA + Muon + FP4/FP8. É essa homogeneidade que permite que o V4 Flash herde a qualidade do Pro com um custo muito menor.
- Especialistas por camada
- 128 (vs 256 para Pro). Roteamento Top-8 idêntico.
- Parâmetros ativos
- 13B (vs 49B para o Pro). Velocidade de inferência ~3,8× maior com o mesmo número total de parâmetros.
- Camadas
- 61 (Pro: 76). Redução moderada para preservar a profundidade de raciocínio.
- Cabeças de atenção
- Igual ao Pro (CSA+HCA configurados de forma idêntica). Sem reduzir os recursos dedicados à atenção para preservar a qualidade em contextos longos.
- Pré-treinamento
- Foco em « raciocínio eficiente »: 18T tokens (vs 32T para Pro), com mistura de dados otimizada para matemática + código.
#3. Hardware por quantização
| Quantization | VRAM do modelo | + KV 32k | Configurações recomendadas |
|---|---|---|---|
| FP16 (referência) | 568 GB | ~620 GB | DC: 4× H200 141GB. Local impraticável. |
| Q8_0 | 305 GB | ~340 GB | Mac Studio M3 Ultra 512 GB ou 8× RTX 4090 24GB. |
| Q5_K_M | 205 GB | ~235 GB | Mac Studio Ultra com 256 GB (no limite); 4× RTX A6000 48GB com folga. |
| Q4_K_M | 170 GB | ~200 GB | Mac Studio Ultra 256 GB, 4× RTX 4090 24GB, 2× RTX 6000 Ada 48GB. |
| IQ3_M (comprimido) | 130 GB | ~160 GB | Mac Studio M2 Ultra 192 GB, 4× RTX 4090 (offload leve). |
| IQ2_XS (extremo) | 85 GB | ~115 GB | RTX 5090 + 64 GB de RAM DDR5 para offload, ou 2× RTX 4090. |
#4. Configuração do Mac Studio Ultra com 256/512 GB
#5. Configuração multi-GPU NVIDIA
#Opção A — vLLM 4× RTX A6000 (48 GB × 4 = 192 GB)
#Opção B — llama.cpp com offload parcial
#6. Benchmarks e tokens por segundo medidos
| Benchmark | V4 Flash | V4 Pro | Llama 4 Scout 109B | Mistral Large 2 |
|---|---|---|---|---|
| MMLU-Pro | 79.4 | 84.2 | 76.8 | 75.3 |
| GPQA Diamond | 70.1 | 78.5 | 63.2 | 59.4 |
| AIME 2025 | 76.5 | 87.0 | 61.3 | 52.1 |
| LiveCodeBench v5 | 72.6 | 79.8 | 65.4 | 61.8 |
| LongBench v2 (1M) | 68.9 | 72.6 | — | — |
| Setup | Tok/s no modo Non | Tok/s no modo High | Tok/s no modo Max |
|---|---|---|---|
| Mac Studio M3 Ultra 256 GB | 10-12 | 8-10 | 5-7 |
| Mac Studio M3 Ultra 512 GB | 12-14 | 10-12 | 7-9 |
| 4× RTX A6000 48GB | 20-25 | 16-20 | 12-15 |
| 2× RTX 5090 + 64GB offload | 3-5 | 2-4 | 1-2 |
#7. Modos de raciocínio e contexto longo
O V4 Flash herda os três modos de raciocínio do V4 Pro com qualidade ligeiramente inferior, mas com custo de inferência muito menor. É uma boa escolha para agentes que precisam raciocinar sem monopolizar uma infraestrutura.
- Modo Non
- Resposta direta. Latência muito baixa (~1s para iniciar o streaming). Para chat conversacional, tradução.
- Modo High
- 200 a 2000 tokens de cadeia de raciocínio antes da resposta. +25% de qualidade em matemática/código. Latência de 5 a 15 segundos antes do primeiro token da resposta final.
- Modo Max
- Até 16k tokens de reflexão. Latência de 1 a 5 minutos em execução local. Reservar para problemas difíceis (provas matemáticas, depuração complexa).
- Contexto longo 1M
- Mesmas capacidades do V4 Pro graças ao HCA — Needle-in-Haystack 1M ~95 % (vs 98 % para Pro). Excelente para RAG em grandes bases.
#V4 Flash vs V4 Pro: escolher
| Critério | V4 Flash 284B | V4 Pro 1.6T |
|---|---|---|
| Parâmetros totais | 284 B | 1 600 B |
| Parâmetros ativos / token | 13 B | 49 B |
| VRAM Q4_K_M | 170 GB | 960 GB |
| Hardware mínimo local | Mac Studio Ultra 256 GB (M3 Ultra de segunda mão ou M5 Ultra novo) | Cluster ~80.000 € |
| Tokens por segundo típicos em execução local | 10-25 | 0,5-2 |
| Qualidade MMLU-Pro | 79.4 | 84.2 |
| Qualidade AIME 2025 | 76.5 | 87.0 |
| Contexto nativo | 1 M | 1 M |
| Modo thinking max | Sim | Sim (melhor qualidade) |
| Licença | MIT | MIT |
#Oficializado em 31 de julho de 2026 (build 0731)
A DeepSeek tirou o V4-Flash da fase de prévia no final de julho de 2026 com o build “0731”: API em beta pública e, ao mesmo tempo, o preço dos tokens de saída do V4-Pro cai 75% (US$ 0,87 por milhão de tokens de saída). A Artificial Analysis volta a colocar a família V4 “entre os líderes de pesos abertos”. Quanto aos pesos, nada muda: 284B no total, com 13B ativos — ainda a única variante V4 minimamente viável para execução local em hardware de ponta (Mac de 256 GB, Strix Halo, múltiplas GPUs), com quantização agressiva.
Desde 2 de agosto, o LM Studio também o oferece: localmente, se sua máquina tiver capacidade suficiente, ou pelo app Bionic em servidores americanos com «Zero Data Retention» por padrão — uma concessão que é preciso conhecer, mesmo que a filosofia deste site continue sendo 100% local.
#FAQ
DeepSeek V4 Flash realmente roda no Mac Studio M3 Ultra com 256 GB?+
Quanto custa uma configuração viável para executar V4 Flash localmente?+
É melhor escolher V4 Flash ou esperar uma versão destilada de 70B?+
O V4 Flash supera o Llama 4 Maverick / Scout?+
Qual é o consumo elétrico de um Mac Studio M3 Ultra em inferência V4 Flash?+
O modo thinking Max vale a pena no V4 Flash?+
É possível fazer fine-tuning do V4 Flash localmente?+
Existe uma versão quantizada Q4 estável em 25 de abril de 2026?+
Os preços mudam rápido: nosso monitoramento registra toda segunda e quinta-feira o menor preço das placas de vídeo para IA local, com o preço por GB de VRAM.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.