Instalar DeepSeek R1 com Ollama
DeepSeek R1 é um modelo de raciocínio com cadeia de pensamento publicado sob licença MIT pela DeepSeek. O modelo completo tem 671 bilhões de parâmetros e continua fora do alcance de um computador pessoal, mas as versões destiladas (1,5B a 70B) cabem confortavelmente em hardware de uso doméstico. Este tutorial mostra como instalar DeepSeek R1 com Ollama, escolher o tamanho adequado e aproveitar o modo de raciocínio.
#Por que DeepSeek R1?
R1 não é um LLM "clássico": antes de responder, ele gera uma cadeia de raciocínio visível, delimitada pelas tags <think>...</think>. É essa fase que lhe permite resolver problemas de matemática, lógica ou código que os modelos de geração direta costumam errar. No AIME 2024 e no MATH-500, os modelos destilados de 14B e 32B superam amplamente o Llama 3.1 70B Instruct, que, apesar disso, é de 2 a 5 vezes maior.
Outra vantagem: a licença MIT, sem restrições de uso comercial ou geográfico. Você pode integrar o R1 em um produto, um agente, uma ferramenta interna, sem precisar pedir permissão a ninguém. Isso é raro para um modelo de raciocínio desse nível.
#Versões distiladas disponíveis
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Ollama distribui sete tamanhos sob o mesmo nome deepseek-r1. A tag padrão aponta para a variante destilada de 7B (base Qwen 7B).
- deepseek-r1:1.5b
- Base Qwen 2.5 Math 1.5B. Leve, perfeito para testar em um laptop sem GPU. Qualidade limitada em problemas complexos.
- deepseek-r1:7b
- Base Qwen 2.5 Math 7B. Tag padrão. Bom equilíbrio para 8 GB de VRAM. Excelente introdução.
- deepseek-r1:8b
- Base Llama 3.1 8B. Ligeiramente mais falante que a 7B, melhor em francês.
- deepseek-r1:14b
- Base Qwen 2.5 14B. Salto significativo de qualidade em matemática. Ponto ideal para 12 GB de VRAM.
- deepseek-r1:32b
- Base Qwen 2.5 32B. No nível do o1-mini na maioria dos benchmarks de raciocínio. Exige 24 GB de VRAM em Q4.
- deepseek-r1:70b
- Base Llama 3.3 70B. O mais capaz dos modelos destilados. RTX 5090 32 GB ou Mac Studio 64 GB+.
- deepseek-r1:671b
- O modelo completo (MoE 671B, 37B ativos). Além da capacidade de um computador pessoal, mas possível em um Mac Studio Ultra com 512 GB.
#Requisitos e VRAM por tamanho
Antes de instalar DeepSeek R1 com Ollama, verifique se você tem Ollama instalado (o daemon escuta por padrão em http://localhost:11434) e se seu GPU tem memória suficiente para o tamanho desejado. Aqui estão os requisitos de VRAM para a quantização Q4_K_M, que é a que Ollama baixa por padrão.
- 1.5B Q4
- ~1,1 GB de VRAM. Roda em qualquer GPU ou até mesmo apenas na CPU (15 a 25 tok/s).
- 7B Q4
- ~4,7 GB de VRAM. RTX 3050 8 GB, 4060 8 GB, Mac M1/M2 16 GB.
- 8B Q4
- ~5,2 GB de VRAM. Mesmo alvo que o 7B, margem mais apertada em 6 GB.
- 14B Q4
- ~9 GB de VRAM. RTX 3060 de 12 GB, 4070 de 12 GB, M2 Pro de 16 GB.
- 32B Q4
- ~19 GB de VRAM. RTX 3090/4090 24 GB, M3 Max 36 GB.
- 70B Q4
- ~40 GB de VRAM. RTX 5090 de 32 GB com offload, Mac Studio Ultra de 64 GB+
#1. Instalar o modelo
Um único comando basta. O Ollama baixa os pesos do seu registro oficial e carrega o modelo na memória na primeira utilização.
Para um tamanho específico, adicione a tag:
Na primeira execução, o modelo é baixado (de 1 GB para a versão 1.5B a 40 GB para a versão 70B). As execuções seguintes são instantâneas enquanto o modelo permanecer no cache do Ollama.
#2. Escolher o tamanho
A escolha do tamanho depende de três variáveis: a VRAM, o tipo de tarefas e sua tolerância à espera. O R1 gera em média entre 500 e 2000 tokens de raciocínio antes da resposta final — ou seja, 3 a 10 vezes mais tokens do que um modelo de chat clássico com geração direta. A velocidade realmente importa.
- Testar R1 sem uma GPU potente
- 1,5B ou 7B. Latência aceitável para chat mesmo usando apenas a CPU.
- Matemática do ensino médio / Python simples
- 7B ou 8B. Suficiente 80% do tempo, decepciona em álgebra avançada.
- Matemática complexa, lógica, raciocínio longo
- Mínimo 14B. Salto significativo entre 8B e 14B em AIME e MATH-500.
- Nível o1-mini, depuração complexa, demonstrações
- 32B. É a opção ideal se você tiver 24 GB de VRAM.
- O máximo local possível
- 70B Q4 em RTX 5090 com offload ou no Mac Studio 64 GB+.
#3. Primeiro prompt de raciocínio
R1 brilha em problemas que exigem várias etapas. Vamos testá-lo em um clássico do AIME, ao alcance da versão 14B:
Observe bem a estrutura: tudo o que está entre <think> e </think> é a cadeia de pensamento do modelo. Você pode exibi-la ao usuário final, ocultá-la ou registrá-la em logs para depuração. É um excelente recurso de explicabilidade em um aplicativo.
#4. Q4 vs Q8: escolher a quantização
Por padrão, Ollama baixa a Q4_K_M (equilíbrio recomendado entre qualidade e uso de memória). Para modelos de raciocínio, alguns preferem passar para Q8_0 — a degradação da qualidade na cadeia de pensamento é mais perceptível do que no chat comum.
- Q4_K_M
- Opção padrão de equilíbrio. Qualidade de 2 a 4 % inferior à do FP16 nos benchmarks de matemática. É a opção a escolher primeiro.
- Q5_K_M
- +1 % de qualidade em relação ao Q4, +25 % de memória. Interessante se você tiver margem de VRAM sem conseguir passar para um modelo de tamanho maior.
- Q8_0
- Qualidade quase FP16 (-0,5 %). Memória dobrada em relação à Q4. Recomendado se você quer o melhor na versão 14B ou 32B e tiver VRAM.
- FP16
- Referência de precisão total. Nenhuma vantagem prática em relação a Q8 nos modelos destilados, e 4 vezes mais pesado que Q4.
#DeepSeek R1 vs Qwen 3.8 27B
Qwen 3.8 27B, lançado em 14 de agosto de 2026 pela equipe Qwen, é o modelo generalista open-weight de referência de 2026: 262k tokens de contexto, visão, licença Apache 2.0 e, sobretudo, um modo de raciocínio integrado. É a alternativa natural ao R1 quando se deseja um único modelo capaz de raciocinar E de fazer todo o resto. Qual escolher?
- DeepSeek R1 32B
- Especialista em raciocínio puro. Melhor nos benchmarks de matemática (AIME, MATH-500). Raciocínio sempre visível e fácil de analisar programaticamente via <think>...</think>. Ele só faz isso, mas faz muito bem.
- Qwen 3.8 27B
- Generalista de 2026 com raciocínio integrado. Contexto 262k, visão, Apache 2.0, ~18 GB em Q4. Por padrão, ele pensa demais: mesmo diante de uma pergunta simples, desenvolve uma longa cadeia de pensamento inútil. Ajuste seu nível de raciocínio para low para voltar a obter respostas diretas.
- Veredito prático
- R1 32B continua à frente em matemática e lógica puras e em termos de um formato de raciocínio estável que pode ser registrado em logs. Qwen 3.8 27B leva vantagem quando você quer um modelo versátil (código, chat, visão, contexto longo) que raciocine sob demanda. Para o francês, os dois são sólidos.
- Recursos
- Semelhantes. R1 32B cabe em Q4 em 24 GB (RTX 3090/4090). Qwen 3.8 27B é um pouco mais leve (~18 GB em Q4) e deixa mais margem de contexto na mesma placa.
#Solução de problemas
- Modelo que não exibe o <think>
- Você pode estar usando um cliente que oculta as tags XML. Teste com ollama run en CLI para verificar se o modelo as gera corretamente. Se a API JSON as corta, é problema do cliente.
- Respostas truncadas
- O contexto padrão do Ollama é de 4096 tokens. O R1 consome muitos tokens para seu raciocínio. Aumente-o com /set parameter num_ctx 16384 na sessão ou pelo parâmetro options.num_ctx na API.
- Muito lento apesar de ter um bom GPU
- Verifique com ollama ps se o modelo está realmente 100% na GPU. Se a coluna PROCESSOR mostrar CPU, parte do modelo está sendo carregada na RAM. Escolha um modelo de tamanho menor ou use uma quantização mais agressiva.
- O modelo fica preso em um loop na sua cadeia de pensamento
- Isso é típico de modelos destilados pequenos (1,5B, 7B) diante de problemas difíceis demais. Use um modelo maior, proponha um problema mais simples ou adicione ao seu prompt: « responda com menos de 500 tokens de raciocínio ».
- Erro "insufficient memory"
- Modelo grande demais para sua VRAM. ollama rm deepseek-r1:32b e depois ollama pull deepseek-r1:14b. Você também pode forçar um offload parcial com OLLAMA_GPU_LAYERS.
#Para se aprofundar
Alguns próximos passos naturais após essa instalação:
- Compreender as quantizações
- O guia Q4/Q5/Q8 do site detalha as vantagens e desvantagens específicas e é útil antes de aumentar o tamanho do modelo.
- Escolher sua GPU para R1
- Se você pretende mesmo usar a versão 32B, o guia de compra de GPU indica os patamares de 24/32 GB a buscar em 2026.
- Conectar R1 a uma interface
- Open WebUI ou LM Studio gerenciam nativamente as tags <think> e permitem recolher/expandir o raciocínio.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.