Iniciante 8 minOllama

Instalar DeepSeek R1 com Ollama

DeepSeek R1 é um modelo de raciocínio com cadeia de pensamento publicado sob licença MIT pela DeepSeek. O modelo completo tem 671 bilhões de parâmetros e continua fora do alcance de um computador pessoal, mas as versões destiladas (1,5B a 70B) cabem confortavelmente em hardware de uso doméstico. Este tutorial mostra como instalar DeepSeek R1 com Ollama, escolher o tamanho adequado e aproveitar o modo de raciocínio.

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux

#Por que DeepSeek R1?

R1 não é um LLM "clássico": antes de responder, ele gera uma cadeia de raciocínio visível, delimitada pelas tags <think>...</think>. É essa fase que lhe permite resolver problemas de matemática, lógica ou código que os modelos de geração direta costumam errar. No AIME 2024 e no MATH-500, os modelos destilados de 14B e 32B superam amplamente o Llama 3.1 70B Instruct, que, apesar disso, é de 2 a 5 vezes maior.

Outra vantagem: a licença MIT, sem restrições de uso comercial ou geográfico. Você pode integrar o R1 em um produto, um agente, uma ferramenta interna, sem precisar pedir permissão a ninguém. Isso é raro para um modelo de raciocínio desse nível.

i
Destilação, em poucas palavras
O modelo completo R1 (671B MoE) gerou milhões de exemplos de raciocínio, que depois foram usados para fazer o ajuste fino de modelos menores (Qwen 7B/14B/32B e Llama 8B/70B). Os modelos destilados não são, portanto, o próprio R1, mas modelos Qwen/Llama que aprenderam a raciocinar como o R1.

#Versões distiladas disponíveis

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Ollama distribui sete tamanhos sob o mesmo nome deepseek-r1. A tag padrão aponta para a variante destilada de 7B (base Qwen 7B).

deepseek-r1:1.5b
Base Qwen 2.5 Math 1.5B. Leve, perfeito para testar em um laptop sem GPU. Qualidade limitada em problemas complexos.
deepseek-r1:7b
Base Qwen 2.5 Math 7B. Tag padrão. Bom equilíbrio para 8 GB de VRAM. Excelente introdução.
deepseek-r1:8b
Base Llama 3.1 8B. Ligeiramente mais falante que a 7B, melhor em francês.
deepseek-r1:14b
Base Qwen 2.5 14B. Salto significativo de qualidade em matemática. Ponto ideal para 12 GB de VRAM.
deepseek-r1:32b
Base Qwen 2.5 32B. No nível do o1-mini na maioria dos benchmarks de raciocínio. Exige 24 GB de VRAM em Q4.
deepseek-r1:70b
Base Llama 3.3 70B. O mais capaz dos modelos destilados. RTX 5090 32 GB ou Mac Studio 64 GB+.
deepseek-r1:671b
O modelo completo (MoE 671B, 37B ativos). Além da capacidade de um computador pessoal, mas possível em um Mac Studio Ultra com 512 GB.

#Requisitos e VRAM por tamanho

Antes de instalar DeepSeek R1 com Ollama, verifique se você tem Ollama instalado (o daemon escuta por padrão em http://localhost:11434) e se seu GPU tem memória suficiente para o tamanho desejado. Aqui estão os requisitos de VRAM para a quantização Q4_K_M, que é a que Ollama baixa por padrão.

1.5B Q4
~1,1 GB de VRAM. Roda em qualquer GPU ou até mesmo apenas na CPU (15 a 25 tok/s).
7B Q4
~4,7 GB de VRAM. RTX 3050 8 GB, 4060 8 GB, Mac M1/M2 16 GB.
8B Q4
~5,2 GB de VRAM. Mesmo alvo que o 7B, margem mais apertada em 6 GB.
14B Q4
~9 GB de VRAM. RTX 3060 de 12 GB, 4070 de 12 GB, M2 Pro de 16 GB.
32B Q4
~19 GB de VRAM. RTX 3090/4090 24 GB, M3 Max 36 GB.
70B Q4
~40 GB de VRAM. RTX 5090 de 32 GB com offload, Mac Studio Ultra de 64 GB+
→
Não tem certeza sobre a sua VRAM?
No Windows, abra o Gerenciador de Tarefas, aba Desempenho > GPU. No Linux: nvidia-smi para NVIDIA, rocm-smi para AMD. No Mac: a memória é unificada, considere cerca de 75% da RAM total como VRAM disponível para o LLM.

#1. Instalar o modelo

Um único comando basta. O Ollama baixa os pesos do seu registro oficial e carrega o modelo na memória na primeira utilização.

Instalar a versão 7B padrão
ollama run deepseek-r1

Para um tamanho específico, adicione a tag:

Escolher explicitamente um tamanho
# Version la plus légère (1.5B)
ollama run deepseek-r1:1.5b

# Sweet spot 12 Go VRAM
ollama run deepseek-r1:14b

# Pour RTX 3090/4090
ollama run deepseek-r1:32b

Na primeira execução, o modelo é baixado (de 1 GB para a versão 1.5B a 40 GB para a versão 70B). As execuções seguintes são instantâneas enquanto o modelo permanecer no cache do Ollama.

!
Nunca use :cloud
Se você vir deepseek-r1:cloud em algum lugar, ignore: é uma etiqueta que direciona para os servidores Ollama Cloud e cobra pelo uso. Para permanecer estritamente self-hosted, use apenas as etiquetas numeradas (1.5b, 7b, 14b, 32b, 70b).

#2. Escolher o tamanho

A escolha do tamanho depende de três variáveis: a VRAM, o tipo de tarefas e sua tolerância à espera. O R1 gera em média entre 500 e 2000 tokens de raciocínio antes da resposta final — ou seja, 3 a 10 vezes mais tokens do que um modelo de chat clássico com geração direta. A velocidade realmente importa.

Testar R1 sem uma GPU potente
1,5B ou 7B. Latência aceitável para chat mesmo usando apenas a CPU.
Matemática do ensino médio / Python simples
7B ou 8B. Suficiente 80% do tempo, decepciona em álgebra avançada.
Matemática complexa, lógica, raciocínio longo
Mínimo 14B. Salto significativo entre 8B e 14B em AIME e MATH-500.
Nível o1-mini, depuração complexa, demonstrações
32B. É a opção ideal se você tiver 24 GB de VRAM.
O máximo local possível
70B Q4 em RTX 5090 com offload ou no Mac Studio 64 GB+.
→
Regra simples
Comece com a 14B se tiver 12 GB de VRAM. É o nível onde o R1 se torna realmente interessante. A 7B serve principalmente para se familiarizar.

#3. Primeiro prompt de raciocínio

R1 brilha em problemas que exigem várias etapas. Vamos testá-lo em um clássico do AIME, ao alcance da versão 14B:

Exemplo de matemática
>>> Un train part de Lyon à 8h à 90 km/h vers Paris.
... Un autre part de Paris à 9h à 110 km/h vers Lyon.
... La distance Lyon-Paris est 460 km. À quelle heure se croisent-ils ?

<think>
À 9h, le premier train a parcouru 90 km. Il reste 460 - 90 = 370 km
entre les deux trains. Ils se rapprochent à 90 + 110 = 200 km/h.
Temps avant croisement : 370 / 200 = 1,85 h = 1h51min.
Donc croisement à 9h + 1h51 = 10h51.
</think>

Les deux trains se croisent à 10h51.

Observe bem a estrutura: tudo o que está entre <think> e </think> é a cadeia de pensamento do modelo. Você pode exibi-la ao usuário final, ocultá-la ou registrá-la em logs para depuração. É um excelente recurso de explicabilidade em um aplicativo.

i
Não remova o <think>
Tentação clássica: adicionar um prompt de sistema que diga "não gere uma cadeia de pensamento". Má ideia: a qualidade despenca. O raciocínio É o modelo. Oculte o bloco na interface em vez de removê-lo na geração.

#4. Q4 vs Q8: escolher a quantização

Por padrão, Ollama baixa a Q4_K_M (equilíbrio recomendado entre qualidade e uso de memória). Para modelos de raciocínio, alguns preferem passar para Q8_0 — a degradação da qualidade na cadeia de pensamento é mais perceptível do que no chat comum.

Tags de quantização Ollama
# Q4_K_M (défaut) — recommandé pour 80 % des cas
ollama pull deepseek-r1:14b

# Q8_0 — qualité maximale, mémoire doublée
ollama pull deepseek-r1:14b-q8_0

# Liste complète des tags disponibles
ollama show deepseek-r1:14b --modelfile
Q4_K_M
Opção padrão de equilíbrio. Qualidade de 2 a 4 % inferior à do FP16 nos benchmarks de matemática. É a opção a escolher primeiro.
Q5_K_M
+1 % de qualidade em relação ao Q4, +25 % de memória. Interessante se você tiver margem de VRAM sem conseguir passar para um modelo de tamanho maior.
Q8_0
Qualidade quase FP16 (-0,5 %). Memória dobrada em relação à Q4. Recomendado se você quer o melhor na versão 14B ou 32B e tiver VRAM.
FP16
Referência de precisão total. Nenhuma vantagem prática em relação a Q8 nos modelos destilados, e 4 vezes mais pesado que Q4.
→
Q4 14B > Q8 7B
Quando você estiver em dúvida entre aumentar a precisão da quantização ou aumentar o tamanho do modelo, sempre aumente o tamanho. Um modelo 14B Q4 supera sistematicamente um modelo 7B Q8 em raciocínio, usando aproximadamente a mesma quantidade de VRAM.

#DeepSeek R1 vs Qwen 3.8 27B

Qwen 3.8 27B, lançado em 14 de agosto de 2026 pela equipe Qwen, é o modelo generalista open-weight de referência de 2026: 262k tokens de contexto, visão, licença Apache 2.0 e, sobretudo, um modo de raciocínio integrado. É a alternativa natural ao R1 quando se deseja um único modelo capaz de raciocinar E de fazer todo o resto. Qual escolher?

DeepSeek R1 32B
Especialista em raciocínio puro. Melhor nos benchmarks de matemática (AIME, MATH-500). Raciocínio sempre visível e fácil de analisar programaticamente via <think>...</think>. Ele só faz isso, mas faz muito bem.
Qwen 3.8 27B
Generalista de 2026 com raciocínio integrado. Contexto 262k, visão, Apache 2.0, ~18 GB em Q4. Por padrão, ele pensa demais: mesmo diante de uma pergunta simples, desenvolve uma longa cadeia de pensamento inútil. Ajuste seu nível de raciocínio para low para voltar a obter respostas diretas.
Veredito prático
R1 32B continua à frente em matemática e lógica puras e em termos de um formato de raciocínio estável que pode ser registrado em logs. Qwen 3.8 27B leva vantagem quando você quer um modelo versátil (código, chat, visão, contexto longo) que raciocine sob demanda. Para o francês, os dois são sólidos.
Recursos
Semelhantes. R1 32B cabe em Q4 em 24 GB (RTX 3090/4090). Qwen 3.8 27B é um pouco mais leve (~18 GB em Q4) e deixa mais margem de contexto na mesma placa.
i
Testar os dois é rápido
ollama pull qwen3.8:27b à côté de deepseek-r1:32b, puis comparez sur vos vrais prompts. Pensez à baisser le niveau de raisonnement de Qwen 3.8 en low si vous le trouvez trop bavard. C'est l'arbitrage le plus fiable — vos cas d'usage valent mieux que n'importe quel benchmark public.

#Solução de problemas

Modelo que não exibe o <think>
Você pode estar usando um cliente que oculta as tags XML. Teste com ollama run en CLI para verificar se o modelo as gera corretamente. Se a API JSON as corta, é problema do cliente.
Respostas truncadas
O contexto padrão do Ollama é de 4096 tokens. O R1 consome muitos tokens para seu raciocínio. Aumente-o com /set parameter num_ctx 16384 na sessão ou pelo parâmetro options.num_ctx na API.
Muito lento apesar de ter um bom GPU
Verifique com ollama ps se o modelo está realmente 100% na GPU. Se a coluna PROCESSOR mostrar CPU, parte do modelo está sendo carregada na RAM. Escolha um modelo de tamanho menor ou use uma quantização mais agressiva.
O modelo fica preso em um loop na sua cadeia de pensamento
Isso é típico de modelos destilados pequenos (1,5B, 7B) diante de problemas difíceis demais. Use um modelo maior, proponha um problema mais simples ou adicione ao seu prompt: « responda com menos de 500 tokens de raciocínio ».
Erro "insufficient memory"
Modelo grande demais para sua VRAM. ollama rm deepseek-r1:32b e depois ollama pull deepseek-r1:14b. Você também pode forçar um offload parcial com OLLAMA_GPU_LAYERS.

#Para se aprofundar

Alguns próximos passos naturais após essa instalação:

Compreender as quantizações
O guia Q4/Q5/Q8 do site detalha as vantagens e desvantagens específicas e é útil antes de aumentar o tamanho do modelo.
Escolher sua GPU para R1
Se você pretende mesmo usar a versão 32B, o guia de compra de GPU indica os patamares de 24/32 GB a buscar em 2026.
Conectar R1 a uma interface
Open WebUI ou LM Studio gerenciam nativamente as tags <think> e permitem recolher/expandir o raciocínio.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.