Iniciante 8 minConceitos

Destilação: como os pequenos modelos herdam dos gros

Você provavelmente já se deparou com nomes como DeepSeek-R1-Distill-Qwen-14B e se perguntou por que um modelo “pequeno” de repente raciocina quase tão bem quanto um gigante. A resposta cabe em uma palavra: destilação. É a técnica que permite que um modelo compacto herde o comportamento de um modelo muito maior, sem ter seu tamanho nem sua lentidão. Este guia explica a destilação de LLM com a metáfora do professor e do aluno, detalha o que realmente se transmite, o que se perde pelo caminho e como reconhecer uma destilação bem-sucedida antes de executar o modelo na sua própria máquina.

Por Clara M.·Atualização 2026-08-07·Testado no Windows, macOS e Linux

#O problema que a distilação resolve

Os melhores modelos abertos são enormes: várias centenas de bilhões de parâmetros. Eles são brilhantes, mas inutilizáveis em máquinas comuns: exigem dezenas de gigabytes de VRAM e geram tokens lentamente. Por outro lado, um modelo de 7B ou 14B cabe em uma placa de vídeo gamer e responde rápido, mas muitas vezes lhe falta a sofisticação de raciocínio do irmão maior.

Gostaríamos, portanto, de aproveitar parte do talento de um modelo grande em um formato que rode localmente. A abordagem ingênua seria simplesmente treinar novamente um modelo pequeno com os mesmos dados brutos do grande. Isso não basta: com um tamanho reduzido, aprender sozinho em um oceano de texto resulta em um modelo razoável, mas não excepcional. A destilação oferece um atalho: em vez de reaprender o mundo do zero, o modelo pequeno aprende diretamente com o grande.

i
Intuição em uma frase
A distilação não é compactar um grande modelo. É treinar um pequeno modelo para imitar as respostas e o estilo de raciocínio de um grande — como um aprendiz observando o mestre trabalhando.

#Princípio professor-aluno

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

A distilação envolve dois modelos. O “professor” é o modelo grande de alto desempenho que queremos imitar. O “aluno” é o modelo pequeno que treinamos. O princípio é: fazemos milhares de perguntas ao professor, coletamos suas respostas e treinamos o aluno para produzir as mesmas. O aluno deixa de aprender com textos brutos encontrados na internet e passa a aprender com exemplos já “mastigados” por um modelo especialista.

O detalhe que faz toda a diferença é exatamente o que o aluno copia. Na versão mais rica, ele não imita apenas a palavra final escolhida pelo professor, mas toda a distribuição de probabilidades da próxima palavra: o professor não diz apenas "a resposta é gato", ele indica "gato muito provável, cachorro um pouco provável, torradeira quase impossível". Essas nuances — às vezes chamadas de soft labels — contêm uma informação que a simples resposta correta não oferece.

Professor (teacher)
O grande modelo de referência, caro mas excelente. Ele serve como fonte e não é implantado no seu ambiente local.
Aluno (student)
O pequeno modelo que é treinado para reproduzir o comportamento do professor. É ele que você rodará localmente.
Rótulos suaves
As probabilidades detalhadas do professor para cada palavra possível, não apenas a palavra vencedora. A matéria-prima mais rica da destilação.
Conjunto de dados de destilação
O conjunto de perguntas feitas e de respostas do professor que o aluno usa para treinar.
→
Uma imagem mental
Um estudante pode aprender sozinho com livros, ou seguir o melhor professor do país que não só mostra a resposta correta, mas também seu raciocínio, suas hesitações e o que descarta. O segundo avança muito mais rápido com o mesmo esforço. A distilação é oferecer esse professor para o modelo pequeno.

#O que realmente é transmitido

Muitas vezes se imagina que a destilação “transfere o conhecimento” do modelo grande. Isso é parcialmente verdadeiro, mas impreciso. O que se transfere melhor são sobretudo comportamentos e formas de agir, mais do que fatos brutos. Um modelo pequeno tem capacidade de armazenamento limitada: não consegue reter tudo da enciclopédia interna de um gigante. Por outro lado, ele pode assimilar métodos muito bem.

Estilo de raciocínio
A forma de decompor um problema em etapas, de formular uma cadeia de pensamento antes de concluir. É o que se transmite melhor e o núcleo dos R1-Distill.
O formato das respostas
A estrutura, o tom, a forma de organizar uma explicação ou código. O aluno adota as práticas redacionais do professor.
Esquemas de resolução
Em matemática, código ou lógica, o aluno herda receitas comprovadas: como abordar um tipo de problema, quais verificações realizar.
Uma parte dos conhecimentos
Fatos e associações, sim, mas dentro dos limites da capacidade do modelo pequeno. É a parte que se transfere com mais dificuldade.

Essa distinção é essencial para entender os modelos destilados recentes. Quando a DeepSeek destila o R1 em um Qwen 14B, o objetivo não é fazer caber todo o conhecimento geral do R1 em 14 bilhões de parâmetros — isso é impossível. O objetivo é transmitir sua forma de raciocinar: refletir passo a passo, corrigir-se, desenvolver uma demonstração. E um modelo pequeno pode aprender isso extraordinariamente bem.

i
Comportamento versus conhecimento
Lembre-se desta regra: a destilação transmite sobretudo habilidades e hábitos (como pensar), e menos fatos brutos (o que saber). Um modelo destilado pode raciocinar como um gigante e, ao mesmo tempo, conhecer menos coisas do que ele.

#Por que um 14B destilado supera um 14B clássico

Aqui está a parte contraintuitiva. Dois modelos têm exatamente o mesmo tamanho — 14 bilhões de parâmetros — e, portanto, a mesma necessidade de VRAM e a mesma velocidade. No entanto, o modelo destilado muitas vezes supera de longe o clássico em raciocínio. O tamanho não mudou; mudou apenas a forma de treinar. Como um mesmo número de parâmetros pode gerar um modelo muito melhor?

Porque o treinamento não preenche os parâmetros ao acaso: ele os organiza. Um 14B clássico aprende sozinho a partir de texto bruto; desenvolve capacidades razoáveis, mas generalistas. Um 14B destilado aprende com exemplos produzidos por um professor de elite, muitas vezes com raciocínios completos apresentados passo a passo. Seus 14 bilhões de parâmetros se organizam em torno de bons métodos, em vez de aprender um pouco de tudo. Com a mesma capacidade, a qualidade do sinal de treinamento faz a diferença.

Mesmo custo, melhor sinal
O modelo destilado não é maior nem mais lento, mas aprendeu com material de qualidade muito superior: as saídas de um especialista.
Exemplos densos
As respostas do professor estão repletas de raciocínios corretos e completos, raros no texto bruto da web.
Menos ruído
A web contém muitos erros e conteúdo desorganizado. Um professor filtra esse conteúdo: o aluno aprende com conteúdo limpo.

Cuidado para não interpretar além do que os resultados permitem: “superar” vale principalmente nas tarefas visadas pela destilação, normalmente raciocínio, matemática e código. Em conhecimentos gerais ou conhecimentos factuais detalhados, a diferença diminui e pode até se inverter. Um modelo destilado não é magicamente superior em tudo — ele é superior naquilo para o qual foi treinado.

#O caso dos R1-Distill

O exemplo que popularizou a destilação local foi a família DeepSeek-R1-Distill, lançada no início de 2025. A DeepSeek utilizou seu grande modelo de raciocínio R1 como professor e destilou seu comportamento em vários alunos de tamanhos diferentes, baseados em arquiteturas existentes como Qwen e Llama. Resultado: modelos de 1,5B, 7B, 8B, 14B e 32B que raciocinam com uma cadeia de pensamento visível, algo anteriormente reservado aos gigantes.

R1-Distill-Qwen-1.5B
Minúsculo, funciona praticamente em qualquer lugar, mesmo sem GPU. Surpreendente para o seu tamanho em matemática simples.
R1-Distill-Qwen-7B / Llama-8B
A opção equilibrada para o público em geral: ~5 GB em Q4, em uma placa de 8 GB. Bom raciocínio para uso diário.
R1-Distill-Qwen-14B
≈ 9 GB em Q4, adequado para uma RTX 3060 de 12 GB ou uma 4070 de 12 GB. O equilíbrio ideal entre raciocínio e hardware acessível.
R1-Distill-Qwen-32B
≈ 19 GB em Q4, para uma RTX 4090 de 24 GB. O mais próximo do professor, se sua VRAM for suficiente.

Esses modelos mostram sua cadeia de pensamento entre tags de reflexão antes de fornecer a resposta final. É exatamente o comportamento do modelo professor R1 que foi transmitido. Na prática, um R1-Distill-Qwen-14B desenvolve um raciocínio estruturado sobre um problema de matemática, enquanto um Qwen 14B clássico responderia de forma mais simples — com o mesmo consumo de memória.

!
Um modelo destilado não é “o verdadeiro R1”
Um DeepSeek-R1-Distill-Qwen-14B não é R1 reduzido: é um Qwen 14B que aprendeu a raciocinar como o R1. Tem o método, mas não toda a potência nem toda a conhecimento. Não se espere com as performances do modelo completo de 671B.

#Limites: o que não é transmitido

A destilação tem um limite definido pelo tamanho do aluno. Não se pode despejar o oceano de um gigante em um dedal. Entender o que se perde pelo caminho evita decepções e escolhas erradas de modelo.

Conhecimento factual detalhado
O modelo pequeno não consegue memorizar tudo o que o professor sabe. Em fatos específicos ou de nicho, ele tende a inventar mais facilmente.
A robustez fora do tema
Em tarefas distantes do que foi destilado, o aluno volta aproximadamente ao nível de um modelo clássico de seu tamanho.
Limite de capacidade
Um 7B destilado continua sendo um 7B. A destilação otimiza o uso dos parâmetros, mas não acrescenta parâmetros.
Coerência em contextos muito longos
Seguir um raciocínio ao longo de dezenas de milhares de tokens continua sendo mais difícil para um modelo pequeno, destilado ou não.

Há também um risco mais sutil: um modelo destilado pode imitar a forma de raciocínio do professor sem que seu raciocínio seja sempre tão correto. Ele “age como se estivesse pensando” de forma convincente, mas pode errar com confiança em um problema além de sua capacidade. Uma bela cadeia de pensamento não garante exatidão — é algo que sempre deve ser verificado, especialmente em decisões importantes.

i
O bom hábito
Use um modelo destilado para o que ele faz bem — raciocinar, estruturar, programar — e mantenha um olhar crítico sobre os fatos que ele apresenta. Para a confiabilidade factual, um RAG que o apoie nos seus documentos é melhor do que depender apenas da memória do modelo.

#Identificar uma boa destilação

Nem todos os modelos destilados têm a mesma qualidade. Antes de baixar um, alguns indicadores permitem avaliar seriamente sua qualidade, sem ser especialista.

Um professor identificado
Uma boa ficha indica claramente o modelo professor (ex.: « destilado a partir de R1 »). Um professor renomado é um bom sinal inicial.
Uma base clara
Em qual arquitetura o aluno (Qwen, Llama…) é construído? Uma base sólida e bem suportada facilita o uso local.
Benchmarks focados
Veja as pontuações nas tarefas visadas (matemática, código, raciocínio), não um número global vago. E compare com o modelo não destilado de mesmo tamanho.
Coerência entre tamanho e promessa
Cuidado com um modelo muito pequeno vendido como equivalente a um gigante em tudo. A destilação ajuda, mas não faz milagres.
Formato de reflexão
Para um modelo de raciocínio destilado, verifique se ele realmente expõe sua cadeia de pensamento e se ela é relevante, não apenas decorativa.
→
O teste que não mente
Baixe o modelo destilado E o modelo clássico de mesmo tamanho e faça a ambos suas próprias perguntas difíceis para compará-los lado a lado. Se o modelo destilado raciocinar melhor em seus casos reais, ele é uma boa escolha para você — isso é muito mais revelador do que um benchmark público.

#Os principais modelos destilados para testar localmente

Aqui estão os modelos destilados que valem a pena em 2026, do mais leve ao mais exigente, com seu consumo indicativo de memória em Q4_K_M.

DeepSeek-R1-Distill-Qwen-1.5B
≈ 1,5 GB. A aposta no minúsculo: roda até em CPU ou em um notebook pequeno. Surpreendente em matemática para seu tamanho.
DeepSeek-R1-Distill-Qwen-7B
≈ 5 GB, em uma placa com 8 GB. O ponto de entrada ideal para descobrir o raciocínio destilado no dia a dia.
DeepSeek-R1-Distill-Qwen-14B
≈ 9 GB, indicado para uma RTX 3060 de 12 GB ou uma 4070. A melhor relação entre capacidade de raciocínio e requisitos de hardware acessíveis.
DeepSeek-R1-Distill-Qwen-32B
≈ 19 GB, para uma RTX 4090 de 24 GB. O mais próximo do professor se sua VRAM permitir.

Se você está começando, comece pela versão 7B ou 14B: elas demonstram os benefícios da destilação em uma única placa voltada ao consumidor, sem o peso das configurações mais robustas. A 1.5B é um excelente ambiente de experimentação para entender o comportamento de raciocínio mesmo sem GPU.

#Experimentar um modelo destilado em 3 minutos

Se o Ollama já estiver instalado e escutando na porta padrão (http://localhost:11434), dois comandos bastam para perceber o que a destilação oferece em comparação com um modelo clássico de mesmo tamanho.

  1. 01
    Baixar e iniciar um modelo destilado
    Baixe um R1-Distill e converse com ele. A primeira execução baixa o modelo (alguns GB conforme o tamanho escolhido).
  2. 02
    Apresentar um problema de raciocínio
    Dê a ele um problema de matemática ou lógica em múltiplas etapas. Observe sua cadeia de pensamento: ele desenvolve um raciocínio antes de chegar a uma conclusão.
  3. 03
    Comparar com o modelo não destilado
    Execute o Qwen clássico do mesmo tamanho e faça a mesma pergunta. O modelo destilado deverá raciocinar de forma mais estruturada, com o mesmo uso de VRAM e a mesma velocidade.
Terminal
# Lancer un modèle distillé de raisonnement
ollama run deepseek-r1:14b

# Comparer avec le modèle classique de même taille
ollama run qwen3:14b
i
Ver o raciocínio
Em um R1-Distill, a resposta começa por uma fase de reflexão (cadeia de pensamento) antes da conclusão. É exatamente o comportamento herdado do professor R1 — o sinal visível de que a distilação fez o seu trabalho.

#Para se aprofundar

É mais fácil entender a distilação ao relacioná-la a outros conceitos básicos de IA local. Estes guias complementam diretamente este guia:

Instalar o DeepSeek R1 com Ollama
Passo a passo para rodar versões distiladas de 7B/14B/32B localmente, com os pré-requisitos de VRAM por tamanho.
MoE explicado: por que um 30B-A3B roda como um modelo pequeno
A outra grande técnica de arquitetura que torna grandes modelos acessíveis localmente, complementar à distilação.
Escolher sua quantização (Q4, Q5, Q8, FP16)
Depois de escolher seu modelo destilado, a quantização determina quanto espaço ele ocupará na memória da sua placa.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.