Destilação: como os pequenos modelos herdam dos gros
Você provavelmente já se deparou com nomes como DeepSeek-R1-Distill-Qwen-14B e se perguntou por que um modelo “pequeno” de repente raciocina quase tão bem quanto um gigante. A resposta cabe em uma palavra: destilação. É a técnica que permite que um modelo compacto herde o comportamento de um modelo muito maior, sem ter seu tamanho nem sua lentidão. Este guia explica a destilação de LLM com a metáfora do professor e do aluno, detalha o que realmente se transmite, o que se perde pelo caminho e como reconhecer uma destilação bem-sucedida antes de executar o modelo na sua própria máquina.
#O problema que a distilação resolve
Os melhores modelos abertos são enormes: várias centenas de bilhões de parâmetros. Eles são brilhantes, mas inutilizáveis em máquinas comuns: exigem dezenas de gigabytes de VRAM e geram tokens lentamente. Por outro lado, um modelo de 7B ou 14B cabe em uma placa de vídeo gamer e responde rápido, mas muitas vezes lhe falta a sofisticação de raciocínio do irmão maior.
Gostaríamos, portanto, de aproveitar parte do talento de um modelo grande em um formato que rode localmente. A abordagem ingênua seria simplesmente treinar novamente um modelo pequeno com os mesmos dados brutos do grande. Isso não basta: com um tamanho reduzido, aprender sozinho em um oceano de texto resulta em um modelo razoável, mas não excepcional. A destilação oferece um atalho: em vez de reaprender o mundo do zero, o modelo pequeno aprende diretamente com o grande.
#Princípio professor-aluno
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
A distilação envolve dois modelos. O “professor” é o modelo grande de alto desempenho que queremos imitar. O “aluno” é o modelo pequeno que treinamos. O princípio é: fazemos milhares de perguntas ao professor, coletamos suas respostas e treinamos o aluno para produzir as mesmas. O aluno deixa de aprender com textos brutos encontrados na internet e passa a aprender com exemplos já “mastigados” por um modelo especialista.
O detalhe que faz toda a diferença é exatamente o que o aluno copia. Na versão mais rica, ele não imita apenas a palavra final escolhida pelo professor, mas toda a distribuição de probabilidades da próxima palavra: o professor não diz apenas "a resposta é gato", ele indica "gato muito provável, cachorro um pouco provável, torradeira quase impossível". Essas nuances — às vezes chamadas de soft labels — contêm uma informação que a simples resposta correta não oferece.
- Professor (teacher)
- O grande modelo de referência, caro mas excelente. Ele serve como fonte e não é implantado no seu ambiente local.
- Aluno (student)
- O pequeno modelo que é treinado para reproduzir o comportamento do professor. É ele que você rodará localmente.
- Rótulos suaves
- As probabilidades detalhadas do professor para cada palavra possível, não apenas a palavra vencedora. A matéria-prima mais rica da destilação.
- Conjunto de dados de destilação
- O conjunto de perguntas feitas e de respostas do professor que o aluno usa para treinar.
#O que realmente é transmitido
Muitas vezes se imagina que a destilação “transfere o conhecimento” do modelo grande. Isso é parcialmente verdadeiro, mas impreciso. O que se transfere melhor são sobretudo comportamentos e formas de agir, mais do que fatos brutos. Um modelo pequeno tem capacidade de armazenamento limitada: não consegue reter tudo da enciclopédia interna de um gigante. Por outro lado, ele pode assimilar métodos muito bem.
- Estilo de raciocínio
- A forma de decompor um problema em etapas, de formular uma cadeia de pensamento antes de concluir. É o que se transmite melhor e o núcleo dos R1-Distill.
- O formato das respostas
- A estrutura, o tom, a forma de organizar uma explicação ou código. O aluno adota as práticas redacionais do professor.
- Esquemas de resolução
- Em matemática, código ou lógica, o aluno herda receitas comprovadas: como abordar um tipo de problema, quais verificações realizar.
- Uma parte dos conhecimentos
- Fatos e associações, sim, mas dentro dos limites da capacidade do modelo pequeno. É a parte que se transfere com mais dificuldade.
Essa distinção é essencial para entender os modelos destilados recentes. Quando a DeepSeek destila o R1 em um Qwen 14B, o objetivo não é fazer caber todo o conhecimento geral do R1 em 14 bilhões de parâmetros — isso é impossível. O objetivo é transmitir sua forma de raciocinar: refletir passo a passo, corrigir-se, desenvolver uma demonstração. E um modelo pequeno pode aprender isso extraordinariamente bem.
#Por que um 14B destilado supera um 14B clássico
Aqui está a parte contraintuitiva. Dois modelos têm exatamente o mesmo tamanho — 14 bilhões de parâmetros — e, portanto, a mesma necessidade de VRAM e a mesma velocidade. No entanto, o modelo destilado muitas vezes supera de longe o clássico em raciocínio. O tamanho não mudou; mudou apenas a forma de treinar. Como um mesmo número de parâmetros pode gerar um modelo muito melhor?
Porque o treinamento não preenche os parâmetros ao acaso: ele os organiza. Um 14B clássico aprende sozinho a partir de texto bruto; desenvolve capacidades razoáveis, mas generalistas. Um 14B destilado aprende com exemplos produzidos por um professor de elite, muitas vezes com raciocínios completos apresentados passo a passo. Seus 14 bilhões de parâmetros se organizam em torno de bons métodos, em vez de aprender um pouco de tudo. Com a mesma capacidade, a qualidade do sinal de treinamento faz a diferença.
- Mesmo custo, melhor sinal
- O modelo destilado não é maior nem mais lento, mas aprendeu com material de qualidade muito superior: as saídas de um especialista.
- Exemplos densos
- As respostas do professor estão repletas de raciocínios corretos e completos, raros no texto bruto da web.
- Menos ruído
- A web contém muitos erros e conteúdo desorganizado. Um professor filtra esse conteúdo: o aluno aprende com conteúdo limpo.
Cuidado para não interpretar além do que os resultados permitem: “superar” vale principalmente nas tarefas visadas pela destilação, normalmente raciocínio, matemática e código. Em conhecimentos gerais ou conhecimentos factuais detalhados, a diferença diminui e pode até se inverter. Um modelo destilado não é magicamente superior em tudo — ele é superior naquilo para o qual foi treinado.
#O caso dos R1-Distill
O exemplo que popularizou a destilação local foi a família DeepSeek-R1-Distill, lançada no início de 2025. A DeepSeek utilizou seu grande modelo de raciocínio R1 como professor e destilou seu comportamento em vários alunos de tamanhos diferentes, baseados em arquiteturas existentes como Qwen e Llama. Resultado: modelos de 1,5B, 7B, 8B, 14B e 32B que raciocinam com uma cadeia de pensamento visível, algo anteriormente reservado aos gigantes.
- R1-Distill-Qwen-1.5B
- Minúsculo, funciona praticamente em qualquer lugar, mesmo sem GPU. Surpreendente para o seu tamanho em matemática simples.
- R1-Distill-Qwen-7B / Llama-8B
- A opção equilibrada para o público em geral: ~5 GB em Q4, em uma placa de 8 GB. Bom raciocínio para uso diário.
- R1-Distill-Qwen-14B
- ≈ 9 GB em Q4, adequado para uma RTX 3060 de 12 GB ou uma 4070 de 12 GB. O equilíbrio ideal entre raciocínio e hardware acessível.
- R1-Distill-Qwen-32B
- ≈ 19 GB em Q4, para uma RTX 4090 de 24 GB. O mais próximo do professor, se sua VRAM for suficiente.
Esses modelos mostram sua cadeia de pensamento entre tags de reflexão antes de fornecer a resposta final. É exatamente o comportamento do modelo professor R1 que foi transmitido. Na prática, um R1-Distill-Qwen-14B desenvolve um raciocínio estruturado sobre um problema de matemática, enquanto um Qwen 14B clássico responderia de forma mais simples — com o mesmo consumo de memória.
#Limites: o que não é transmitido
A destilação tem um limite definido pelo tamanho do aluno. Não se pode despejar o oceano de um gigante em um dedal. Entender o que se perde pelo caminho evita decepções e escolhas erradas de modelo.
- Conhecimento factual detalhado
- O modelo pequeno não consegue memorizar tudo o que o professor sabe. Em fatos específicos ou de nicho, ele tende a inventar mais facilmente.
- A robustez fora do tema
- Em tarefas distantes do que foi destilado, o aluno volta aproximadamente ao nível de um modelo clássico de seu tamanho.
- Limite de capacidade
- Um 7B destilado continua sendo um 7B. A destilação otimiza o uso dos parâmetros, mas não acrescenta parâmetros.
- Coerência em contextos muito longos
- Seguir um raciocínio ao longo de dezenas de milhares de tokens continua sendo mais difícil para um modelo pequeno, destilado ou não.
Há também um risco mais sutil: um modelo destilado pode imitar a forma de raciocínio do professor sem que seu raciocínio seja sempre tão correto. Ele “age como se estivesse pensando” de forma convincente, mas pode errar com confiança em um problema além de sua capacidade. Uma bela cadeia de pensamento não garante exatidão — é algo que sempre deve ser verificado, especialmente em decisões importantes.
#Identificar uma boa destilação
Nem todos os modelos destilados têm a mesma qualidade. Antes de baixar um, alguns indicadores permitem avaliar seriamente sua qualidade, sem ser especialista.
- Um professor identificado
- Uma boa ficha indica claramente o modelo professor (ex.: « destilado a partir de R1 »). Um professor renomado é um bom sinal inicial.
- Uma base clara
- Em qual arquitetura o aluno (Qwen, Llama…) é construído? Uma base sólida e bem suportada facilita o uso local.
- Benchmarks focados
- Veja as pontuações nas tarefas visadas (matemática, código, raciocínio), não um número global vago. E compare com o modelo não destilado de mesmo tamanho.
- Coerência entre tamanho e promessa
- Cuidado com um modelo muito pequeno vendido como equivalente a um gigante em tudo. A destilação ajuda, mas não faz milagres.
- Formato de reflexão
- Para um modelo de raciocínio destilado, verifique se ele realmente expõe sua cadeia de pensamento e se ela é relevante, não apenas decorativa.
#Os principais modelos destilados para testar localmente
Aqui estão os modelos destilados que valem a pena em 2026, do mais leve ao mais exigente, com seu consumo indicativo de memória em Q4_K_M.
- DeepSeek-R1-Distill-Qwen-1.5B
- ≈ 1,5 GB. A aposta no minúsculo: roda até em CPU ou em um notebook pequeno. Surpreendente em matemática para seu tamanho.
- DeepSeek-R1-Distill-Qwen-7B
- ≈ 5 GB, em uma placa com 8 GB. O ponto de entrada ideal para descobrir o raciocínio destilado no dia a dia.
- DeepSeek-R1-Distill-Qwen-14B
- ≈ 9 GB, indicado para uma RTX 3060 de 12 GB ou uma 4070. A melhor relação entre capacidade de raciocínio e requisitos de hardware acessíveis.
- DeepSeek-R1-Distill-Qwen-32B
- ≈ 19 GB, para uma RTX 4090 de 24 GB. O mais próximo do professor se sua VRAM permitir.
Se você está começando, comece pela versão 7B ou 14B: elas demonstram os benefícios da destilação em uma única placa voltada ao consumidor, sem o peso das configurações mais robustas. A 1.5B é um excelente ambiente de experimentação para entender o comportamento de raciocínio mesmo sem GPU.
#Experimentar um modelo destilado em 3 minutos
Se o Ollama já estiver instalado e escutando na porta padrão (http://localhost:11434), dois comandos bastam para perceber o que a destilação oferece em comparação com um modelo clássico de mesmo tamanho.
- 01Baixar e iniciar um modelo destiladoBaixe um R1-Distill e converse com ele. A primeira execução baixa o modelo (alguns GB conforme o tamanho escolhido).
- 02Apresentar um problema de raciocínioDê a ele um problema de matemática ou lógica em múltiplas etapas. Observe sua cadeia de pensamento: ele desenvolve um raciocínio antes de chegar a uma conclusão.
- 03Comparar com o modelo não destiladoExecute o Qwen clássico do mesmo tamanho e faça a mesma pergunta. O modelo destilado deverá raciocinar de forma mais estruturada, com o mesmo uso de VRAM e a mesma velocidade.
#Para se aprofundar
É mais fácil entender a distilação ao relacioná-la a outros conceitos básicos de IA local. Estes guias complementam diretamente este guia:
- Instalar o DeepSeek R1 com Ollama
- Passo a passo para rodar versões distiladas de 7B/14B/32B localmente, com os pré-requisitos de VRAM por tamanho.
- MoE explicado: por que um 30B-A3B roda como um modelo pequeno
- A outra grande técnica de arquitetura que torna grandes modelos acessíveis localmente, complementar à distilação.
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Depois de escolher seu modelo destilado, a quantização determina quanto espaço ele ocupará na memória da sua placa.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.