Iniciante 9 minEdge

SmolLM3: como se sai esse pequeno modelo da Hugging Face ?

Resposta direta

SmolLM3 é um modelo da Hugging Face com 3 bilhões de parâmetros, multilíngue (incluindo o francês), com contexto de treinamento de 64.000 tokens, extensível a 128.000, e um modo de raciocínio que pode ser ativado via /think no prompt de sistema. Ponto importante antes de instalar: não existe uma ficha oficial library/smollm3 no Ollama, apenas tags comunitárias ou o GGUF oficial hospedado na Hugging Face, que deve ser baixado pelo endereço completo.

O SmolLM3 é o pequeno modelo de linguagem publicado pela Hugging Face, pensado para rodar em hardware modesto, mantendo um contexto longo e um modo de raciocínio opcional. Este guia verifica o que o modelo realmente oferece, mostra como instalá-lo sem escolher a fonte errada e delimita o que se pode esperar razoavelmente de um modelo com 3B de parâmetros.

Por Mohamed Meguedmi·Atualização 2026-09-28·Testado no Windows, macOS e Linux

#SmolLM3 em uma frase

SmolLM3 é um modelo de linguagem com 3 bilhões de parâmetros publicado pela Hugging Face, posicionado entre modelos de 1B limitados demais para uso geral e modelos de 7-8B que consomem mais memória. O interesse de um modelo desse tamanho não é rivalizar com um modelo de 30B ou mais, mas caber em uma máquina modesta (notebook sem GPU dedicada, mini-PC) e ainda ser utilizável para resumos, textos curtos ou perguntas factuais simples.

#O que o modelo realmente oferece

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

A Hugging Face informa que o SmolLM3 foi treinado com 11,2 trilhões de tokens segundo uma estratégia em três etapas. O contexto de treinamento é ampliado progressivamente, primeiro de 4.000 para 32.000 tokens e depois de 32.000 para 64.000 tokens; além desse limite, o modelo pode atingir 128.000 tokens graças a uma técnica de extrapolação chamada YARN. Isso equivale ao dobro do comprimento efetivamente usado no treinamento e deve ser tratado como uma capacidade máxima, e não como uma garantia de qualidade constante em todo esse contexto.

SmolLM3: o que está confirmado no documento oficial
CaracterísticaValor
Parâmetros3 bilhões
Contexto usado no treinamento64.000 tokens
Contexto ampliado (YARN)128 000 tokens
Tokens de treinamento11,2 T
Idiomas nativamente suportados6 (incluindo o francês)

#Por que um modelo de 3B suporta um contexto longo sem um aumento excessivo no consumo de memória

O Hugging Face detalha as escolhas de arquitetura que tornam esse contexto longo viável em hardware modesto. O SmolLM3 substitui a atenção clássica de múltiplas cabeças pela atenção de consultas agrupadas (grouped-query attention) com apenas 4 grupos, o que reduz diretamente o tamanho do cache KV a ser armazenado por token gerado — o principal fator que faz o consumo de RAM ou VRAM disparar quando o contexto aumenta. O modelo também aplica uma técnica chamada NoPE (No Positional Encoding): o RoPE, a codificação de posição habitual, é removido de uma em cada quatro camadas, uma solução de compromisso documentada para melhorar o desempenho em contexto longo sem prejudicar o desempenho em contexto curto.

Outro detalhe de treinamento que tem efeito concreto na qualidade: a atenção utiliza um mascaramento intra-documento, ou seja, os tokens de dois documentos diferentes concatenados em uma mesma sequência de treinamento não se influenciam entre si. Para o usuário final, isso reduz o risco de um modelo compacto 'misturar' informações sem relação quando múltiplas fontes são inseridas no mesmo contexto, um defeito mais evidente em modelos pequenos do que em modelos grandes.

→
Configurações de amostragem recomendadas
O Hugging Face recomenda temperature=0.6 e top_p=0.95 para respostas em modo padrão. Esses valores não são universais: eles equilibram criatividade e coerência e servem como ponto de partida antes de serem ajustados conforme seu uso (reduzir a temperatura para respostas mais factuais, por exemplo).

#O francês, idioma nativamente suportado

Diferentemente de muitos pequenos modelos projetados inicialmente para o inglês e depois adaptados, o SmolLM3 anuncia o francês como uma das seis línguas nativamente suportadas, ao lado do inglês, espanhol, alemão, italiano e português. A Hugging Face também esclarece que o modelo foi treinado com dados em árabe, chinês e russo, mas em quantidade menor do que nas seis línguas principais: usar com cautela nessas línguas secundárias, pois a ficha oficial não afirma uma qualidade equivalente.

i
Gradiente de surpresa
Um pequeno modelo multilíngue não é automaticamente bom em francês: o que importa é a distribuição real dos dados de treinamento por língua, e não o número de línguas listadas. Aqui, o francês faz parte do núcleo principal de treinamento, e não de um acréscimo marginal.

#Instalar: atenção à tag

Primeira armadilha a evitar: no momento da redação, não existe uma página oficial « library/smollm3 » no catálogo público do Ollama. As tags encontradas sob esse nome no ollama.com são versões disponibilizadas pela comunidade, em espaços de nomes pessoais, sem garantia de conformidade com o repositório original. O caminho confiável é usar o GGUF oficial publicado pela organização ggml-org no Hugging Face, que Ollama e llama.cpp conseguem carregar diretamente pelo endereço completo.

  1. 01
    Verificar a fonte
    Utilizar o repositório oficial ggml-org/SmolLM3-3B-GGUF no Hugging Face em vez de uma tag comunitária não verificada, para ter certeza da conformidade do modelo e do tokenizer.
  2. 02
    Iniciar com Ollama
    Executar ollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_M, que baixa e inicia diretamente a quantização Q4_K_M do Hugging Face.
  3. 03
    Ou iniciar com llama.cpp
    Utilizar llama-server -hf ggml-org/SmolLM3-3B-GGUF:Q4_K_M para um servidor local ou llama-cli para uma sessão via linha de comando.
  4. 04
    Escolher a quantização
    Q4_K_M (1,92 GB) para a maioria das máquinas, Q8_0 (3,28 GB) se você tiver memória e quiser limitar a perda de qualidade, F16 (6,16 GB) apenas como referência de comparação.
Iniciar o SmolLM3 via Ollama (repositório oficial do Hugging Face)
ollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_M

Um rótulo comunitário, alibayram/smollm3, também existe diretamente no catálogo público de Ollama (ollama pull alibayram/smollm3) e funciona sem passar pela URL completa do Hugging Face. No entanto, ele é mantido por um contribuidor individual, não pelo Hugging Face nem pela equipe Ollama: em caso de dúvida sobre uma versão ou comportamento inesperado, o GGUF oficial ggml-org continua sendo a referência a comparar antes de concluir que é um bug no próprio modelo.

#Ativar o modo de raciocínio

O SmolLM3 funciona em dois modos: um modo direto e um modo de raciocínio, que gera uma sequência de reflexão antes de responder. O modo é ativado ao adicionar o indicador /think ao prompt de sistema enviado ao modelo (ou desativado com /no_think). Esse ajuste é feito no nível da mensagem de sistema, não por meio de uma opção de inicialização: qualquer interface que permita personalizar o prompt de sistema pode, portanto, ativar esse modo.

→
Com llama.cpp
Para usar o modo de raciocínio estendido com llama.cpp, a documentação oficial recomenda adicionar a opção --jinja ao iniciar o programa, o que ativa o processamento correto do template de chat necessário para esse modo.

O modo raciocínio tem um custo direto: cada resposta começa por uma fase de reflexão interna, de duração variável, antes do texto final, o que aumenta a quantidade de tokens gerados e, consequentemente, o tempo de resposta. Para uma pergunta factual simples, o modo direto (/no_think) continua sendo amplamente suficiente e muito mais rápido.

#Como posicionar o SmolLM3 em relação aos outros tamanhos

Um modelo com 3B de parâmetros está em uma faixa intermediária do mercado de modelos pequenos: mais capaz que um de 1B, frequentemente limitado a tarefas simples e a um estilo bastante rígido, mas menos versátil que um de 7-8B, que continua sendo a referência para uso geral em uma máquina com 8 GB de RAM ou mais. A pergunta a se fazer não é “O SmolLM3 é bom?” em termos absolutos, mas “minha máquina e meu uso justificam reduzir para 3B em vez de continuar com um modelo de 7-8B?”.

O contexto anunciado (64.000 tokens no treinamento, até 128.000 por extrapolação) é um diferencial em relação a pequenos modelos concorrentes, frequentemente limitados a 8.000 ou 32.000 tokens. Na prática, isso permite inserir um documento mais longo de uma só vez, por exemplo para um resumo, sem divisão prévia. Essa vantagem de contexto, no entanto, não compensa uma falta de capacidade de raciocínio puro: em uma pergunta que exige encadear várias etapas lógicas, um modelo maior geralmente continua sendo mais confiável, com contexto longo ou não.

i
Ganho de informação
A progressão do contexto em etapas (4k, depois 32k, depois 64k) documentada pelo Hugging Face mostra que o treinamento com contexto longo é feito em etapas sucessivas em volumes específicos de tokens (100 bilhões de tokens apenas para a extensão do contexto), e não em uma única passagem. Essa informação é útil para entender por que a qualidade pode variar conforme o comprimento real do texto processado, mesmo abaixo do limite anunciado.

Em termos de resultados, a Hugging Face anuncia que o SmolLM3 supera Llama-3.2-3B e Qwen2.5-3B em um conjunto de 12 benchmarks públicos que abrangem conhecimento, raciocínio, matemática e código, mantendo-se competitivo em relação a modelos 4B mais pesados. Trata-se de um dado publicado pelo desenvolvedor do modelo, não de uma medição independente: ele situa o SmolLM3 entre os melhores modelos de seu porte, sem substituir um teste com seus próprios prompts se seu uso estiver fora do escopo desses benchmarks gerais.

Distribuição dos dados de treinamento de acordo com o progresso (fonte Hugging Face)
EtapaTokens acumuladosWebCódigoMatemática
Etapa 10 à 8 T85 %12 %3 %
Etapa 28 à 10 T75 %15 %10 %
Etapa 310 à 11,1 T63 %24 %13 %

Esse aumento da participação de código e matemática no final do treinamento (respectivamente de 12% para 24% e de 3% para 13%) explica em parte por que um modelo desse tamanho consegue lidar com tarefas simples de programação e cálculo, enquanto um modelo pequeno treinado apenas com textos generalistas da web falha nessas tarefas com mais frequência.

#Para que 3B realmente serve

Resumo de texto curto
Eficiente em documentos de algumas páginas, com contexto confortável até 64.000 tokens em uso treinado.
Redação de rascunhos curtos
E-mails, mensagens, reformulações: um uso típico de modelo compacto, sem pretensões criativas avançadas.
Perguntas factuais simples
Respostas corretas sobre fatos comuns, com um risco de erro maior do que o de um modelo maior em perguntas especializadas.
Integração embarcada
O tamanho reduzido do modelo e as quantizações leves (1,92 GB em Q4_K_M) fazem dele um candidato para máquinas com memória limitada, mais do que para tarefas que exigem raciocínio complexo.

#O que um 3B não fará

Nenhuma fonte oficial publica métricas de desempenho do SmolLM3 em hardware comum como um Raspberry Pi: todas as promessas desse tipo devem ser verificadas por você antes de assumi-las como base para implantação. Da mesma forma, o contexto estendido a 128.000 tokens via YARN é uma capacidade técnica, não uma prova de que a qualidade das respostas permaneça constante em um documento tão longo: um teste em seu próprio caso de uso continua necessário antes de confiar nisso para uso crítico.

!
Objeção: « Por que não um 7B logo de cara? »
Se a sua máquina tiver 8 GB de RAM ou mais, um modelo de 7-8B em Q4 geralmente dará melhores resultados gerais. O SmolLM3 faz sentido quando a memória ou o armazenamento são realmente limitados, ou quando o contexto longo em um modelo de 3B é um critério decisivo para o seu uso.
Perguntas frequentes
O SmolLM3 está disponível diretamente no Ollama?+
Não por meio de uma página oficial library/smollm3 no momento da redação. O comando confiável continua sendo ollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_M, que baixa o GGUF oficial do Hugging Face com a quantização de sua escolha. Também existe uma tag comunitária, alibayram/smollm3, que funciona, mas é mantida apenas por um colaborador individual, não pelo Hugging Face nem pela equipe Ollama.
O SmolLM3 fala bem francês?+
O francês faz parte das 6 línguas nativamente suportadas de acordo com a ficha do Hugging Face, ao lado do inglês, do espanhol, do alemão, do italiano e do português, com um conjunto de dados de treinamento dedicado em vez de um acréscimo marginal. É um dos pontos fortes do modelo em comparação com modelos pequenos voltados principalmente para o inglês.
Como ativar o modo de raciocínio do SmolLM3?+
Adicionando o indicador /think ao prompt de sistema enviado ao modelo (ou /no_think para desativá-lo e permanecer no modo direto, mais rápido). Com llama.cpp, adicione a opção --jinja ao iniciar para que o template de chat necessário para esse modo seja aplicado corretamente; caso contrário, a fase de reflexão pode nunca terminar de forma adequada.
Qual quantização escolher para o SmolLM3?+
Q4_K_M (1,92 GB) é adequado para a maioria das máquinas e continua sendo a escolha padrão recomendada para um bom equilíbrio entre qualidade e memória. Q8_0 (3,28 GB) reduz a perda de qualidade se você tiver memória disponível. F16 (6,16 GB) serve principalmente como referência de comparação durante seus testes e raramente é útil no uso cotidiano de um modelo 3B.
Quais configurações de amostragem usar com o SmolLM3?+
O Hugging Face recomenda temperature=0.6 e top_p=0.95 como ponto de partida no modo padrão, valores que equilibram coerência e variedade das respostas. Esses não são ajustes universais: reduzi-los ajuda a obter respostas mais factuais e reprodutíveis para uso técnico, enquanto aumentá-los levemente favorece reformulações mais variadas para redação criativa.
O SmolLM3 é melhor que o Qwen2.5-3B ou o Llama-3.2-3B?+
A Hugging Face anuncia que o SmolLM3 supera esses dois modelos em 12 benchmarks públicos de conhecimento, raciocínio, matemática e código, mantendo-se competitivo com modelos de 4B. Esse resultado foi publicado pelo desenvolvedor e deve ser confirmado com seus próprios prompts se o seu uso real diferir desses benchmarks genéricos.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.