Intermediário 10 minComunidade

Qwythos 9B: o pequeno modelo de raciocínio treinado com Claude, testado localmente

Qwythos-9B é um modelo comunitário publicado pela Empero AI em junho de 2026: uma base Qwen3.5-9B sob licença Apache 2.0, com contexto de 1M, submetida a ajuste fino com registros de raciocínio gerados por Claude — daí o nome formado pela combinação de palavras “Qwythos” (Qwen + Mythos). Não há uma página de marketing sofisticada por trás: apenas pesos GGUF no Hugging Face e tags Ollama publicadas pela comunidade. Este guia esclarece sua origem, mostra como instalá-lo corretamente e o compara, em um teste real, com sua base Qwen3.5-9B em uma RTX 5070 Ti.

Por Mohamed Meguedmi·Atualização 2026-08-21·Testado no Windows, macOS e Linux

#O que é Qwythos, afinal

O Qwythos-9B não é um modelo "do zero". É um fine-tune: alguém pegou uma base aberta sólida — o Qwen3.5-9B da Alibaba — e a treinou novamente com um corpus específico de rastros de raciocínio. Esses rastros (cadeias de pensamento detalhadas, pergunta → reflexão passo a passo → resposta) teriam vindo de saídas do Claude, a família de modelos da Anthropic, em um conjunto de problemas de lógica, matemática e código. O nome "Qwythos" condensa a ideia: a letra inicial de Qwen e "Mythos", nome informal dado ao estilo de raciocínio do Claude pela comunidade que montou o dataset.

O interesse do projeto pode ser resumido em uma frase: destilar um estilo de raciocínio verboso e estruturado em um modelo pequeno o suficiente para rodar em uma GPU de consumo. Um modelo de 9B cabe em 6 GB de VRAM em Q4, enquanto os grandes modelos de raciocínio exigem dezenas de GB. Se a transferência da “forma de pensar” funcionar, teremos um modelo de raciocínio de bolso. É exatamente isso que vamos verificar.

i
Modelo comunitário, não produto oficial
Qwythos não é um modelo da Alibaba nem um modelo da Anthropic. É um fine-tune comunitário distribuído pela Empero AI. Nenhuma das duas empresas de origem o mantém nem o apoia. Trate-o como um projeto open source: os pesos estão lá, a qualidade precisa ser verificada, o suporte depende da boa vontade dos autores.

#Origem do Qwythos: as duas fontes a conhecer

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Antes de instalar qualquer coisa, é necessário entender de onde realmente vêm os pesos. Para um modelo comunitário, a origem não é um detalhe: ela condiciona a confiança que você pode depositar no arquivo que está baixando. O Qwythos está disponível em dois lugares, mas eles não têm o mesmo valor.

Fonte 1 — Hugging Face (repositório original)
A Empero AI publica os pesos no Hugging Face, tanto no formato transformers (safetensors) quanto em GGUF quantizado. Essa é a fonte de referência: ficha do modelo, licença Apache 2.0 exibida, menção à base Qwen3.5-9B e ao conjunto de dados de registros de raciocínio. Sempre parta dessa fonte para verificar o hash e ler a ficha.
Fonte 2 — Tags Ollama comunitárias
No registro do Ollama, Qwythos aparece em espaços de nomes de usuários (do tipo nome-usuario/qwythos), não na biblioteca oficial. Essas tags são práticas — um único comando para instalar — mas são reempacotadas por terceiros a partir dos GGUF do Hugging Face. Verifique quem publica a tag antes de confiar nela.
!
Uma tag Ollama não está assinada
Qualquer pessoa pode publicar um modelo no registro do Ollama sob seu próprio nome. Uma tag « qwythos » não garante que o GGUF associado corresponda aos pesos oficiais da Empero AI. Para um uso sério, prefira baixar o GGUF do Hugging Face e importá-lo você mesmo por meio de um Modelfile (ver abaixo), em vez de baixar uma tag da comunidade às cegas.
Base
Qwen3.5-9B (Alibaba), licença Apache 2.0
Tipo
Fine-tune de raciocínio, cadeia de pensamento explícita
Desenvolvedor
Empero AI (comunitário), publicação em junho de 2026
Licença
Apache 2.0 — uso comercial autorizado, licença herdada do modelo-base
Contexto
1M de tokens anunciado (herdado do Qwen3.5), valor a considerar com ressalvas conforme a VRAM real
Formatos
safetensors + GGUF (Q4_K_M, Q5_K_M, Q8_0) no Hugging Face

#Pré-requisitos de hardware

Um modelo de 9 bilhões de parâmetros roda com folga em hardware recente. Com quantização Q4_K_M — o equilíbrio entre qualidade e memória recomendado — Qwythos-9B ocupa cerca de 6 GB de VRAM após ser carregado, aos quais se soma o cache de contexto (KV cache), que cresce com o comprimento dos prompts. Nossa bancada de testes roda em uma RTX 5070 Ti (16 GB), bem acima do mínimo.

Q4_K_M (recomendado)
≈ 6 GB de VRAM. Cabe em uma RTX 3060 de 12 GB, uma 4070, uma 5070 Ti — e até parcialmente em 8 GB com um contexto modesto.
Q5_K_M
≈ 7 GB. Pequeno ganho de qualidade, preferível se você tiver 12 GB ou mais.
Q8_0
≈ 10 GB. Quase sem perda em comparação com o FP16, adequado para 16 GB ou mais.
Contexto longo
O 1M anunciado é teórico. Um cache KV para 128k tokens já adiciona vários GB; busque 16 GB+ de VRAM para ultrapassar confortavelmente 32k.
→
Um modelo de raciocínio gera muito
Os modelos de raciocínio “pensam” em voz alta antes de responder: às vezes, produzem várias centenas de tokens de reflexão para uma resposta de uma linha. Reserve uma margem no contexto de saída (num_predict) e espere tempos de resposta mais longos do que os de um modelo tradicional do mesmo tamanho.

#Instalar Qwythos com Ollama

Duas opções. A rápida: baixar uma tag da comunidade. A segura: baixar o GGUF oficial do Hugging Face e importá-lo por meio de um Modelfile. Detalho as duas; para uma estação de trabalho de uso sério, a segunda é preferível, pois você sabe exatamente qual arquivo está executando.

  1. 01
    Verificar se o Ollama está em execução
    O Ollama expõe seu daemon em http://localhost:11434. Uma simples chamada confirma que ele responde antes de avançar. Se você ainda não o instalou, consulte o guia de instalação do Ollama.
  2. 02
    Caminho rápido — tag comunitária
    Identifique a tag no ollama.com (espaço de nomes do usuário), depois inicie o ollama run. Anote o nome exato do publicador: é sua única garantia de origem.
  3. 03
    Caminho seguro — GGUF do Hugging Face
    Baixe o arquivo .gguf em Q4_K_M do repositório Empero AI, compare seu hash SHA256 com o exibido na ficha do modelo e depois crie um Modelfile que aponte para esse arquivo.
  4. 04
    Criar o modelo local
    O comando ollama create cria um modelo com um nome a partir do seu Modelfile. Você obtém uma tag local que controla de ponta a ponta.
  5. 05
    Iniciar e conversar
    ollama run inicia a sessão interativa. No primeiro carregamento, o modelo é carregado na VRAM; as inicializações seguintes são instantâneas enquanto ele permanecer nela.
Terminal — verificar Ollama
curl http://localhost:11434/api/version
# {"version":"0.x.x"}
Terminal — caminho rápido (tag da comunidade)
# Remplacez <publieur> par le nom réel du dépôt Ollama
ollama run <publieur>/qwythos:9b-q4_k_m
Terminal — caminho seguro (GGUF Hugging Face)
# 1. Télécharger le GGUF officiel depuis le dépôt Empero AI
huggingface-cli download EmperoAI/Qwythos-9B-GGUF \
  qwythos-9b-Q4_K_M.gguf --local-dir ./qwythos

# 2. Vérifier l'empreinte contre celle de la carte du modèle
sha256sum ./qwythos/qwythos-9b-Q4_K_M.gguf
Modelfile — qwythos.Modelfile
FROM ./qwythos/qwythos-9b-Q4_K_M.gguf

PARAMETER temperature 0.6
PARAMETER top_p 0.95
PARAMETER num_ctx 32768

# Encourage la chaîne de pensée explicite
SYSTEM """Tu es un assistant de raisonnement. Décompose chaque problème étape par étape avant de conclure."""
Terminal — importar e iniciar
ollama create qwythos-9b -f qwythos.Modelfile
ollama run qwythos-9b
i
Temperatura mais baixa para raciocínio
Nos modelos de raciocínio, uma temperatura em torno de 0,6 gera cadeias de pensamento mais estáveis do que o valor clássico de 0,8. Se a temperatura for alta demais, o modelo começa a digressar; se for baixa demais (0,1–0,2), ele se repete. O par 0,6 / top_p 0,95 é um bom ponto de partida; ajuste conforme suas tarefas.

#Primeiro teste de raciocínio

Começamos com um problema clássico com pegadinha, do tipo que faz os pequenos modelos não treinados para raciocinar tropeçarem. O objetivo não é apenas obter a resposta correta, mas ver se o modelo desenvolve um raciocínio coerente, em vez de adivinhar.

Prompt de teste
ollama run qwythos-9b "Un batte et une balle coûtent 1,10 € au total. La batte coûte 1 € de plus que la balle. Combien coûte la balle ? Raisonne étape par étape."

Resposta esperada: 0,05 €. A armadilha intuitiva leva a 0,10 €. No nosso banco de testes, Qwythos-9B formula a equação (bola = x, taco = x + 1, total 2x + 1 = 1,10), isola x = 0,05 e verifica que 0,05 + 1,05 = 1,10 antes de concluir. O processo é prolixo — cerca de dez linhas de raciocínio para uma resposta de um único número —, mas é correto e rastreável. É precisamente o comportamento que se espera de um fine-tune de raciocínio.

→
Teste em SEUS problemas
Um modelo pode ter visto esse tipo de enigma clássico durante o treinamento. Para julgar com honestidade, crie dois ou três problemas tirados do seu domínio real (uma restrição logística, um trecho de código para depurar, um cálculo de negócio) e compare o processo, não apenas o resultado final.

#Qwythos versus o modelo base Qwen3.5-9B: o que o fine-tuning muda

A verdadeira pergunta: o fine-tune traz algo em relação ao modelo base do qual foi derivado? Para medir isso, instalamos o Qwen3.5-9B base em paralelo e apresentamos a mesma série de problemas de lógica e matemática aos dois modelos, com a mesma temperatura. Veja os resultados obtidos na nossa bancada de testes com RTX 5070 Ti.

Terminal — instalar a base para comparar
ollama pull qwen3.5:9b
ollama run qwen3.5:9b "Un batte et une balle coûtent 1,10 €..."
Extensão da reflexão
O Qwythos sempre desenvolve uma cadeia de pensamento explícita; a base Qwen3.5 costuma responder de forma mais breve, às vezes diretamente, sem mostrar as etapas intermediárias.
Problemas com pegadinhas
Em enigmas contraintuitivos (taco/bola, sequências lógicas), Qwythos erra menos porque verifica sua resposta. O modelo base cai mais facilmente na armadilha intuitiva.
Velocidade
Vantagem para o modelo base: ele gera menos tokens para uma resposta equivalente. O Qwythos é mais lento na prática porque « pensa » antes de responder — o preço do raciocínio.
Conhecimento factual
Empate. O fine-tuning de raciocínio não adiciona conhecimento factual; em questões de cultura geral, os dois modelos são equivalentes (e compartilham as mesmas lacunas).
Francês
Equivalente. A qualidade do francês vem da base Qwen3.5; Qwythos não melhora nem piora a fluidez, apenas altera a estrutura da resposta, não a língua.

Veredito da comparação: Qwythos vence claramente nas tarefas em que o processo de raciocínio importa (matemática, lógica, depuração, planejamento) e perde em velocidade e nas respostas curtas. Se você quer um assistente rápido para reformulação ou resumo, o modelo-base Qwen3.5-9B basta. Se você quer um pequeno modelo de raciocínio que mostre como chegou à resposta, Qwythos justifica sua existência.

!
O raciocínio não é gratuito
Cadeia de pensamento = mais tokens gerados = mais latência e mais VRAM consumida pelo contexto. Em tarefas simples, forçar um modelo a raciocinar torna a execução mais lenta sem trazer benefícios. Reserve Qwythos para problemas que realmente se beneficiam de uma decomposição e mantenha um modelo mais direto para o resto.

#O irmão mais velho: Qwythos 27B

A Empero AI também publica uma variante de 27B, construída sobre uma base Qwen3.5 maior segundo o mesmo princípio: fine-tuning com registros de raciocínio. Ela é voltada a quem tem VRAM para ir além na qualidade do raciocínio, ao custo de uma necessidade de memória consideravelmente maior.

VRAM (Q4_K_M)
≈ 19 GB. É necessária uma RTX 4090 de 24 GB, uma placa profissional ou um Mac com memória unificada (M4 Pro/Max) para acomodá-lo com conforto.
O que se ganha
Cadeias de raciocínio mais longas e robustas em problemas com múltiplas etapas; menos erros de aritmética em cascata. A diferença aumenta sobretudo nas tarefas realmente difíceis.
O que você paga
Três vezes mais VRAM e uma geração mais lenta. Em equipamentos com 12-16 GB, o 27B simplesmente não cabe em Q4 sem offload no CPU, o que prejudica a velocidade.
Quando escolhê-lo
Se o 9B falhar regularmente em seus problemas reais E você tiver 24 GB de VRAM. Caso contrário, o 9B continua oferecendo a melhor relação entre qualidade e recursos.
i
Comece pelo 9B
Não vá direto para o 27B por reflexo. Teste primeiro o 9B com as suas tarefas reais: em muitos casos, é suficiente. Só passe para o 27B se identificar um limite concreto de qualidade em problemas que você realmente precisa resolver — não por princípio.

#Solução de problemas

A tag do Ollama não existe / desapareceu
Os tags comunitários vêm e vão. Mude para o caminho seguro: baixe o GGUF do Hugging Face e importe via Modelfile. Você não depende mais da disponibilidade de terceiros.
O modelo não raciocina, responde de forma direta
Adicione uma instrução de sistema explícita (« decomponha passo a passo ») e verifique se num_ctx é grande o suficiente para deixar espaço para a reflexão. Uma temperatura muito baixa também suprime a cadeia de pensamento.
Respostas truncadas
A reflexão consome o orçamento de saída. Aumente num_predict (ou o parâmetro equivalente do seu cliente) para deixar o modelo finalizar sua linha de raciocínio E fornecer a resposta.
Saída muito lenta
Verifique se o modelo cabe bem na VRAM (ollama ps). Se parte dele precisar ser carregada na RAM do sistema, a velocidade despenca: diminua um nível de quantização ou reduza num_ctx.
Dúvida sobre a integridade do arquivo
Compare o SHA256 do GGUF baixado com o publicado na ficha do modelo no Hugging Face. Um hash diferente significa que o arquivo foi reempacotado ou corrompido — não o execute.

#Para se aprofundar

Para instalar os componentes em torno do Qwythos e entender os compromissos envolvidos nas escolhas mencionadas aqui:

Instalar Ollama (Windows, macOS, Linux)
O pré-requisito deste guia: configurar o daemon do Ollama na porta 11434 antes de baixar qualquer modelo.
Escolher sua quantização (Q4, Q5, Q8, FP16)
Para escolher entre Q4_K_M, Q5_K_M e Q8_0 de acordo com sua VRAM e o nível de qualidade exigido, tanto no Qwythos quanto nos modelos da mesma família.
Instalar o DeepSeek R1 com Ollama
Outro modelo de raciocínio open source com cadeia de pensamento, útil para comparar a abordagem do Qwythos com uma referência bem estabelecida.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.