Qwythos 9B: o pequeno modelo de raciocínio treinado com Claude, testado localmente
Qwythos-9B é um modelo comunitário publicado pela Empero AI em junho de 2026: uma base Qwen3.5-9B sob licença Apache 2.0, com contexto de 1M, submetida a ajuste fino com registros de raciocínio gerados por Claude — daí o nome formado pela combinação de palavras “Qwythos” (Qwen + Mythos). Não há uma página de marketing sofisticada por trás: apenas pesos GGUF no Hugging Face e tags Ollama publicadas pela comunidade. Este guia esclarece sua origem, mostra como instalá-lo corretamente e o compara, em um teste real, com sua base Qwen3.5-9B em uma RTX 5070 Ti.
#O que é Qwythos, afinal
O Qwythos-9B não é um modelo "do zero". É um fine-tune: alguém pegou uma base aberta sólida — o Qwen3.5-9B da Alibaba — e a treinou novamente com um corpus específico de rastros de raciocínio. Esses rastros (cadeias de pensamento detalhadas, pergunta → reflexão passo a passo → resposta) teriam vindo de saídas do Claude, a família de modelos da Anthropic, em um conjunto de problemas de lógica, matemática e código. O nome "Qwythos" condensa a ideia: a letra inicial de Qwen e "Mythos", nome informal dado ao estilo de raciocínio do Claude pela comunidade que montou o dataset.
O interesse do projeto pode ser resumido em uma frase: destilar um estilo de raciocínio verboso e estruturado em um modelo pequeno o suficiente para rodar em uma GPU de consumo. Um modelo de 9B cabe em 6 GB de VRAM em Q4, enquanto os grandes modelos de raciocínio exigem dezenas de GB. Se a transferência da “forma de pensar” funcionar, teremos um modelo de raciocínio de bolso. É exatamente isso que vamos verificar.
#Origem do Qwythos: as duas fontes a conhecer
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Antes de instalar qualquer coisa, é necessário entender de onde realmente vêm os pesos. Para um modelo comunitário, a origem não é um detalhe: ela condiciona a confiança que você pode depositar no arquivo que está baixando. O Qwythos está disponível em dois lugares, mas eles não têm o mesmo valor.
- Fonte 1 — Hugging Face (repositório original)
- A Empero AI publica os pesos no Hugging Face, tanto no formato transformers (safetensors) quanto em GGUF quantizado. Essa é a fonte de referência: ficha do modelo, licença Apache 2.0 exibida, menção à base Qwen3.5-9B e ao conjunto de dados de registros de raciocínio. Sempre parta dessa fonte para verificar o hash e ler a ficha.
- Fonte 2 — Tags Ollama comunitárias
- No registro do Ollama, Qwythos aparece em espaços de nomes de usuários (do tipo nome-usuario/qwythos), não na biblioteca oficial. Essas tags são práticas — um único comando para instalar — mas são reempacotadas por terceiros a partir dos GGUF do Hugging Face. Verifique quem publica a tag antes de confiar nela.
- Base
- Qwen3.5-9B (Alibaba), licença Apache 2.0
- Tipo
- Fine-tune de raciocínio, cadeia de pensamento explícita
- Desenvolvedor
- Empero AI (comunitário), publicação em junho de 2026
- Licença
- Apache 2.0 — uso comercial autorizado, licença herdada do modelo-base
- Contexto
- 1M de tokens anunciado (herdado do Qwen3.5), valor a considerar com ressalvas conforme a VRAM real
- Formatos
- safetensors + GGUF (Q4_K_M, Q5_K_M, Q8_0) no Hugging Face
#Pré-requisitos de hardware
Um modelo de 9 bilhões de parâmetros roda com folga em hardware recente. Com quantização Q4_K_M — o equilíbrio entre qualidade e memória recomendado — Qwythos-9B ocupa cerca de 6 GB de VRAM após ser carregado, aos quais se soma o cache de contexto (KV cache), que cresce com o comprimento dos prompts. Nossa bancada de testes roda em uma RTX 5070 Ti (16 GB), bem acima do mínimo.
- Q4_K_M (recomendado)
- ≈ 6 GB de VRAM. Cabe em uma RTX 3060 de 12 GB, uma 4070, uma 5070 Ti — e até parcialmente em 8 GB com um contexto modesto.
- Q5_K_M
- ≈ 7 GB. Pequeno ganho de qualidade, preferível se você tiver 12 GB ou mais.
- Q8_0
- ≈ 10 GB. Quase sem perda em comparação com o FP16, adequado para 16 GB ou mais.
- Contexto longo
- O 1M anunciado é teórico. Um cache KV para 128k tokens já adiciona vários GB; busque 16 GB+ de VRAM para ultrapassar confortavelmente 32k.
#Instalar Qwythos com Ollama
Duas opções. A rápida: baixar uma tag da comunidade. A segura: baixar o GGUF oficial do Hugging Face e importá-lo por meio de um Modelfile. Detalho as duas; para uma estação de trabalho de uso sério, a segunda é preferível, pois você sabe exatamente qual arquivo está executando.
- 01Verificar se o Ollama está em execuçãoO Ollama expõe seu daemon em http://localhost:11434. Uma simples chamada confirma que ele responde antes de avançar. Se você ainda não o instalou, consulte o guia de instalação do Ollama.
- 02Caminho rápido — tag comunitáriaIdentifique a tag no ollama.com (espaço de nomes do usuário), depois inicie o ollama run. Anote o nome exato do publicador: é sua única garantia de origem.
- 03Caminho seguro — GGUF do Hugging FaceBaixe o arquivo .gguf em Q4_K_M do repositório Empero AI, compare seu hash SHA256 com o exibido na ficha do modelo e depois crie um Modelfile que aponte para esse arquivo.
- 04Criar o modelo localO comando ollama create cria um modelo com um nome a partir do seu Modelfile. Você obtém uma tag local que controla de ponta a ponta.
- 05Iniciar e conversarollama run inicia a sessão interativa. No primeiro carregamento, o modelo é carregado na VRAM; as inicializações seguintes são instantâneas enquanto ele permanecer nela.
#Primeiro teste de raciocínio
Começamos com um problema clássico com pegadinha, do tipo que faz os pequenos modelos não treinados para raciocinar tropeçarem. O objetivo não é apenas obter a resposta correta, mas ver se o modelo desenvolve um raciocínio coerente, em vez de adivinhar.
Resposta esperada: 0,05 €. A armadilha intuitiva leva a 0,10 €. No nosso banco de testes, Qwythos-9B formula a equação (bola = x, taco = x + 1, total 2x + 1 = 1,10), isola x = 0,05 e verifica que 0,05 + 1,05 = 1,10 antes de concluir. O processo é prolixo — cerca de dez linhas de raciocínio para uma resposta de um único número —, mas é correto e rastreável. É precisamente o comportamento que se espera de um fine-tune de raciocínio.
#Qwythos versus o modelo base Qwen3.5-9B: o que o fine-tuning muda
A verdadeira pergunta: o fine-tune traz algo em relação ao modelo base do qual foi derivado? Para medir isso, instalamos o Qwen3.5-9B base em paralelo e apresentamos a mesma série de problemas de lógica e matemática aos dois modelos, com a mesma temperatura. Veja os resultados obtidos na nossa bancada de testes com RTX 5070 Ti.
- Extensão da reflexão
- O Qwythos sempre desenvolve uma cadeia de pensamento explícita; a base Qwen3.5 costuma responder de forma mais breve, às vezes diretamente, sem mostrar as etapas intermediárias.
- Problemas com pegadinhas
- Em enigmas contraintuitivos (taco/bola, sequências lógicas), Qwythos erra menos porque verifica sua resposta. O modelo base cai mais facilmente na armadilha intuitiva.
- Velocidade
- Vantagem para o modelo base: ele gera menos tokens para uma resposta equivalente. O Qwythos é mais lento na prática porque « pensa » antes de responder — o preço do raciocínio.
- Conhecimento factual
- Empate. O fine-tuning de raciocínio não adiciona conhecimento factual; em questões de cultura geral, os dois modelos são equivalentes (e compartilham as mesmas lacunas).
- Francês
- Equivalente. A qualidade do francês vem da base Qwen3.5; Qwythos não melhora nem piora a fluidez, apenas altera a estrutura da resposta, não a língua.
Veredito da comparação: Qwythos vence claramente nas tarefas em que o processo de raciocínio importa (matemática, lógica, depuração, planejamento) e perde em velocidade e nas respostas curtas. Se você quer um assistente rápido para reformulação ou resumo, o modelo-base Qwen3.5-9B basta. Se você quer um pequeno modelo de raciocínio que mostre como chegou à resposta, Qwythos justifica sua existência.
#O irmão mais velho: Qwythos 27B
A Empero AI também publica uma variante de 27B, construída sobre uma base Qwen3.5 maior segundo o mesmo princípio: fine-tuning com registros de raciocínio. Ela é voltada a quem tem VRAM para ir além na qualidade do raciocínio, ao custo de uma necessidade de memória consideravelmente maior.
- VRAM (Q4_K_M)
- ≈ 19 GB. É necessária uma RTX 4090 de 24 GB, uma placa profissional ou um Mac com memória unificada (M4 Pro/Max) para acomodá-lo com conforto.
- O que se ganha
- Cadeias de raciocínio mais longas e robustas em problemas com múltiplas etapas; menos erros de aritmética em cascata. A diferença aumenta sobretudo nas tarefas realmente difíceis.
- O que você paga
- Três vezes mais VRAM e uma geração mais lenta. Em equipamentos com 12-16 GB, o 27B simplesmente não cabe em Q4 sem offload no CPU, o que prejudica a velocidade.
- Quando escolhê-lo
- Se o 9B falhar regularmente em seus problemas reais E você tiver 24 GB de VRAM. Caso contrário, o 9B continua oferecendo a melhor relação entre qualidade e recursos.
#Solução de problemas
- A tag do Ollama não existe / desapareceu
- Os tags comunitários vêm e vão. Mude para o caminho seguro: baixe o GGUF do Hugging Face e importe via Modelfile. Você não depende mais da disponibilidade de terceiros.
- O modelo não raciocina, responde de forma direta
- Adicione uma instrução de sistema explícita (« decomponha passo a passo ») e verifique se num_ctx é grande o suficiente para deixar espaço para a reflexão. Uma temperatura muito baixa também suprime a cadeia de pensamento.
- Respostas truncadas
- A reflexão consome o orçamento de saída. Aumente num_predict (ou o parâmetro equivalente do seu cliente) para deixar o modelo finalizar sua linha de raciocínio E fornecer a resposta.
- Saída muito lenta
- Verifique se o modelo cabe bem na VRAM (ollama ps). Se parte dele precisar ser carregada na RAM do sistema, a velocidade despenca: diminua um nível de quantização ou reduza num_ctx.
- Dúvida sobre a integridade do arquivo
- Compare o SHA256 do GGUF baixado com o publicado na ficha do modelo no Hugging Face. Um hash diferente significa que o arquivo foi reempacotado ou corrompido — não o execute.
#Para se aprofundar
Para instalar os componentes em torno do Qwythos e entender os compromissos envolvidos nas escolhas mencionadas aqui:
- Instalar Ollama (Windows, macOS, Linux)
- O pré-requisito deste guia: configurar o daemon do Ollama na porta 11434 antes de baixar qualquer modelo.
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Para escolher entre Q4_K_M, Q5_K_M e Q8_0 de acordo com sua VRAM e o nível de qualidade exigido, tanto no Qwythos quanto nos modelos da mesma família.
- Instalar o DeepSeek R1 com Ollama
- Outro modelo de raciocínio open source com cadeia de pensamento, útil para comparar a abordagem do Qwythos com uma referência bem estabelecida.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.