Qwen 3.8 27B localmente: instalação do Ollama e VRAM
Os pesos do Qwen3.8-27B foram lançados em 14 de agosto de 2026 no Hugging Face, sob a licença Apache 2.0, e a tag oficial do Ollama foi disponibilizada no mesmo dia. É o primeiro modelo da geração 3.8 que você pode realmente instalar em sua própria máquina: denso, multimodal (imagem e vídeo), com 262.144 tokens de contexto nativo. Este guia fornece o comando exato, a VRAM realmente necessária para cada tag, as configurações do modo “thinking”, ativado por padrão, e as duas armadilhas que prejudicam a maioria dos primeiros testes — o truncamento silencioso do contexto e a transferência de parte do modelo para a RAM do sistema.
#O veredito em 30 segundos
Qwen 3.8 27B pode ser instalado com um único comando: « ollama run qwen3.8:27b ». O pacote padrão (Q4_K_M) pesa 18 GB e exige uma placa com 24 GB de VRAM — RTX 3090, 4090, 5090 — ou um Mac Apple Silicon com pelo menos 32 GB de memória unificada para trabalhar confortavelmente. Abaixo disso, o modelo continua rodando, mas parte das camadas passa a ser executada no processador e a taxa de geração cai drasticamente.
- O que é
- Um modelo denso de 27 bilhões de parâmetros, visão-linguagem nativa (imagens e vídeos), 262 144 tokens de contexto, sob a licença Apache 2.0 — portanto, utilizável comercialmente sem cláusula restritiva.
- O requisito realista
- 24 GB de VRAM ou 32 GB de memória unificada para a versão Q4_K_M. 30 GB de arquivos e ~40 GB de VRAM para a Q8, 56 GB para a BF16.
- O comando
- ollama pull qwen3.8:27b puis ollama run qwen3.8:27b. Sur Mac, préférez le tag -mlx, optimisé Metal.
- A armadilha nº 1
- O contexto anunciado é de 256k, mas Ollama aplica uma janela padrão bem menor e trunca sem avisar. É preciso configurar num_ctx manualmente.
- A armadilha nº 2
- O modo « thinking » está ativo por padrão e consome muitos tokens antes de responder. Localmente, reduza reasoning_effort ou desative esse modo para tarefas simples.
#O que Qwen 3.8 27B realmente é
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Diferentemente da tendência dos Mixture-of-Experts, o Qwen3.8-27B é um modelo denso: os 27 bilhões de parâmetros são ativados a cada token. É isso que torna seu uso de memória previsível — sem surpresas boas na taxa de geração, nem surpresas ruins na VRAM — e também explica uma taxa de geração local mais modesta que a de um MoE de tamanho comparável.
- Arquitetura
- 64 camadas organizadas em 16 blocos de « 3 × (Gated DeltaNet → FFN), depois 1 × (Gated Attention → FFN) ». Uma atenção híbrida: a maioria das camadas usa atenção linear, econômica em memória, intercalada com camadas reais de atenção para maior precisão.
- Modalidades
- Visão-linguagem nativa: imagens estáticas, documentos, diagramas científicos e vídeos. Não se trata de um adaptador acrescentado posteriormente.
- Contexto
- 262 144 tokens nativamente, expansível para 1 000 000 via YaRN — mas somente no vLLM, SGLang ou TokenSpeed, não via Ollama.
- Licença
- Apache 2.0. Uso comercial permitido, sem limite de usuários como no caso de Llama, sem cláusula de uso como no caso de Gemma.
- Particularidade
- O modelo é treinado com Multi-Token Prediction (MTP) — daí as tags Ollama « mtp », que aceleram a geração nos mecanismos que sabem aproveitá-lo.
#O hardware necessário, tag por tag
A biblioteca Ollama publica doze variantes. O tamanho do download não corresponde à VRAM necessária: é preciso acrescentar o cache KV, que cresce com o comprimento do contexto, e o codificador visual. Reserve uma margem de 15% a 25% acima do tamanho do arquivo.
| Tag | Tamanho | Memória para uso confortável | Para quem |
|---|---|---|---|
| qwen3.8:27b (Q4_K_M, padrão) | 18 GB | 24 GB | A escolha padrão: RTX 3090/4090/5090, Mac de 32 GB |
| qwen3.8:27b-q8_0 | 30 GB | 40 GB e mais | Qualidade quase máxima: RTX Pro 6000, duas GPUs de 24 GB |
| qwen3.8:27b-bf16 | 56 GB | 80 GB | Pesos de referência, máquinas de computação (H100, H200) |
| qwen3.8:27b-mlx | 18 GB | 32 GB unificados | Apple Silicon: build com Metal, a opção padrão adequada no Mac |
| qwen3.8:27b-mxfp8 | 32 GB | 48 GB unificados | Mac Studio / M4 Max 64 GB, qualidade superior |
| qwen3.8:27b-mlx-bf16 | 56 GB | 96 GB de memória unificada | Mac Studio 128 GB, sem perda decorrente da quantização |
| qwen3.8:27b-mtp-q4_K_M | 18 GB | 24 GB | Igual à variante padrão, com predição explícita de múltiplos tokens |
Quanto ao desempenho, nossas estimativas para um modelo denso de 27B em Q4 ficam em torno de 14 tokens por segundo em uma configuração intermediária e 22 tokens por segundo em uma configuração recente de ponta. São ordens de grandeza calculadas, não medições: o modo “thinking”, ativado por padrão, pode ainda dobrar o tempo percebido até a primeira linha de resposta.
#Instalar Qwen 3.8 27B com Ollama
- 01Atualize o OllamaAs camadas híbridas e o parser de visão do Qwen 3.8 exigem uma versão recente do Ollama. Uma versão anterior a agosto de 2026 gerará um erro de arquitetura ou um 'model not found' enganoso. Reinstale a partir do site oficial ou execute novamente o script de instalação no Linux.
- 02Baixe o modeloSão transferidos 18 GB: reserve espaço no disco do sistema, onde o Ollama armazena seus blobs. O pull pode ser retomado se a conexão cair.
- 03Inicie uma primeira conversaA primeira resposta é mais lenta, enquanto os pesos são carregados na memória. Se ela levar mais de um minuto para começar, é sinal de que parte do modelo está sendo executada no processador.
- 04Verifique onde o modelo está sendo executadoO comando ollama ps mostra a distribuição entre GPU e CPU. Enquanto você não vir 100 % GPU na saída, cada token custa caro — use uma quantização um nível abaixo ou reduza o contexto.
#No Mac Apple Silicon: escolha a variante MLX
O Ollama publica uma build MLX, compilada para o motor Metal da Apple. Com o mesmo tamanho de arquivo (18 GB), ela aproveita melhor a memória unificada e oferece uma taxa de geração sensivelmente superior à do GGUF genérico nos chips M3, M4 e posteriores.
- Mac 16 GB
- Insuficiente. O macOS deixa apenas cerca de 70% da memória unificada disponível para a GPU: o modelo passa a usar swap e se torna inutilizável.
- Mac 24 GB
- Mal cabe com um contexto curto, sem outro aplicativo pesado aberto. Aceitável para testar, frustrante no uso.
- Mac 32 GB
- O verdadeiro ponto de entrada: o modelo cabe na memória e ainda há margem para o cache KV e o sistema.
- Mac com 64 GB ou mais
- Confortável, e permite passar para mxfp8 ou trabalhar com documentos longos.
#A armadilha do contexto de 256k
É o erro que quase todos os usuários iniciantes cometem. O modelo anuncia 262.144 tokens, mas o Ollama aplica por padrão uma janela muito mais curta: quando esse limite é ultrapassado, o início do seu documento é simplesmente cortado, sem mensagem de erro. O modelo responde com confiança sobre um texto que não viu por inteiro.
Quanto ao milhão de tokens anunciado: ele depende de uma extensão YaRN, configurada no arquivo de configuração do modelo, e é compatível apenas com vLLM, SGLang ou TokenSpeed. Atualmente, não há nenhum caminho para acessá-lo pelo Ollama.
#Modo de raciocínio e parâmetros de amostragem
Qwen 3.8 reflete antes de responder: gera um bloco de raciocínio entre tags « think » e depois a resposta final. Isso está ativado por padrão e explica a maior parte da latência percebida. Nos motores que oferecem suporte a esse recurso, a profundidade é ajustada com reasoning_effort — xhigh por padrão, depois medium e low.
| Modo | temperature | top_p | top_k | presence_penalty |
|---|---|---|---|---|
| Thinking (padrão) | 1.0 | 0.95 | 20 | 0.0 |
| Instruct (sem raciocínio) | 0.7 | 0.80 | 20 | 1.5 |
- Tarefas curtas localmente
- Reduza reasoning_effort para low ou medium: em uma reformulação ou extração, a reflexão longa não muda nada na qualidade e triplica o tempo de espera.
- Tarefas agênticas
- Mantenha xhigh. A Alibaba observa que um esforço reduzido provoca análises insuficientes e, portanto, retrabalho — o ganho por rodada é anulado pelas falhas.
- Respostas que entram em loop
- Aumente presence_penalty (entre 0 e 2). Acima de 1,5, o modelo começa a misturar idiomas.
- Saída poluída pelo raciocínio
- Se seu aplicativo exibe as tags de reflexão, isso significa que ele não separa reasoning_content do conteúdo final. Desative a reflexão para esse caso de uso em vez de filtrar o texto posteriormente.
#Analisar uma imagem ou um documento
A visão é nativa: captura de tela, foto de quadro, esquema técnico, página digitalizada. Na linha de comando, basta informar o caminho do arquivo no prompt; pela API, as imagens são enviadas codificadas em base64 no campo previsto pelo Ollama.
#O que os scores anunciados realmente valem
O salto anunciado em relação ao Qwen 3.6-27B, o modelo de mesmo tamanho da geração anterior, é significativo — especialmente na programação com agentes e no uso do computador. Aqui estão os números divulgados pela Alibaba, lembrando que eles não foram reproduzidos de forma independente.
| Teste | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
| Terminal Bench 2.1 (programação com agentes) | 73,0 | 63,4 |
| SWE-bench Pro | 61,7 | 53,5 |
| LiveCodeBench v6 | 90,3 | 83,9 |
| IFBench (seguimento de instruções) | 79,5 | 69,1 |
| GPQA Diamond (ciências) | 89,2 | 87,8 |
| OSWorld-Verified (uso de computador) | 84,3 | 63,9 |
| MathVision (matemática visual) | 90,0 | 85,1 |
| OmniDocBench 1.5 (documentos) | 91,1 | 89,4 |
O que você deve ter em mente para uso local: os avanços se concentram principalmente em tarefas longas que usam ferramentas — controlar um terminal, corrigir um repositório, encadear etapas sem sair do rumo. Em uma conversa simples ou um resumo, a diferença em relação à geração anterior será muito menos evidente do que esses números sugerem.
#É necessário deixar de usar Qwen 3.6, Gemma 4 ou gpt-oss?
- Você está em Qwen 3.6-27B
- Sim, a atualização vale a pena: mesmo uso de memória, mesma licença permissiva, ganhos claros em programação e em tarefas com agentes. Mantenha a tag antiga enquanto valida seus prompts, pois as respostas mudam de estilo.
- Você está usando o Gemma 4 26B
- O Qwen 3.8 mantém a vantagem em programação e no uso de agentes; quanto à licença, ambos agora usam a Apache 2.0, já que o Gemma passou a ter uma licença permissiva em abril de 2026. O Gemma 4 (MoE 26B-A4B, multimodal) costuma continuar mais natural em conversas em francês e mais rápido para iniciar.
- Você está no gpt-oss-20b
- Duas filosofias: gpt-oss é mais leve e rápido, Qwen 3.8 vê imagens, suporta um contexto muito mais longo e é voltado para tarefas longas. Escolha de acordo com a VRAM disponível.
- Você quer principalmente programar
- Um modelo de 30B especializado em código, com arquitetura MoE, continua sendo mais rápido para autocompletar. Qwen 3.8 27B se justifica quando o agente precisa ler, planejar e modificar vários arquivos.
- Você tem menos de 24 GB
- Não force. Um modelo de 12-14B em Q4 dará a você uma experiência melhor do que um de 27B que precisa transferir parte do processamento para a CPU.
#Solução de problemas
- « model not found » ao executar pull
- A versão do Ollama é antiga demais para reconhecer esse repositório, ou a tag está escrita incorretamente — a forma correta é « qwen3.8:27b », com ponto, não com hífen. Atualize o Ollama e tente novamente.
- Erro de arquitetura ao carregar
- A mesma causa: as camadas híbridas do Qwen 3.8 só são compatíveis com as versões recentes do mecanismo.
- Geração muito lenta (menos de 5 tokens/s)
- Parte do modelo é transferida para a RAM por não caber na VRAM. Verifique com ollama ps: se a distribuição não indicar 100% na GPU, reduza num_ctx, feche os outros aplicativos que usam a GPU ou mude para um modelo menor.
- Respostas que ignoram o início do documento
- Contexto truncado sem aviso. Ajuste num_ctx ao tamanho real da sua entrada ou divida o documento.
- O modelo “pensa” sem parar
- reasoning_effort alto demais para a tarefa. Reduza para medium ou low, ou desative o raciocínio para tarefas simples.
- A imagem é ignorada
- O caminho do arquivo precisa estar acessível a partir do processo Ollama, e o analisador de visão exige uma versão atualizada. Teste com uma imagem local simples antes de culpar o modelo.
- Falta de espaço em disco
- Entre os blobs e o cache, reserve o dobro do tamanho anunciado durante a instalação. Um pull interrompido por um disco cheio deixa fragmentos: ollama rm e depois um novo pull.
De quanta VRAM Qwen 3.8 27B precisa?+
Como instalar Qwen 3.8 27B localmente?+
O Qwen 3.8 27B é gratuito e pode ser usado em empresas?+
Qual é a diferença entre Qwen 3.8 27B e Qwen 3.8-Max?+
É possível executar Qwen 3.8 27B com 16 GB de VRAM?+
Qwen 3.8 27B é melhor que Qwen 3.6 27B?+
É possível desativar o modo de reflexão do Qwen 3.8?+
O contexto de um milhão de tokens está disponível localmente?+
#Para se aprofundar
Este guia pressupõe uma instalação funcional do Ollama e uma escolha consciente de quantização. Estas páginas complementam o tema:
- Instalar Ollama
- O pré-requisito, se o motor ainda não estiver instalado, no Windows, macOS ou Linux — e a atualização, indispensável para o Qwen 3.8.
- Escolher sua quantização
- Para decidir entre Q4, Q8 e BF16 de forma bem informada: quanto cada nível exige de memória e o que oferece em qualidade.
- Qwen 3.8: a cronologia dos modelos com pesos abertos
- De onde vem a confusão entre o Max via API e o 27B aberto, e o que realmente foi anunciado e quando.
- Qual LLM para 24 GB de VRAM
- A comparação dos modelos que cabem em uma placa de 24 GB, caso você ainda esteja em dúvida entre Qwen 3.8 27B e uma alternativa mais leve.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.