Intermediário 14 minOllama

Qwen 3.8 27B localmente: instalação do Ollama e VRAM

Os pesos do Qwen3.8-27B foram lançados em 14 de agosto de 2026 no Hugging Face, sob a licença Apache 2.0, e a tag oficial do Ollama foi disponibilizada no mesmo dia. É o primeiro modelo da geração 3.8 que você pode realmente instalar em sua própria máquina: denso, multimodal (imagem e vídeo), com 262.144 tokens de contexto nativo. Este guia fornece o comando exato, a VRAM realmente necessária para cada tag, as configurações do modo “thinking”, ativado por padrão, e as duas armadilhas que prejudicam a maioria dos primeiros testes — o truncamento silencioso do contexto e a transferência de parte do modelo para a RAM do sistema.

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux

#O veredito em 30 segundos

Qwen 3.8 27B pode ser instalado com um único comando: « ollama run qwen3.8:27b ». O pacote padrão (Q4_K_M) pesa 18 GB e exige uma placa com 24 GB de VRAM — RTX 3090, 4090, 5090 — ou um Mac Apple Silicon com pelo menos 32 GB de memória unificada para trabalhar confortavelmente. Abaixo disso, o modelo continua rodando, mas parte das camadas passa a ser executada no processador e a taxa de geração cai drasticamente.

O que é
Um modelo denso de 27 bilhões de parâmetros, visão-linguagem nativa (imagens e vídeos), 262 144 tokens de contexto, sob a licença Apache 2.0 — portanto, utilizável comercialmente sem cláusula restritiva.
O requisito realista
24 GB de VRAM ou 32 GB de memória unificada para a versão Q4_K_M. 30 GB de arquivos e ~40 GB de VRAM para a Q8, 56 GB para a BF16.
O comando
ollama pull qwen3.8:27b puis ollama run qwen3.8:27b. Sur Mac, préférez le tag -mlx, optimisé Metal.
A armadilha nº 1
O contexto anunciado é de 256k, mas Ollama aplica uma janela padrão bem menor e trunca sem avisar. É preciso configurar num_ctx manualmente.
A armadilha nº 2
O modo « thinking » está ativo por padrão e consome muitos tokens antes de responder. Localmente, reduza reasoning_effort ou desative esse modo para tarefas simples.
!
Os números de desempenho vêm da Alibaba
Na data de publicação deste guia, nenhum benchmark independente havia sido reproduzido com o Qwen3.8-27B. Todas as pontuações citadas a seguir vêm da ficha oficial do modelo. Elas são coerentes com a geração anterior, mas devem ser tratadas como números fornecidos pelo desenvolvedor.

#O que Qwen 3.8 27B realmente é

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Diferentemente da tendência dos Mixture-of-Experts, o Qwen3.8-27B é um modelo denso: os 27 bilhões de parâmetros são ativados a cada token. É isso que torna seu uso de memória previsível — sem surpresas boas na taxa de geração, nem surpresas ruins na VRAM — e também explica uma taxa de geração local mais modesta que a de um MoE de tamanho comparável.

Arquitetura
64 camadas organizadas em 16 blocos de « 3 × (Gated DeltaNet → FFN), depois 1 × (Gated Attention → FFN) ». Uma atenção híbrida: a maioria das camadas usa atenção linear, econômica em memória, intercalada com camadas reais de atenção para maior precisão.
Modalidades
Visão-linguagem nativa: imagens estáticas, documentos, diagramas científicos e vídeos. Não se trata de um adaptador acrescentado posteriormente.
Contexto
262 144 tokens nativamente, expansível para 1 000 000 via YaRN — mas somente no vLLM, SGLang ou TokenSpeed, não via Ollama.
Licença
Apache 2.0. Uso comercial permitido, sem limite de usuários como no caso de Llama, sem cláusula de uso como no caso de Gemma.
Particularidade
O modelo é treinado com Multi-Token Prediction (MTP) — daí as tags Ollama « mtp », que aceleram a geração nos mecanismos que sabem aproveitá-lo.
i
Não confundir com o Qwen 3.8-Max
O Qwen 3.8-Max, lançado em 3 de agosto de 2026, é um MoE de cerca de 2 400 bilhões de parâmetros, disponível apenas via API: não existe nenhuma maneira de executá-lo na sua máquina. O 27B é a variante de pesos abertos da mesma geração. A cronologia completa é detalhada em nosso guia sobre pesos abertos Qwen 3.8.

#O hardware necessário, tag por tag

A biblioteca Ollama publica doze variantes. O tamanho do download não corresponde à VRAM necessária: é preciso acrescentar o cache KV, que cresce com o comprimento do contexto, e o codificador visual. Reserve uma margem de 15% a 25% acima do tamanho do arquivo.

Variantes oficiais do Qwen 3.8 27B no Ollama (levantamento de 18 de agosto de 2026)
TagTamanhoMemória para uso confortávelPara quem
qwen3.8:27b (Q4_K_M, padrão)18 GB24 GBA escolha padrão: RTX 3090/4090/5090, Mac de 32 GB
qwen3.8:27b-q8_030 GB40 GB e maisQualidade quase máxima: RTX Pro 6000, duas GPUs de 24 GB
qwen3.8:27b-bf1656 GB80 GBPesos de referência, máquinas de computação (H100, H200)
qwen3.8:27b-mlx18 GB32 GB unificadosApple Silicon: build com Metal, a opção padrão adequada no Mac
qwen3.8:27b-mxfp832 GB48 GB unificadosMac Studio / M4 Max 64 GB, qualidade superior
qwen3.8:27b-mlx-bf1656 GB96 GB de memória unificadaMac Studio 128 GB, sem perda decorrente da quantização
qwen3.8:27b-mtp-q4_K_M18 GB24 GBIgual à variante padrão, com predição explícita de múltiplos tokens
!
16 GB de VRAM: possível, mas não confortável
Em uma RTX 4060 Ti de 16 GB ou em uma 5070 Ti, a Q4_K_M não cabe inteiramente na memória: Ollama coloca o restante no processador e a geração frequentemente cai para menos de 5 tokens por segundo. Para 16 GB, um modelo de 12 a 14 bilhões de parâmetros continua sendo uma utilização muito melhor da máquina.

Quanto ao desempenho, nossas estimativas para um modelo denso de 27B em Q4 ficam em torno de 14 tokens por segundo em uma configuração intermediária e 22 tokens por segundo em uma configuração recente de ponta. São ordens de grandeza calculadas, não medições: o modo “thinking”, ativado por padrão, pode ainda dobrar o tempo percebido até a primeira linha de resposta.

#Instalar Qwen 3.8 27B com Ollama

  1. 01
    Atualize o Ollama
    As camadas híbridas e o parser de visão do Qwen 3.8 exigem uma versão recente do Ollama. Uma versão anterior a agosto de 2026 gerará um erro de arquitetura ou um 'model not found' enganoso. Reinstale a partir do site oficial ou execute novamente o script de instalação no Linux.
  2. 02
    Baixe o modelo
    São transferidos 18 GB: reserve espaço no disco do sistema, onde o Ollama armazena seus blobs. O pull pode ser retomado se a conexão cair.
  3. 03
    Inicie uma primeira conversa
    A primeira resposta é mais lenta, enquanto os pesos são carregados na memória. Se ela levar mais de um minuto para começar, é sinal de que parte do modelo está sendo executada no processador.
  4. 04
    Verifique onde o modelo está sendo executado
    O comando ollama ps mostra a distribuição entre GPU e CPU. Enquanto você não vir 100 % GPU na saída, cada token custa caro — use uma quantização um nível abaixo ou reduza o contexto.
Instalação e primeiro teste
# 1. Récupérer le modèle (18 Go)
ollama pull qwen3.8:27b

# 2. Discuter avec
ollama run qwen3.8:27b

# 3. Vérifier la répartition GPU / CPU
ollama ps
i
Apenas qwen3.8 = o 27B
A tag “qwen3.8:latest” aponta hoje para o mesmo blob que “qwen3.8:27b”: é o único formato publicado na biblioteca oficial. Escrever “ollama run qwen3.8” dá exatamente no mesmo — mas fixar o tamanho nos seus scripts evita surpresas desagradáveis quando outras variantes chegarem.

#No Mac Apple Silicon: escolha a variante MLX

O Ollama publica uma build MLX, compilada para o motor Metal da Apple. Com o mesmo tamanho de arquivo (18 GB), ela aproveita melhor a memória unificada e oferece uma taxa de geração sensivelmente superior à do GGUF genérico nos chips M3, M4 e posteriores.

No Mac Apple Silicon
# Build MLX (Metal) — recommandé sur M1/M2/M3/M4
ollama run qwen3.8:27b-mlx

# Mac 64 Go et plus : qualité supérieure
ollama run qwen3.8:27b-mxfp8
Mac 16 GB
Insuficiente. O macOS deixa apenas cerca de 70% da memória unificada disponível para a GPU: o modelo passa a usar swap e se torna inutilizável.
Mac 24 GB
Mal cabe com um contexto curto, sem outro aplicativo pesado aberto. Aceitável para testar, frustrante no uso.
Mac 32 GB
O verdadeiro ponto de entrada: o modelo cabe na memória e ainda há margem para o cache KV e o sistema.
Mac com 64 GB ou mais
Confortável, e permite passar para mxfp8 ou trabalhar com documentos longos.

#A armadilha do contexto de 256k

É o erro que quase todos os usuários iniciantes cometem. O modelo anuncia 262.144 tokens, mas o Ollama aplica por padrão uma janela muito mais curta: quando esse limite é ultrapassado, o início do seu documento é simplesmente cortado, sem mensagem de erro. O modelo responde com confiança sobre um texto que não viu por inteiro.

Ajustar a janela de contexto
# Dans une session interactive
/set parameter num_ctx 32768

# Ou via un Modelfile réutilisable
cat > Modelfile <<'EOF'
FROM qwen3.8:27b
PARAMETER num_ctx 32768
PARAMETER temperature 1.0
PARAMETER top_p 0.95
PARAMETER top_k 20
EOF
ollama create qwen38-long -f Modelfile
!
256k no papel, 16k a 64k na sua máquina
O cache KV cresce de forma aproximadamente linear com o contexto e se soma aos 18 GB dos pesos. Em uma placa de 24 GB, uma janela de 32.000 tokens é uma configuração adequada; 64.000 tokens cabem, ao custo de alguma lentidão; 262.144 está fora de alcance. Ativar a atenção rápida e quantizar o cache KV em q8_0 (variáveis OLLAMA_FLASH_ATTENTION e OLLAMA_KV_CACHE_TYPE) libera vários gigabytes.

Quanto ao milhão de tokens anunciado: ele depende de uma extensão YaRN, configurada no arquivo de configuração do modelo, e é compatível apenas com vLLM, SGLang ou TokenSpeed. Atualmente, não há nenhum caminho para acessá-lo pelo Ollama.

#Modo de raciocínio e parâmetros de amostragem

Qwen 3.8 reflete antes de responder: gera um bloco de raciocínio entre tags « think » e depois a resposta final. Isso está ativado por padrão e explica a maior parte da latência percebida. Nos motores que oferecem suporte a esse recurso, a profundidade é ajustada com reasoning_effort — xhigh por padrão, depois medium e low.

Parâmetros de amostragem recomendados pela Alibaba
Modotemperaturetop_ptop_kpresence_penalty
Thinking (padrão)1.00.95200.0
Instruct (sem raciocínio)0.70.80201.5
Tarefas curtas localmente
Reduza reasoning_effort para low ou medium: em uma reformulação ou extração, a reflexão longa não muda nada na qualidade e triplica o tempo de espera.
Tarefas agênticas
Mantenha xhigh. A Alibaba observa que um esforço reduzido provoca análises insuficientes e, portanto, retrabalho — o ganho por rodada é anulado pelas falhas.
Respostas que entram em loop
Aumente presence_penalty (entre 0 e 2). Acima de 1,5, o modelo começa a misturar idiomas.
Saída poluída pelo raciocínio
Se seu aplicativo exibe as tags de reflexão, isso significa que ele não separa reasoning_content do conteúdo final. Desative a reflexão para esse caso de uso em vez de filtrar o texto posteriormente.

#Analisar uma imagem ou um documento

A visão é nativa: captura de tela, foto de quadro, esquema técnico, página digitalizada. Na linha de comando, basta informar o caminho do arquivo no prompt; pela API, as imagens são enviadas codificadas em base64 no campo previsto pelo Ollama.

Visão na linha de comando
ollama run qwen3.8:27b
>>> Décris ce schéma et liste les valeurs lisibles ./schema.png
!
Teste a visão antes de colocá-la em produção
O processamento multimodal recebeu uma correção no parser pouco depois do lançamento. Se as respostas ignorarem a imagem ou descreverem outra coisa, atualize o Ollama antes de investigar mais — e valide com cerca de dez documentos seus antes de usar em escala.

#O que os scores anunciados realmente valem

O salto anunciado em relação ao Qwen 3.6-27B, o modelo de mesmo tamanho da geração anterior, é significativo — especialmente na programação com agentes e no uso do computador. Aqui estão os números divulgados pela Alibaba, lembrando que eles não foram reproduzidos de forma independente.

Qwen3.8-27B vs Qwen3.6-27B — pontuações divulgadas pela Alibaba (agosto de 2026)
TesteQwen3.8-27BQwen3.6-27B
Terminal Bench 2.1 (programação com agentes)73,063,4
SWE-bench Pro61,753,5
LiveCodeBench v690,383,9
IFBench (seguimento de instruções)79,569,1
GPQA Diamond (ciências)89,287,8
OSWorld-Verified (uso de computador)84,363,9
MathVision (matemática visual)90,085,1
OmniDocBench 1.5 (documentos)91,189,4

O que você deve ter em mente para uso local: os avanços se concentram principalmente em tarefas longas que usam ferramentas — controlar um terminal, corrigir um repositório, encadear etapas sem sair do rumo. Em uma conversa simples ou um resumo, a diferença em relação à geração anterior será muito menos evidente do que esses números sugerem.

#É necessário deixar de usar Qwen 3.6, Gemma 4 ou gpt-oss?

Você está em Qwen 3.6-27B
Sim, a atualização vale a pena: mesmo uso de memória, mesma licença permissiva, ganhos claros em programação e em tarefas com agentes. Mantenha a tag antiga enquanto valida seus prompts, pois as respostas mudam de estilo.
Você está usando o Gemma 4 26B
O Qwen 3.8 mantém a vantagem em programação e no uso de agentes; quanto à licença, ambos agora usam a Apache 2.0, já que o Gemma passou a ter uma licença permissiva em abril de 2026. O Gemma 4 (MoE 26B-A4B, multimodal) costuma continuar mais natural em conversas em francês e mais rápido para iniciar.
Você está no gpt-oss-20b
Duas filosofias: gpt-oss é mais leve e rápido, Qwen 3.8 vê imagens, suporta um contexto muito mais longo e é voltado para tarefas longas. Escolha de acordo com a VRAM disponível.
Você quer principalmente programar
Um modelo de 30B especializado em código, com arquitetura MoE, continua sendo mais rápido para autocompletar. Qwen 3.8 27B se justifica quando o agente precisa ler, planejar e modificar vários arquivos.
Você tem menos de 24 GB
Não force. Um modelo de 12-14B em Q4 dará a você uma experiência melhor do que um de 27B que precisa transferir parte do processamento para a CPU.

#Solução de problemas

« model not found » ao executar pull
A versão do Ollama é antiga demais para reconhecer esse repositório, ou a tag está escrita incorretamente — a forma correta é « qwen3.8:27b », com ponto, não com hífen. Atualize o Ollama e tente novamente.
Erro de arquitetura ao carregar
A mesma causa: as camadas híbridas do Qwen 3.8 só são compatíveis com as versões recentes do mecanismo.
Geração muito lenta (menos de 5 tokens/s)
Parte do modelo é transferida para a RAM por não caber na VRAM. Verifique com ollama ps: se a distribuição não indicar 100% na GPU, reduza num_ctx, feche os outros aplicativos que usam a GPU ou mude para um modelo menor.
Respostas que ignoram o início do documento
Contexto truncado sem aviso. Ajuste num_ctx ao tamanho real da sua entrada ou divida o documento.
O modelo “pensa” sem parar
reasoning_effort alto demais para a tarefa. Reduza para medium ou low, ou desative o raciocínio para tarefas simples.
A imagem é ignorada
O caminho do arquivo precisa estar acessível a partir do processo Ollama, e o analisador de visão exige uma versão atualizada. Teste com uma imagem local simples antes de culpar o modelo.
Falta de espaço em disco
Entre os blobs e o cache, reserve o dobro do tamanho anunciado durante a instalação. Um pull interrompido por um disco cheio deixa fragmentos: ollama rm e depois um novo pull.
Perguntas frequentes
De quanta VRAM Qwen 3.8 27B precisa?+
24 GB de VRAM para a versão padrão Q4_K_M, cujos arquivos ocupam 18 GB, aos quais se soma o cache KV. Reserve 40 GB para a versão Q8 e 56 GB para os pesos BF16. No Mac, são necessários pelo menos 32 GB de memória unificada.
Como instalar Qwen 3.8 27B localmente?+
Instale ou atualize Ollama e, em seguida, execute « ollama pull qwen3.8:27b » e « ollama run qwen3.8:27b ». O download tem 18 GB. Em um Mac Apple Silicon, prefira a tag qwen3.8:27b-mlx, otimizada para Metal.
O Qwen 3.8 27B é gratuito e pode ser usado em empresas?+
Sim. Os pesos são publicados sob a licença Apache 2.0, que autoriza o uso comercial, a modificação e a redistribuição, sem limite de usuários nem cláusula de uso restritiva. É uma das licenças mais permissivas entre os modelos abertos.
Qual é a diferença entre Qwen 3.8 27B e Qwen 3.8-Max?+
Qwen 3.8-Max é um modelo proprietário do tipo Mixture-of-Experts com aproximadamente 2.400 bilhões de parâmetros, acessível apenas por API. Qwen3.8-27B é a variante densa com pesos abertos da mesma geração: é a única das duas que você pode rodar em sua máquina.
É possível executar Qwen 3.8 27B com 16 GB de VRAM?+
Tecnicamente sim, mas parte do modelo passa a ser executada no processador (CPU), e a velocidade geralmente cai para menos de 5 tokens por segundo. Com 16 GB, um modelo com 12 a 14 bilhões de parâmetros oferece uma experiência muito melhor.
Qwen 3.8 27B é melhor que Qwen 3.6 27B?+
De acordo com os dados publicados pela Alibaba, sim, claramente na programação com agentes (73,0 contra 63,4 no Terminal Bench 2.1) e no uso de computador (84,3 contra 63,9 no OSWorld-Verified). Esses resultados ainda não foram reproduzidos de forma independente, e a diferença é menos perceptível nos usos conversacionais.
É possível desativar o modo de reflexão do Qwen 3.8?+
Sim. O modo thinking fica ativo por padrão, mas pode ser desativado por solicitação, e sua profundidade é ajustada com o parâmetro reasoning_effort (xhigh, medium ou low). No modo direto, as configurações recomendadas são temperature 0,7 e top_p 0,80.
O contexto de um milhão de tokens está disponível localmente?+
Não via Ollama. O contexto nativo é de 262 144 tokens, e a extensão para um milhão passa por uma configuração YaRN compatível apenas com vLLM, SGLang e TokenSpeed. Na prática, em uma placa de 24 GB, uma janela de 16 000 a 64 000 tokens é a configuração realista.

#Para se aprofundar

Este guia pressupõe uma instalação funcional do Ollama e uma escolha consciente de quantização. Estas páginas complementam o tema:

Instalar Ollama
O pré-requisito, se o motor ainda não estiver instalado, no Windows, macOS ou Linux — e a atualização, indispensável para o Qwen 3.8.
Escolher sua quantização
Para decidir entre Q4, Q8 e BF16 de forma bem informada: quanto cada nível exige de memória e o que oferece em qualidade.
Qwen 3.8: a cronologia dos modelos com pesos abertos
De onde vem a confusão entre o Max via API e o 27B aberto, e o que realmente foi anunciado e quando.
Qual LLM para 24 GB de VRAM
A comparação dos modelos que cabem em uma placa de 24 GB, caso você ainda esteja em dúvida entre Qwen 3.8 27B e uma alternativa mais leve.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.