Llama 4 Scout localmente: instalação e primeiros testes com Ollama
Llama 4 Scout é o menor dos três modelos da família Llama 4 da Meta. É também o único que cabe em uma estação de trabalho de alto desempenho para execução local — Maverick e Behemoth continuam restritos à nuvem ou a servidores dedicados. Este guia mostra como instalar Llama 4 Scout com Ollama, quanta VRAM é realmente necessária (a promessa do MoE costuma ser mal compreendida) e como aproveitar seus dois diferenciais: a multimodalidade nativa e o contexto de 10M de tokens.
#Por que instalar Llama 4 Scout localmente com Ollama?
Scout é o único modelo da linha Llama 4 desenvolvido para rodar em uma única máquina. A Meta o posicionou como o "workstation model" da família: multimodal nativamente (texto + imagens), janela de contexto anunciada de 10 milhões de tokens e arquitetura MoE (Mixture of Experts) que ativa apenas uma fração dos parâmetros por token.
Na prática, em comparação com um modelo denso de tamanho equivalente, o Scout oferece menor latência (poucos parâmetros ativos por token), uma memória de contexto muito maior e recursos de visão incluídos, sem um modelo separado. O preço a pagar: um tamanho considerável em disco (todos os especialistas devem permanecer carregados na VRAM para que o roteamento funcione).
#Scout, Maverick, Behemoth: quem faz o quê
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
- Scout (17B ativos)
- O modelo para estações de trabalho. 16 especialistas, ~109B de parâmetros no total. Multimodal. Contexto de 10M de tokens. Destinado a RTX 4090, M3/M4 Max/Ultra ou uma configuração multi-GPU com 48 GB ou mais.
- Maverick (17B ativos)
- O modelo para servidores. 128 especialistas, ~400B parâmetros no total. Mesmo número de parâmetros ativos que o Scout, mas com muito mais conhecimento codificado. Destinado a um servidor com 8 GPUs H100 ou a um cluster. Fora de alcance para uso local na maioria das configurações.
- Behemoth (288B ativos)
- O modelo de fronteira. ~2T parâmetros totais. Não executável localmente sem datacenter. Útil sobretudo como modelo "professor" para destilar os outros dois.
#VRAM real: o que a ficha técnica não diz
O erro clássico com modelos MoE é considerar apenas os parâmetros ativos. "17B ativos = cabe em 12 GB em Q4": falso. Para que o roteamento funcione, todos os especialistas devem permanecer na memória. O Scout em Q4_K_M exige muito mais do que seus 17B ativos fariam supor.
- Q4_K_M (recomendado)
- ≈ 65 GB de VRAM apenas para o modelo. Adicionar ~4 GB para um contexto razoável (32k tokens). Total ≈ 70 GB.
- Q5_K_M
- ≈ 78 GB. Ganho marginal de qualidade na maioria das tarefas em comparação com o Q4_K_M.
- Q8_0
- ≈ 115 GB. Reservado para benchmarks de referência.
- FP16
- ≈ 220 GB. Apenas na nuvem ou em múltiplos servidores.
Configurações que permitem rodar o Scout com folga localmente:
- Mac Studio M3 Ultra / M5 Ultra com 96 GB ou mais
- A melhor plataforma de consumo para o Scout. Memória unificada, sem offload, ~25-40 tokens/sec de acordo com a quantização.
- 2x RTX 4090 / 2x 5090
- 48 GB ou 64 GB no total, suficientes para Q4_K_M com contexto ampliado. Contar com llama.cpp ou Ollama com a variável OLLAMA_NUM_GPU.
- Workstation RTX 6000 Ada (48 GB) ou A6000
- O Scout Q4 cabe com folga, com margem para o contexto.
#Pré-requisitos
- Ollama 0.6 ou mais recente
- O suporte a Llama 4 foi adicionado a partir de Ollama 0.6. Verifique com o comando ollama --version e atualize, se necessário.
- 70 GB de espaço em disco livre
- A tag Q4_K_M pesa aproximadamente 65 GB. Reserve espaço com folga para o cache.
- Largura de banda de memória elevada
- No Mac: visar ≥ 400 GB/s (M3 Max e superiores). No PC: DDR5 se estiver previsto o offload para a CPU.
- Uma conexão estável
- O download inicial pode durar de 1 a 3 horas dependendo do seu link. ollama pull supporte a recuperação em caso de interrupção.
#1. Instalar Llama 4 Scout com Ollama
Se Ollama ainda não estiver instalado, siga primeiro o guia adequado ao seu sistema. Em seguida, o download de Scout é feito com um único comando.
Esta tag aponta por padrão para a quantização Q4_K_M. Se quiser forçar outra variante:
Após a conclusão do download, liste os modelos para confirmar o tamanho real:
#2. Primeiro teste: texto e raciocínio
Inicie uma sessão interativa para validar o funcionamento correto antes de tocar no resto.
Ao aparecer o prompt >>>, verifique a língua e a qualidade do raciocínio com um teste simples:
Enquanto a conversa avança, abra um segundo terminal para observar a carga:
A coluna SIZE deve refletir o tamanho efetivamente carregado. Em PROCESSOR, o ideal é 100% GPU. Se você vir uma combinação CPU/GPU, é porque a VRAM não é suficiente e o Ollama está fazendo offload — a velocidade será severamente afetada.
#3. Teste de visão em francês
Scout é multimodal nativamente: imagem e texto passam pelo mesmo backbone, ao contrário de uma abordagem que acopla um codificador visual separado a um modelo puramente textual. Isso dá melhores resultados em tarefas que misturam as duas modalidades (OCR contextual, leitura de esquemas, descrição detalhada).
Com a API REST de Ollama, enviamos a imagem em base64 no campo images:
Em casos típicos (captura de tela de interface, foto de quadro branco, escaneamento de PDF), o Scout gera uma descrição detalhada e permanece coerente em francês mesmo quando a imagem contém texto em inglês. Está um nível acima de um modelo de visão pequeno e generalista como o Qwen 3.5 9B em termos de detalhes estruturados.
#4. Contexto de 10M tokens: promessa e realidade
A Meta anuncia uma janela de contexto de 10 milhões de tokens para o Scout. Na prática, duas limitações se impõem na execução local.
- O cache KV explode
- Com 1 milhão de tokens, o cache KV adiciona facilmente entre 30 e 50 GB à VRAM utilizada pelo modelo. Acima disso, é necessário ativar a quantização do cache KV (opção num_ctx + parâmetros experimentais) ou aceitar o offload do cache para a CPU.
- A qualidade cai bem antes de 10M
- Os benchmarks independentes (RULER, NoLiMa) mostram uma queda no desempenho efetivo por volta de 256k–512k tokens, apesar do treinamento com contexto longo. Além disso, é tecnicamente possível, mas pouco confiável.
Para aproveitar um contexto estendido sem fazer tudo travar, configure o Ollama por meio de um Modelfile:
#Scout vs Qwen3-30B-A3B: o verdadeiro comparativo
Qwen3-30B-A3B é o outro MoE seriamente considerado para uso local em 2026: 30B totais, 3B ativos, contexto nativo de 256k. A comparação vale a pena, pois os dois não competem na mesma categoria em termos de hardware.
- Uso de VRAM em Q4
- Scout ≈ 65 GB. Qwen3-30B-A3B ≈ 18 GB. A diferença é enorme e muda completamente o perfil da máquina necessária.
- Velocidade de geração
- Com parâmetros ativos comparáveis (17B vs 3B), Qwen3-30B-A3B é mais rápido em tokens por segundo — tipicamente 2 a 3 vezes mais rápido na mesma máquina, quando os dois cabem na memória.
- Qualidade de raciocínio
- Nos benchmarks públicos MMLU-Pro, GPQA, Scout continua à frente do Qwen3-30B-A3B. A diferença se reduz bastante com o modo thinking do Qwen3 ativado.
- Multimodalidade
- Scout é nativamente multimodal. Qwen3-30B-A3B não é — é necessário usar um modelo de visão separado como Qwen 3.5 9B em paralelo se você quiser visão na mesma stack.
- Contexto longo
- Scout visa 10M (256k de forma estável na prática). Qwen3-30B-A3B oferece 256k nativos, com comportamento mais previsível e menor consumo de memória para o cache KV.
#Solução de problemas
- "Error: model requires more system memory than is available"
- A capacidade total da sua VRAM e RAM é insuficiente. Passe para uma quantização mais agressiva (rara em Q4, que já deixa pouca margem) ou mude de modelo. O Ollama não faz milagres.
- Velocidade < 5 tokens/s em GPU de 24 GB
- Você está com offload no CPU. Verifique com o ollama ps: a coluna PROCESSOR deve mostrar 100% GPU. Caso contrário, o Scout não é adequado para sua máquina.
- Respostas truncadas
- Aumente num_predict (padrão 128 em algumas configurações). Com /set parameter num_predict 2048 na sessão, ou via Modelfile.
- Falhas acima de 64k tokens
- O cache KV satura a VRAM. Reduza num_ctx ou ative a quantização do cache KV via OLLAMA_FLASH_ATTENTION=1 + OLLAMA_KV_CACHE_TYPE=q8_0 no ambiente.
- Imagem recusada com "unsupported image format"
- Converta para JPEG ou PNG padrão. Dependendo da versão do Ollama, nem todos os formatos WebP, HEIC e AVIF são suportados.
#Para se aprofundar
Quando o Scout estiver funcionando, vale a pena explorar vários caminhos para aproveitar suas características específicas.
- Escolher bem a quantização
- Q4_K_M é o ponto ideal para o Scout, mas entender quando subir para Q5 ou Q8 depende do caso de uso — especialmente em tarefas multimodais, nas quais a quantização pode degradar a qualidade mais do que em tarefas de texto puro.
- Explorar a visão localmente
- O guia específico de visão aborda os padrões de prompt que realmente funcionam (OCR contextual, extração estruturada, comparação de imagens) com o Scout e seus concorrentes multimodais, como Qwen 3.5 9B e Gemma 4 12B.
- Modelfile para personalizar
- Além de num_ctx, um Modelfile permite fixar um prompt de sistema, um formato de saída JSON e uma temperatura adequada ao seu caso — útil para não precisar reconfigurar tudo a cada sessão.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.