Intermediário 12 minOllama

Llama 4 Scout localmente: instalação e primeiros testes com Ollama

Llama 4 Scout é o menor dos três modelos da família Llama 4 da Meta. É também o único que cabe em uma estação de trabalho de alto desempenho para execução local — Maverick e Behemoth continuam restritos à nuvem ou a servidores dedicados. Este guia mostra como instalar Llama 4 Scout com Ollama, quanta VRAM é realmente necessária (a promessa do MoE costuma ser mal compreendida) e como aproveitar seus dois diferenciais: a multimodalidade nativa e o contexto de 10M de tokens.

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux

#Por que instalar Llama 4 Scout localmente com Ollama?

Scout é o único modelo da linha Llama 4 desenvolvido para rodar em uma única máquina. A Meta o posicionou como o "workstation model" da família: multimodal nativamente (texto + imagens), janela de contexto anunciada de 10 milhões de tokens e arquitetura MoE (Mixture of Experts) que ativa apenas uma fração dos parâmetros por token.

Na prática, em comparação com um modelo denso de tamanho equivalente, o Scout oferece menor latência (poucos parâmetros ativos por token), uma memória de contexto muito maior e recursos de visão incluídos, sem um modelo separado. O preço a pagar: um tamanho considerável em disco (todos os especialistas devem permanecer carregados na VRAM para que o roteamento funcione).

i
MoE em poucas palavras
Um modelo MoE como o Scout contém N 'experts' (sub-redes especializadas). Em cada token, um roteador escolhe k (normalmente 1 ou 2). Apenas esses k experts são calculados. Resultado: a velocidade de inferência é a de um modelo pequeno, mas a qualidade tende à de um grande. Os parâmetros totais permanecem na VRAM — apenas o cálculo é parcial.

#Scout, Maverick, Behemoth: quem faz o quê

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias
Scout (17B ativos)
O modelo para estações de trabalho. 16 especialistas, ~109B de parâmetros no total. Multimodal. Contexto de 10M de tokens. Destinado a RTX 4090, M3/M4 Max/Ultra ou uma configuração multi-GPU com 48 GB ou mais.
Maverick (17B ativos)
O modelo para servidores. 128 especialistas, ~400B parâmetros no total. Mesmo número de parâmetros ativos que o Scout, mas com muito mais conhecimento codificado. Destinado a um servidor com 8 GPUs H100 ou a um cluster. Fora de alcance para uso local na maioria das configurações.
Behemoth (288B ativos)
O modelo de fronteira. ~2T parâmetros totais. Não executável localmente sem datacenter. Útil sobretudo como modelo "professor" para destilar os outros dois.
→
Qual escolher?
Se você está lendo este guia e instalando localmente, é o Scout. Maverick exige, pelo menos, um servidor com múltiplas GPUs de alto desempenho — nesse nível, os guias DeepSeek V4 Flash ou Qwen3.7 Max são mais adequados.

#VRAM real: o que a ficha técnica não diz

O erro clássico com modelos MoE é considerar apenas os parâmetros ativos. "17B ativos = cabe em 12 GB em Q4": falso. Para que o roteamento funcione, todos os especialistas devem permanecer na memória. O Scout em Q4_K_M exige muito mais do que seus 17B ativos fariam supor.

Q4_K_M (recomendado)
≈ 65 GB de VRAM apenas para o modelo. Adicionar ~4 GB para um contexto razoável (32k tokens). Total ≈ 70 GB.
Q5_K_M
≈ 78 GB. Ganho marginal de qualidade na maioria das tarefas em comparação com o Q4_K_M.
Q8_0
≈ 115 GB. Reservado para benchmarks de referência.
FP16
≈ 220 GB. Apenas na nuvem ou em múltiplos servidores.
!
Não indicado para uma GPU de 24 GB
Se você tiver apenas uma RTX 4090 ou uma 3090, o Scout não funcionará corretamente. Você pode forçar o offload para a CPU, mas a velocidade despenca (< 2 tokens/s). Para uma GPU de 24 GB, considere Qwen3-30B-A3B ou Mistral Small 24B. Para uma RTX 5090 de 32 GB, Qwen 3.6 35B-A3B continua sendo uma opção mais adequada do que o Scout com offload.

Configurações que permitem rodar o Scout com folga localmente:

Mac Studio M3 Ultra / M5 Ultra com 96 GB ou mais
A melhor plataforma de consumo para o Scout. Memória unificada, sem offload, ~25-40 tokens/sec de acordo com a quantização.
2x RTX 4090 / 2x 5090
48 GB ou 64 GB no total, suficientes para Q4_K_M com contexto ampliado. Contar com llama.cpp ou Ollama com a variável OLLAMA_NUM_GPU.
Workstation RTX 6000 Ada (48 GB) ou A6000
O Scout Q4 cabe com folga, com margem para o contexto.

#Pré-requisitos

Ollama 0.6 ou mais recente
O suporte a Llama 4 foi adicionado a partir de Ollama 0.6. Verifique com o comando ollama --version e atualize, se necessário.
70 GB de espaço em disco livre
A tag Q4_K_M pesa aproximadamente 65 GB. Reserve espaço com folga para o cache.
Largura de banda de memória elevada
No Mac: visar ≥ 400 GB/s (M3 Max e superiores). No PC: DDR5 se estiver previsto o offload para a CPU.
Uma conexão estável
O download inicial pode durar de 1 a 3 horas dependendo do seu link. ollama pull supporte a recuperação em caso de interrupção.

#1. Instalar Llama 4 Scout com Ollama

Se Ollama ainda não estiver instalado, siga primeiro o guia adequado ao seu sistema. Em seguida, o download de Scout é feito com um único comando.

Terminal — pull do modelo
ollama pull llama4:scout

Esta tag aponta por padrão para a quantização Q4_K_M. Se quiser forçar outra variante:

Variantes disponíveis
ollama pull llama4:scout-q5_K_M
ollama pull llama4:scout-q8_0
ollama pull llama4:scout-fp16

Após a conclusão do download, liste os modelos para confirmar o tamanho real:

Verificação
ollama list
i
Paciência no primeiro carregamento
Carregar 65 GB na VRAM leva tempo: entre 30 segundos e 2 minutos, dependendo do SSD. Carregamentos subsequentes são mais rápidos devido ao cache do sistema operacional.

#2. Primeiro teste: texto e raciocínio

Inicie uma sessão interativa para validar o funcionamento correto antes de tocar no resto.

Sessão interativa
ollama run llama4:scout

Ao aparecer o prompt >>>, verifique a língua e a qualidade do raciocínio com um teste simples:

Prompt de teste
>>> Explique en 4 phrases ce qu'est un modèle MoE, puis donne un avantage et un inconvénient.

[Réponse attendue : explication structurée en français, distinction entre paramètres totaux et actifs, mention de la latence comme avantage et de la VRAM comme inconvénient.]

Enquanto a conversa avança, abra um segundo terminal para observar a carga:

Monitorar a carga
ollama ps

A coluna SIZE deve refletir o tamanho efetivamente carregado. Em PROCESSOR, o ideal é 100% GPU. Se você vir uma combinação CPU/GPU, é porque a VRAM não é suficiente e o Ollama está fazendo offload — a velocidade será severamente afetada.

#3. Teste de visão em francês

Scout é multimodal nativamente: imagem e texto passam pelo mesmo backbone, ao contrário de uma abordagem que acopla um codificador visual separado a um modelo puramente textual. Isso dá melhores resultados em tarefas que misturam as duas modalidades (OCR contextual, leitura de esquemas, descrição detalhada).

Com a API REST de Ollama, enviamos a imagem em base64 no campo images:

Teste de visão em Python
import base64, requests, json

with open('facture.jpg', 'rb') as f:
    img_b64 = base64.b64encode(f.read()).decode()

response = requests.post(
    'http://localhost:11434/api/generate',
    json={
        'model': 'llama4:scout',
        'prompt': 'Décris cette image en français. Si c\'est un document, extrais les montants et la date.',
        'images': [img_b64],
        'stream': False,
    }
)
print(response.json()['response'])

Em casos típicos (captura de tela de interface, foto de quadro branco, escaneamento de PDF), o Scout gera uma descrição detalhada e permanece coerente em francês mesmo quando a imagem contém texto em inglês. Está um nível acima de um modelo de visão pequeno e generalista como o Qwen 3.5 9B em termos de detalhes estruturados.

→
Formato de imagem
JPEG e PNG funcionam. Evite imagens muito grandes (> 4 MB): Ollama as redimensiona, mas isso exige processamento. Antes de enviar, redimensione-as para no máximo 1024px no lado maior.

#4. Contexto de 10M tokens: promessa e realidade

A Meta anuncia uma janela de contexto de 10 milhões de tokens para o Scout. Na prática, duas limitações se impõem na execução local.

O cache KV explode
Com 1 milhão de tokens, o cache KV adiciona facilmente entre 30 e 50 GB à VRAM utilizada pelo modelo. Acima disso, é necessário ativar a quantização do cache KV (opção num_ctx + parâmetros experimentais) ou aceitar o offload do cache para a CPU.
A qualidade cai bem antes de 10M
Os benchmarks independentes (RULER, NoLiMa) mostram uma queda no desempenho efetivo por volta de 256k–512k tokens, apesar do treinamento com contexto longo. Além disso, é tecnicamente possível, mas pouco confiável.

Para aproveitar um contexto estendido sem fazer tudo travar, configure o Ollama por meio de um Modelfile:

Modelfile para contexto de 128k
FROM llama4:scout

PARAMETER num_ctx 131072
PARAMETER num_predict 4096
PARAMETER temperature 0.6
Criação da variante
ollama create llama4-scout-128k -f Modelfile
ollama run llama4-scout-128k
!
128k já é bastante
Um contexto de 128k tokens já representa cerca de 250 páginas de texto. Para 95% dos casos de uso locais (base de código inteira, PDFs longos, arquivos de tickets), isso é amplamente suficiente e muito mais estável do que configurações com 1M+.

#Scout vs Qwen3-30B-A3B: o verdadeiro comparativo

Qwen3-30B-A3B é o outro MoE seriamente considerado para uso local em 2026: 30B totais, 3B ativos, contexto nativo de 256k. A comparação vale a pena, pois os dois não competem na mesma categoria em termos de hardware.

Uso de VRAM em Q4
Scout ≈ 65 GB. Qwen3-30B-A3B ≈ 18 GB. A diferença é enorme e muda completamente o perfil da máquina necessária.
Velocidade de geração
Com parâmetros ativos comparáveis (17B vs 3B), Qwen3-30B-A3B é mais rápido em tokens por segundo — tipicamente 2 a 3 vezes mais rápido na mesma máquina, quando os dois cabem na memória.
Qualidade de raciocínio
Nos benchmarks públicos MMLU-Pro, GPQA, Scout continua à frente do Qwen3-30B-A3B. A diferença se reduz bastante com o modo thinking do Qwen3 ativado.
Multimodalidade
Scout é nativamente multimodal. Qwen3-30B-A3B não é — é necessário usar um modelo de visão separado como Qwen 3.5 9B em paralelo se você quiser visão na mesma stack.
Contexto longo
Scout visa 10M (256k de forma estável na prática). Qwen3-30B-A3B oferece 256k nativos, com comportamento mais previsível e menor consumo de memória para o cache KV.
→
Veredito prático
Se você tiver um Mac Studio Ultra, uma configuração com 2x RTX 4090 ou uma A6000, escolha o Scout pela visão nativa e pela qualidade. Se estiver usando apenas uma RTX 4090, uma 3090 ou um Mac M3 Max de 36 a 64 GB, escolha o Qwen3-30B-A3B — é uma escolha racional e muito mais rápida. Rodar o Scout com offload para a CPU nesse tipo de máquina parece uma boa ideia, mas não é.

#Solução de problemas

"Error: model requires more system memory than is available"
A capacidade total da sua VRAM e RAM é insuficiente. Passe para uma quantização mais agressiva (rara em Q4, que já deixa pouca margem) ou mude de modelo. O Ollama não faz milagres.
Velocidade < 5 tokens/s em GPU de 24 GB
Você está com offload no CPU. Verifique com o ollama ps: a coluna PROCESSOR deve mostrar 100% GPU. Caso contrário, o Scout não é adequado para sua máquina.
Respostas truncadas
Aumente num_predict (padrão 128 em algumas configurações). Com /set parameter num_predict 2048 na sessão, ou via Modelfile.
Falhas acima de 64k tokens
O cache KV satura a VRAM. Reduza num_ctx ou ative a quantização do cache KV via OLLAMA_FLASH_ATTENTION=1 + OLLAMA_KV_CACHE_TYPE=q8_0 no ambiente.
Imagem recusada com "unsupported image format"
Converta para JPEG ou PNG padrão. Dependendo da versão do Ollama, nem todos os formatos WebP, HEIC e AVIF são suportados.

#Para se aprofundar

Quando o Scout estiver funcionando, vale a pena explorar vários caminhos para aproveitar suas características específicas.

Escolher bem a quantização
Q4_K_M é o ponto ideal para o Scout, mas entender quando subir para Q5 ou Q8 depende do caso de uso — especialmente em tarefas multimodais, nas quais a quantização pode degradar a qualidade mais do que em tarefas de texto puro.
Explorar a visão localmente
O guia específico de visão aborda os padrões de prompt que realmente funcionam (OCR contextual, extração estruturada, comparação de imagens) com o Scout e seus concorrentes multimodais, como Qwen 3.5 9B e Gemma 4 12B.
Modelfile para personalizar
Além de num_ctx, um Modelfile permite fixar um prompt de sistema, um formato de saída JSON e uma temperatura adequada ao seu caso — útil para não precisar reconfigurar tudo a cada sessão.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.