Iniciante 11 minConfiguração

Entender a janela de contexto

Resposta direta

A janela de contexto é o número máximo de tokens que o modelo processa de uma só vez: instrução de sistema, histórico, documentos anexados e resposta que está sendo gerada, tudo somado. Ela consome memória, pois cada token mantém uma entrada no cache KV. No Ollama, o valor padrão é de 4.096 tokens em uma placa com menos de 24 GiB de VRAM: muitas vezes é ela, e não o modelo, que limita o que você pode fazê-lo ler.

Quando é curta demais, a janela faz com que o início de uma conversa seja esquecido ou que um documento seja truncado. Quando é grande demais, ela satura a VRAM e deixa tudo mais lento. Este guia explica o que ela contém, calcula seu consumo de memória a partir da arquitetura de um modelo real e mostra como ajustá-la sem surpresas desagradáveis.

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux

#O que a janela de contexto contém

De acordo com a documentação do Ollama, o comprimento do contexto é o número máximo de tokens aos quais o modelo tem acesso na memória. Tudo se soma nesse limite único: a mensagem de sistema, o histórico da conversa, os arquivos ou trechos de documentos que você cola, sua última pergunta e a resposta que o modelo está escrevendo. Para um modelo de raciocínio, os tokens de reflexão também contam. Quando o total ultrapassa a janela, alguma coisa precisa ser descartada: as ferramentas geralmente truncam o início ou recusam a requisição. O modelo não tem memória fora dessa janela, a menos que um sistema externo (resumo, RAG) volte a fornecer informações a ele.

i
Janela e memória não são a mesma coisa
Um assistente que “se lembra” de uma conversa de ontem não faz isso graças à janela: o aplicativo relê um histórico ou uma base e copia esse conteúdo para o prompt. A janela é o limite do que pode entrar nela em um dado momento.

#Token: a unidade que preenche a janela

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Um token não é uma palavra: é um fragmento de texto definido pelo tokenizer do modelo, geralmente uma sílaba ou uma palavra comum. Palavras raras ou longas ocupam vários tokens. O francês consome, em geral, mais tokens que o inglês para um conteúdo equivalente, porque a maioria dos tokenizers é treinada principalmente com inglês. A proporção exata varia de modelo para modelo: em vez de se basear em regras aproximadas, meça. A API do Ollama retorna prompt_eval_count, o número de tokens do prompt, em cada solicitação.

Contar os tokens reais de um prompt
curl http://localhost:11434/api/generate -d '{"model":"qwen3:8b","prompt":"Bonjour le monde","stream":false}'
# lisez prompt_eval_count et eval_count dans la réponse JSON
Regra prática
Uma página A4 de texto francês denso representa cerca de um milhar de tokens, de acordo com o tokenizer: valide com prompt_eval_count em seu próprio documento.
Um livro
Centenas de milhares de tokens: fora do alcance de uma janela de 32.000 ou 64.000 tokens sem divisão.
Uma resposta
Um modelo de raciocínio pode gerar milhares de tokens de reflexão antes da resposta visível, o que consome a janela.

#Qual tamanho de janela escolher

O Ollama define seu valor padrão com base na memória de vídeo: cerca de 4 000 tokens (4k) com menos de 24 GiB de VRAM, 32k entre 24 e 48 GiB e 256k a partir de 48 GiB. A mesma página recomenda pelo menos 64 000 tokens para tarefas que exigem um grande contexto, como pesquisa na web, agentes e ferramentas de codificação. Os modelos recentes anunciam máximos muito maiores: o catálogo QuelLLM indica, por exemplo, cerca de 256 000 tokens para Kimi K2.5 e cerca de 1 milhão para Kimi K3, DeepSeek V4 Flash e GLM 5.2. Mas um máximo anunciado não significa que esse contexto seja utilizável na sua máquina: as limitações de memória e, às vezes, de qualidade impedem isso.

Qual janela para qual uso
UsoJanela indicativaObservação
Conversa curta, perguntas e respostas4.096 a 8.192 tokensÉ suficiente se você não colar documentos
Resumo ou análise de um artigo16.000 a 32.000 tokensVerifique o número de tokens do texto
Assistente de código em um repositório64.000 tokens ou maisRecomendado pelo Ollama para ferramentas de programação
Agente com ferramentas e pesquisa na web64.000 tokens ou maisCada chamada de ferramenta reinjeta texto
Corpus muito grandeNão busque a janelaUse um RAG em vez de enviar tudo

Duas armadilhas de dimensionamento são frequentes. Primeiro, a janela deve conter a resposta: se você preencher 31.000 dos 32.000 tokens com um documento, quase nada restará para responder, e um modelo de raciocínio parará no meio da reflexão. Segundo, em uma conversa, o histórico cresce a cada turno: uma janela que comporta a primeira mensagem pode ficar saturada no vigésimo. Planeje, portanto, o pior caso do seu uso, não o caso médio, e mantenha uma margem de cerca de um quinto da janela.

#Quanta memória o contexto consome

Cada token presente na janela deixa, em cada camada do modelo, uma chave e um valor, armazenados no cache KV. O custo por token é calculado a partir de quatro números da arquitetura: o número de camadas, o número de cabeças chave-valor, a dimensão de uma cabeça e o tamanho de um número (2 bytes em FP16). A fórmula é: 2 (chave e valor) × camadas × cabeças KV × dimensão da cabeça × 2 bytes. Atenção: são as cabeças chave-valor que contam, e não as cabeças de atenção, pois os modelos recentes compartilham várias delas (grouped-query attention). O cálculo com as cabeças de atenção superestima o cache por um fator de quatro para o modelo abaixo.

Tomemos o Qwen3-8B, cuja ficha oficial indica 36 camadas e 8 cabeças de chave-valor (contra 32 cabeças de consulta), com a configuração pública definindo a dimensão de cada cabeça em 128. O custo é de 2 × 36 × 8 × 128 × 2 = 147.456 bytes por token, ou seja, 144 KiB.

Cache KV do Qwen3-8B em FP16 (cálculo com base na sua configuração)
ContextoCache KV (FP16)Cache KV (q8_0, cerca da metade)
4 096 tokens0,56 GiB0,28 GiB
8 192 tokens1,13 GiB0,56 GiB
16 384 tokens2,25 GiB1,13 GiB
32 768 tokens4,50 GiB2,25 GiB
131.072 tokens (com YaRN, segundo a ficha técnica)18,00 GiB9,00 GiB
!
A armadilha da placa de 8 GB
Qwen3-8B em Q4 ocupa aproximadamente 5 GB para seus pesos. Com 32.768 tokens de contexto, o cache KV adiciona 4,5 GiB, atingindo cerca de 9,5 GB antes mesmo dos buffers de cálculo. Em uma placa de 8 GB, parte do modelo passa então a ser executada na CPU, e a geração fica muito mais lenta, sem uma mensagem de erro clara. Verifique com ollama ps.

Duas medidas reduzem o cache. A primeira é a quantização do cache: a FAQ do Ollama indica que o tipo q8_0 consome aproximadamente metade da memória do FP16 com uma perda muito pequena, e q4_0 cerca de um quarto com uma perda mais perceptível em contextos longos; ambos exigem que o Flash Attention esteja ativado. A segunda é reduzir a janela ao que você precisa. Nosso guia sobre o cache KV detalha as configurações.

#Ajustar o comprimento do contexto

#No Ollama

O Ollama permite definir o comprimento padrão ao iniciar o servidor, alterá-lo para uma sessão ou especificá-lo a cada requisição via API.

Três formas de definir o contexto em Ollama
# Valeur par défaut pour tout le serveur
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

# Pour une session interactive
>>> /set parameter num_ctx 16384

# Pour un modèle personnalisé (Modelfile)
FROM qwen3:8b
PARAMETER num_ctx 16384

Após o carregamento, execute o ollama ps: a coluna CONTEXT mostra o tamanho alocado e a coluna PROCESSOR indica a divisão entre GPU e CPU. Se uma parte for usada no CPU, reduza o contexto ou escolha um modelo menor.

#No LM Studio

Em LM Studio, o comprimento do contexto é definido ao carregar o modelo, nos parâmetros de carregamento. Mudar o valor exige recarregar o modelo. Monitore a estimativa de memória exibida antes de confirmar.

#Um procedimento de configuração em quatro etapas

  1. 01
    Medir a necessidade real
    Envie seu documento ou seu histórico típico e veja prompt_eval_count. Adicione o comprimento esperado da resposta e, se o modelo produz reflexão, inclua isso também.
  2. 02
    Escolher a janela
    Escolha o menor valor que comporte esse total com 20% de margem, pelo menos 64.000 tokens se você usar um agente ou uma ferramenta de programação, como recomenda o Ollama.
  3. 03
    Verificar a memória
    Carregue o modelo com esta janela e execute ollama ps. O processador deve indicar 100% GPU; caso contrário, reduza a janela, quantize o cache ou mude de modelo.
  4. 04
    Testar a recuperação de informações
    Coloque um fato específico no meio de um texto longo e pergunte por ele. Se o modelo não o recuperar, a janela anunciada excede o que ele efetivamente aproveita, e será necessário dividir o texto em partes ou usar RAG.

#Grande janela não significa leitura fiel

Um estudo de 2023, “Lost in the Middle”, mostra que o desempenho dos modelos pode piorar significativamente dependendo da posição da informação no contexto: costuma ser melhor quando a informação está no início ou no final e piora quando ela está no meio, mesmo em modelos anunciados como tendo contexto longo. O benchmark RULER, publicado em 2024, vai além: quase todos os modelos testados perdem muita precisão quando o comprimento do contexto aumenta, e apenas metade deles mantém um nível satisfatório com 32.000 tokens, embora todos anunciassem 32.000 ou mais.

Esses trabalhos abordam modelos de sua época e não dizem nada sobre os modelos de 2026, vários dos quais são treinados especificamente para contexto longo. Mas a abordagem continua válida: coloque a instrução e os fatos críticos no início, repita a pergunta no final e faça medições com seus documentos antes de confiar em uma janela anunciada de várias centenas de milhares de tokens. O teste mais simples consiste em inserir uma informação precisa no meio de um longo texto da sua área e depois perguntar por ela novamente: se o modelo a encontrar em cada tentativa, a janela é utilizável para seu caso de uso; se ele não a encontrar, reduza o texto enviado ou divida-o em partes.

#Quando o conteúdo excede o limite

Resumir ao longo da conversa
Faça o modelo produzir um resumo da conversa a cada poucos turnos e recomece com esse resumo no início do contexto: você perde detalhes, mas mantém o fio da conversa.
Dividir o documento
Um PDF longo é processado seção por seção, e depois as respostas parciais são agregadas. O guia sobre chunking detalha os tamanhos úteis.
Mudar para um RAG
Quando o corpus ultrapassa em muito a janela, recuperamos os poucos trechos relevantes em vez de enviar tudo.
Escolher um modelo com maior contexto
Apenas se a memória for suficiente: consulte o cálculo do cache KV acima antes de dobrar a janela.
FAQ
O que é a janela de contexto de um LLM?+
É o número máximo de tokens que o modelo processa de uma vez: mensagem de sistema, histórico, documentos anexados, pergunta e resposta em andamento. Acima disso, o início é truncado ou a requisição é recusada. A janela limita o que o modelo pode ler, não o que aprendeu durante o treinamento.
Qual é a janela de contexto padrão do Ollama?+
Ela depende da memória de vídeo: 4k tokens com menos de 24 GiB de VRAM, 32k entre 24 e 48 GiB, 256k acima de 48 GiB. O Ollama recomenda pelo menos 64.000 tokens para agentes, pesquisa na web e ferramentas de programação. Você pode alterá-la com OLLAMA_CONTEXT_LENGTH ou num_ctx.
Como aumentar o contexto de um modelo local?+
Defina OLLAMA_CONTEXT_LENGTH ao iniciar o servidor, use /set parameter num_ctx em uma sessão interativa ou declare PARAMETER num_ctx em um Modelfile. Verifique depois com o comando ollama ps se o modelo permanece inteiramente na GPU: um contexto mais longo consome mais memória e pode fazer com que parte do modelo passe a ser executada na CPU.
Quanta VRAM um contexto de 32.000 tokens consome?+
Depende da arquitetura. Para Qwen3-8B, o cache KV em FP16 atinge cerca de 4,5 GiB com 32.768 tokens, além dos pesos. A fórmula é: 2 × camadas × cabeças KV × dimensão da cabeça × 2 bytes por token. A quantização q8_0 do cache reduz esse custo em cerca de metade.
Um contexto maior torna o modelo mais inteligente?+
Não. Ele permite que o modelo leia mais texto, não que raciocine melhor. Pelo contrário, os estudos «Lost in the Middle» e RULER mostram que a precisão pode cair quando o contexto aumenta. Use a janela necessária para a sua tarefa, não a maior possível.
É necessário um RAG ou uma grande janela para analisar documentos?+
Se o documento couber na janela com uma margem e você tiver memória disponível, enviar o documento inteiro é mais simples. Se ultrapassar esse limite, ou para consultar uma base com muitos arquivos, o RAG é mais econômico e muitas vezes mais confiável, pois envia apenas os trechos úteis.

#Para se aprofundar

Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.