Entender a janela de contexto
A janela de contexto é o número máximo de tokens que o modelo processa de uma só vez: instrução de sistema, histórico, documentos anexados e resposta que está sendo gerada, tudo somado. Ela consome memória, pois cada token mantém uma entrada no cache KV. No Ollama, o valor padrão é de 4.096 tokens em uma placa com menos de 24 GiB de VRAM: muitas vezes é ela, e não o modelo, que limita o que você pode fazê-lo ler.
Quando é curta demais, a janela faz com que o início de uma conversa seja esquecido ou que um documento seja truncado. Quando é grande demais, ela satura a VRAM e deixa tudo mais lento. Este guia explica o que ela contém, calcula seu consumo de memória a partir da arquitetura de um modelo real e mostra como ajustá-la sem surpresas desagradáveis.
#O que a janela de contexto contém
De acordo com a documentação do Ollama, o comprimento do contexto é o número máximo de tokens aos quais o modelo tem acesso na memória. Tudo se soma nesse limite único: a mensagem de sistema, o histórico da conversa, os arquivos ou trechos de documentos que você cola, sua última pergunta e a resposta que o modelo está escrevendo. Para um modelo de raciocínio, os tokens de reflexão também contam. Quando o total ultrapassa a janela, alguma coisa precisa ser descartada: as ferramentas geralmente truncam o início ou recusam a requisição. O modelo não tem memória fora dessa janela, a menos que um sistema externo (resumo, RAG) volte a fornecer informações a ele.
#Token: a unidade que preenche a janela
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Um token não é uma palavra: é um fragmento de texto definido pelo tokenizer do modelo, geralmente uma sílaba ou uma palavra comum. Palavras raras ou longas ocupam vários tokens. O francês consome, em geral, mais tokens que o inglês para um conteúdo equivalente, porque a maioria dos tokenizers é treinada principalmente com inglês. A proporção exata varia de modelo para modelo: em vez de se basear em regras aproximadas, meça. A API do Ollama retorna prompt_eval_count, o número de tokens do prompt, em cada solicitação.
- Regra prática
- Uma página A4 de texto francês denso representa cerca de um milhar de tokens, de acordo com o tokenizer: valide com prompt_eval_count em seu próprio documento.
- Um livro
- Centenas de milhares de tokens: fora do alcance de uma janela de 32.000 ou 64.000 tokens sem divisão.
- Uma resposta
- Um modelo de raciocínio pode gerar milhares de tokens de reflexão antes da resposta visível, o que consome a janela.
#Qual tamanho de janela escolher
O Ollama define seu valor padrão com base na memória de vídeo: cerca de 4 000 tokens (4k) com menos de 24 GiB de VRAM, 32k entre 24 e 48 GiB e 256k a partir de 48 GiB. A mesma página recomenda pelo menos 64 000 tokens para tarefas que exigem um grande contexto, como pesquisa na web, agentes e ferramentas de codificação. Os modelos recentes anunciam máximos muito maiores: o catálogo QuelLLM indica, por exemplo, cerca de 256 000 tokens para Kimi K2.5 e cerca de 1 milhão para Kimi K3, DeepSeek V4 Flash e GLM 5.2. Mas um máximo anunciado não significa que esse contexto seja utilizável na sua máquina: as limitações de memória e, às vezes, de qualidade impedem isso.
| Uso | Janela indicativa | Observação |
|---|---|---|
| Conversa curta, perguntas e respostas | 4.096 a 8.192 tokens | É suficiente se você não colar documentos |
| Resumo ou análise de um artigo | 16.000 a 32.000 tokens | Verifique o número de tokens do texto |
| Assistente de código em um repositório | 64.000 tokens ou mais | Recomendado pelo Ollama para ferramentas de programação |
| Agente com ferramentas e pesquisa na web | 64.000 tokens ou mais | Cada chamada de ferramenta reinjeta texto |
| Corpus muito grande | Não busque a janela | Use um RAG em vez de enviar tudo |
Duas armadilhas de dimensionamento são frequentes. Primeiro, a janela deve conter a resposta: se você preencher 31.000 dos 32.000 tokens com um documento, quase nada restará para responder, e um modelo de raciocínio parará no meio da reflexão. Segundo, em uma conversa, o histórico cresce a cada turno: uma janela que comporta a primeira mensagem pode ficar saturada no vigésimo. Planeje, portanto, o pior caso do seu uso, não o caso médio, e mantenha uma margem de cerca de um quinto da janela.
#Quanta memória o contexto consome
Cada token presente na janela deixa, em cada camada do modelo, uma chave e um valor, armazenados no cache KV. O custo por token é calculado a partir de quatro números da arquitetura: o número de camadas, o número de cabeças chave-valor, a dimensão de uma cabeça e o tamanho de um número (2 bytes em FP16). A fórmula é: 2 (chave e valor) × camadas × cabeças KV × dimensão da cabeça × 2 bytes. Atenção: são as cabeças chave-valor que contam, e não as cabeças de atenção, pois os modelos recentes compartilham várias delas (grouped-query attention). O cálculo com as cabeças de atenção superestima o cache por um fator de quatro para o modelo abaixo.
Tomemos o Qwen3-8B, cuja ficha oficial indica 36 camadas e 8 cabeças de chave-valor (contra 32 cabeças de consulta), com a configuração pública definindo a dimensão de cada cabeça em 128. O custo é de 2 × 36 × 8 × 128 × 2 = 147.456 bytes por token, ou seja, 144 KiB.
| Contexto | Cache KV (FP16) | Cache KV (q8_0, cerca da metade) |
|---|---|---|
| 4 096 tokens | 0,56 GiB | 0,28 GiB |
| 8 192 tokens | 1,13 GiB | 0,56 GiB |
| 16 384 tokens | 2,25 GiB | 1,13 GiB |
| 32 768 tokens | 4,50 GiB | 2,25 GiB |
| 131.072 tokens (com YaRN, segundo a ficha técnica) | 18,00 GiB | 9,00 GiB |
Duas medidas reduzem o cache. A primeira é a quantização do cache: a FAQ do Ollama indica que o tipo q8_0 consome aproximadamente metade da memória do FP16 com uma perda muito pequena, e q4_0 cerca de um quarto com uma perda mais perceptível em contextos longos; ambos exigem que o Flash Attention esteja ativado. A segunda é reduzir a janela ao que você precisa. Nosso guia sobre o cache KV detalha as configurações.
#Ajustar o comprimento do contexto
#No Ollama
O Ollama permite definir o comprimento padrão ao iniciar o servidor, alterá-lo para uma sessão ou especificá-lo a cada requisição via API.
Após o carregamento, execute o ollama ps: a coluna CONTEXT mostra o tamanho alocado e a coluna PROCESSOR indica a divisão entre GPU e CPU. Se uma parte for usada no CPU, reduza o contexto ou escolha um modelo menor.
#No LM Studio
Em LM Studio, o comprimento do contexto é definido ao carregar o modelo, nos parâmetros de carregamento. Mudar o valor exige recarregar o modelo. Monitore a estimativa de memória exibida antes de confirmar.
#Um procedimento de configuração em quatro etapas
- 01Medir a necessidade realEnvie seu documento ou seu histórico típico e veja prompt_eval_count. Adicione o comprimento esperado da resposta e, se o modelo produz reflexão, inclua isso também.
- 02Escolher a janelaEscolha o menor valor que comporte esse total com 20% de margem, pelo menos 64.000 tokens se você usar um agente ou uma ferramenta de programação, como recomenda o Ollama.
- 03Verificar a memóriaCarregue o modelo com esta janela e execute ollama ps. O processador deve indicar 100% GPU; caso contrário, reduza a janela, quantize o cache ou mude de modelo.
- 04Testar a recuperação de informaçõesColoque um fato específico no meio de um texto longo e pergunte por ele. Se o modelo não o recuperar, a janela anunciada excede o que ele efetivamente aproveita, e será necessário dividir o texto em partes ou usar RAG.
#Grande janela não significa leitura fiel
Um estudo de 2023, “Lost in the Middle”, mostra que o desempenho dos modelos pode piorar significativamente dependendo da posição da informação no contexto: costuma ser melhor quando a informação está no início ou no final e piora quando ela está no meio, mesmo em modelos anunciados como tendo contexto longo. O benchmark RULER, publicado em 2024, vai além: quase todos os modelos testados perdem muita precisão quando o comprimento do contexto aumenta, e apenas metade deles mantém um nível satisfatório com 32.000 tokens, embora todos anunciassem 32.000 ou mais.
Esses trabalhos abordam modelos de sua época e não dizem nada sobre os modelos de 2026, vários dos quais são treinados especificamente para contexto longo. Mas a abordagem continua válida: coloque a instrução e os fatos críticos no início, repita a pergunta no final e faça medições com seus documentos antes de confiar em uma janela anunciada de várias centenas de milhares de tokens. O teste mais simples consiste em inserir uma informação precisa no meio de um longo texto da sua área e depois perguntar por ela novamente: se o modelo a encontrar em cada tentativa, a janela é utilizável para seu caso de uso; se ele não a encontrar, reduza o texto enviado ou divida-o em partes.
#Quando o conteúdo excede o limite
- Resumir ao longo da conversa
- Faça o modelo produzir um resumo da conversa a cada poucos turnos e recomece com esse resumo no início do contexto: você perde detalhes, mas mantém o fio da conversa.
- Dividir o documento
- Um PDF longo é processado seção por seção, e depois as respostas parciais são agregadas. O guia sobre chunking detalha os tamanhos úteis.
- Mudar para um RAG
- Quando o corpus ultrapassa em muito a janela, recuperamos os poucos trechos relevantes em vez de enviar tudo.
- Escolher um modelo com maior contexto
- Apenas se a memória for suficiente: consulte o cálculo do cache KV acima antes de dobrar a janela.
O que é a janela de contexto de um LLM?+
Qual é a janela de contexto padrão do Ollama?+
Como aumentar o contexto de um modelo local?+
Quanta VRAM um contexto de 32.000 tokens consome?+
Um contexto maior torna o modelo mais inteligente?+
É necessário um RAG ou uma grande janela para analisar documentos?+
#Para se aprofundar
- Quantizar o cache KV: economizar VRAM
- Tokens e tokenização: entender o que um LLM consome
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- O que é o RAG e como ele funciona
- Estratégias de chunking
- Calculadora de VRAM
- Fonte: documentação Ollama, comprimento de contexto
- Fonte: FAQ do Ollama (cache KV, Flash Attention)
- Fonte: Lost in the Middle (arXiv 2023)
- Fonte: RULER, benchmark de contexto longo (arXiv 2024)
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.