Ollama: o que é e como funciona (guia iniciante)
O que é Ollama? É a ferramenta mais simples para rodar um LLM localmente na sua própria máquina — sem nuvem, sem assinatura, sem nenhuma linha enviada à OpenAI. Este guia explica do zero o que é Ollama, como ele baixa e executa os modelos, os três ou quatro comandos que você usará 90% do tempo e o mínimo necessário para começar.
#O que é Ollama?
Ollama é uma ferramenta open source que baixa, armazena e executa modelos de linguagem (LLM) diretamente no seu computador. Você digita um comando, o modelo é carregado na memória e você conversa com ele — seja pela linha de comando, seja por uma interface gráfica que você conecta ao Ollama. Tudo acontece localmente: nenhum dado é enviado para a Internet após o modelo ser baixado.
Na prática, o Ollama desempenha dois papéis ao mesmo tempo: é um daemon (um programa que roda em segundo plano) e uma CLI (uma interface de linha de comando) que conversa com esse daemon. O daemon escuta na porta 11434 da sua máquina e expõe uma pequena API HTTP — a mesma da OpenAI, ou quase. Todas as interfaces compatíveis (Open WebUI, LM Studio em modo cliente, Continue.dev, etc.) podem, portanto, se conectar a ela sem alterações.
Por que tantas pessoas passam a usá-lo? Porque elimina todas as dificuldades técnicas de executar um LLM local: sem compilação, sem configuração manual de GPU, sem gerenciamento de versões do Python. Você instala, digita ollama run qwen3.5:9b, e funciona. É o equivalente ao Docker para LLMs: o modelo e seu ambiente de execução são empacotados em um formato único.
#Como funciona internamente
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Quando você executa Ollama, três camadas colaboram. Entender essas camadas muda radicalmente sua capacidade de diagnosticar um problema.
- O daemon (ollama serve)
- Um serviço que roda em segundo plano, escuta em http://localhost:11434 e gerencia o carregamento/descarregamento dos modelos na memória. No Windows e no macOS, ele é iniciado automaticamente após a instalação. No Linux, normalmente é um serviço systemd.
- O mecanismo de inferência (llama.cpp)
- É ele que executa os modelos. Ollama inclui uma versão pré-compilada com suporte a CUDA (NVIDIA), Metal (Apple Silicon) e CPU. Você não precisa compilar nada.
- A CLI (ollama)
- O programa de linha de comando que você executa. Ele não faz muita coisa por si só: envia requisições HTTP ao daemon e exibe as respostas.
Quando você digita ollama run qwen3.5:9b, o que realmente acontece é o seguinte: a CLI pede ao daemon para carregar esse modelo; se o modelo não estiver no disco, o daemon o baixa do registro do Ollama (um pouco como o Docker Hub); ele o carrega na VRAM se você tiver uma GPU compatível, caso contrário na RAM; e abre uma sessão de chat interativa. Todo o trabalho pesado acontece no daemon — a CLI é apenas um cliente.
#Os comandos: run, pull, list
Três comandos cobrem 90% do uso. Aprenda-os; o restante parecerá evidente.
#ollama run
O comando que você precisa conhecer primeiro. Ele baixa o modelo se ele não estiver presente, carrega-o na memória e, em seguida, abre uma conversa interativa no terminal.
Depois de entrar na sessão, digite sua pergunta e pressione Enter. Para sair, use /bye ou pressione Ctrl+D. Para alternar para o modo multilinha, comece com três aspas ("""). Tudo que começa com / é um comando interno (/show, /set, /clear, /save, /load).
Você também pode passar diretamente um prompt como argumento — útil para criar scripts:
#ollama pull
Baixa um modelo sem iniciá-lo. Útil quando você quer preparar vários modelos com antecedência ou baixar uma variante específica (tamanho, quantização).
O nome segue o formato modele:tag. Sem tag, você obtém a versão padrão (geralmente um 8B/9B em quantização Q4_K_M). Com uma tag explícita, você escolhe o tamanho (2b, 4b, 9b, 27b, 30b) e a quantização (q4_K_M, q5_K_M, q8_0, fp16).
#ollama list
Exibe os modelos instalados na sua máquina, o tamanho deles no disco e a data de instalação.
#Outros comandos úteis
- ollama ps
- Mostra os modelos atualmente carregados na memória (e quanta VRAM/RAM eles consomem). Essencial para diagnosticar situações em que "está tudo lento".
- ollama rm <modelo>
- Remove um modelo do disco. Útil quando a pasta dos modelos começa a ocupar 50 GB.
- ollama show <modelo>
- Exibe os metadados de um modelo: tamanho do contexto, quantização, template de prompt, capacidades (ferramentas, visão, etc.).
- ollama serve
- Inicia manualmente o daemon em primeiro plano. Útil no Linux ou para diagnóstico (você vê os logs em tempo real).
- ollama create
- Cria um modelo personalizado a partir de um Modelfile — é o equivalente a um Dockerfile para LLM. Assunto mais avançado.
#Onde os modelos são armazenados
Os modelos podem ocupar vários gigabytes. Saber onde eles ficam é essencial para fazer uma limpeza, mover a biblioteca para outro disco ou fazer backup.
- Windows
- %USERPROFILE%\.ollama\models — normalmente C:\Users\votrenom\.ollama\models
- macOS
- ~/.ollama/models
- Linux (instalação via script oficial)
- /usr/share/ollama/.ollama/models — le démon tourne sous l'utilisateur ollama
- Linux (instalação manual no nível do usuário)
- ~/.ollama/models
Dentro desse diretório, dois subdiretórios: blobs (os arquivos binários dos modelos, identificados por um hash) e manifests (os metadados que descrevem qual blob corresponde a qual tag). Não edite esses arquivos manualmente — use ollama rm e ollama pull para gerenciar.
#Configuração mínima para começar
A pergunta “o que é Ollama e minha máquina consegue rodá-lo?” aparece o tempo todo. Aqui estão os patamares reais, não os requisitos mínimos de marketing.
- RAM de 8 GB, sem GPU
- Limitado a modelos de 2–3B em Q4 (Qwen 3.5 2B, Granite 4.2 3B). 5–10 tokens por segundo em uma CPU moderna. Usável para testar e aprender.
- 16 GB de RAM, sem GPU
- Os modelos de 8B são quantizados em Q4 (Granite 4.2 8B, Qwen 3.5 9B). Espere de 4 a 8 tokens por segundo. É lento para uso interativo contínuo, mas funciona.
- GPU com 8 GB de VRAM
- Funciona com folga com modelos de 8B em Q4 (Qwen 3.5 9B, Granite 4.2 8B — 30–50 tokens/s). Atinge o limite com modelos de 12-14B.
- GPU com 12 GB de VRAM (RTX 3060, 4070)
- O ponto ideal para começar em 2026. Todos os modelos de 8B rodam com fluidez, o Gemma 4 12B em Q4 roda com folga, ou o Qwen 3.5 9B em Q8 oferece a qualidade máxima nessa faixa.
- GPU de 16 GB (RTX 4080, 5080) ou Mac M-Pro com 32 GB unificados
- Podemos passar para modelos de 24B em Q4 (Mistral Small 24B, Devstral 24B, gpt-oss 20B) ou para o Qwen 3.5 9B em Q8 para priorizar a qualidade.
- GPU de 24 GB (RTX 3090, 4090) ou Mac M-Max de 48 GB+
- Já é possível rodar modelos de 27–35B com conforto (Qwen 3.8 27B, Qwen 3.6 35B-A3B), e grandes modelos MoE em Q4 com um pouco de paciência.
Para o espaço em disco, reserve 10 GB por modelo 7B em Q4 e 30 GB por modelo 32B. Ter entre 50 e 100 GB livres desde o início evita ter que fazer uma limpeza cedo demais.
#Primeiro modelo recomendado
Quando você conhece o Ollama, o reflexo é testar o maior modelo possível "para ver". Isso é um erro — você satura a VRAM, parte do modelo passa para a RAM, fica lento e você desiste. Comece pequeno.
- 01Qwen 3.5 9B — uma escolha padrão sensataollama run qwen3.5:9b baixa a versão Q4_K_M do Qwen 3.5 9B (6,6 GB). Boa qualidade geral, francês sólido, entrada de visão, janela de contexto de 256k. É a escolha para 8 GB de 2026 e um excelente parâmetro para avaliar o que sua máquina consegue fazer.
- 02Granite 4.2 8B — a alternativa discretaollama run granite4.2:8b para o modelo da IBM (5,3 GB, Apache 2.0). Um pouco mais leve, muito econômico em tokens, contexto 128k. Um bom compromisso se sua placa estiver no limite da VRAM. Para um francês muito natural com mais VRAM, Mistral Small 24B (ollama run mistral-small) continua sendo uma escolha segura.
- 03Qwen 3.5 4B — o pequeno modelo polivalente em ascensãoollama run qwen3.5:4b para o novo pequeno modelo padrão (3,4 GB, Apache 2.0). Surpreendentemente capaz para seu tamanho, adequado para código leve e extração. Muitos o adotam como padrão quando a VRAM é limitada.
- 04Granite 4.2 3B — se o seu computador for modestoollama run granite4.2:3b para um modelo que cabe em 4 GB de RAM (2,2 GB, Apache 2.0). Menos capaz, mas utilizável para tarefas simples e para aprender o funcionamento do Ollama sem sofrer com os tempos de carregamento.
#Dicas e armadilhas
- O modelo é descarregado após 5 minutos de inatividade
- Esse é o valor padrão de OLLAMA_KEEP_ALIVE. Se você quiser manter o modelo na VRAM por mais tempo, defina OLLAMA_KEEP_ALIVE=2h (ou -1 para nunca descarregá-lo). Por outro lado, defina 0 se quiser liberar a VRAM assim que a requisição terminar.
- Respostas truncadas depois de algumas frases
- O valor padrão do parâmetro num_ctx (janela de contexto) é de 4096 tokens, independentemente do que o modelo suporte. Para uso com RAG ou documentos longos, crie um Modelfile com PARAMETER num_ctx 32768 e execute ollama create. Atenção: o consumo de VRAM aumenta rapidamente.
- Sem autocompletação no shell
- Digite ollama help para ver todos os comandos e ollama help <comando> para ver os detalhes de cada um. A documentação está na CLI.
- Conexão recusada ao tentar acessar a partir de outra máquina da rede
- Por padrão, o Ollama escuta apenas em 127.0.0.1. Para expô-lo na rede local, defina OLLAMA_HOST=0.0.0.0:11434 antes de iniciar o daemon. Lembre-se do firewall.
- Um mesmo nome de modelo, várias versões
- ollama pull qwen3.5:9b e ollama pull qwen3.5:9b-q8_0 baixam duas variantes separadas. Monitore seu disco com ollama list.
#Para se aprofundar
Você entendeu o que é o Ollama e seu funcionamento básico. Os próximos passos naturais são:
- Instalá-lo de verdade no seu sistema operacional
- O guia para instalar Ollama no Windows (ou macOS, ou Linux) explica passo a passo a instalação, a verificação da GPU e o primeiro modelo em um ambiente limpo.
- Escolher a quantização certa
- O guia Escolha sua quantização (Q4, Q5, Q8, FP16) compara visualmente as perdas reais de qualidade e ajuda você a equilibrar qualidade e VRAM.
- Conectar uma interface gráfica de verdade
- O guia Open WebUI com Ollama instala em 10 minutos uma interface semelhante à do ChatGPT, com suporte a vários usuários e RAG integrado, sobre o daemon que você já tem em execução.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.