Iniciante 7 minOllama

Ollama: o que é e como funciona (guia iniciante)

O que é Ollama? É a ferramenta mais simples para rodar um LLM localmente na sua própria máquina — sem nuvem, sem assinatura, sem nenhuma linha enviada à OpenAI. Este guia explica do zero o que é Ollama, como ele baixa e executa os modelos, os três ou quatro comandos que você usará 90% do tempo e o mínimo necessário para começar.

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux

#O que é Ollama?

Ollama é uma ferramenta open source que baixa, armazena e executa modelos de linguagem (LLM) diretamente no seu computador. Você digita um comando, o modelo é carregado na memória e você conversa com ele — seja pela linha de comando, seja por uma interface gráfica que você conecta ao Ollama. Tudo acontece localmente: nenhum dado é enviado para a Internet após o modelo ser baixado.

Na prática, o Ollama desempenha dois papéis ao mesmo tempo: é um daemon (um programa que roda em segundo plano) e uma CLI (uma interface de linha de comando) que conversa com esse daemon. O daemon escuta na porta 11434 da sua máquina e expõe uma pequena API HTTP — a mesma da OpenAI, ou quase. Todas as interfaces compatíveis (Open WebUI, LM Studio em modo cliente, Continue.dev, etc.) podem, portanto, se conectar a ela sem alterações.

i
Em uma frase
Ollama = um daemon local que pode baixar e executar LLMs de pesos abertos, e uma CLI para conversar com ele. Por trás, é o llama.cpp bem empacotado. Você não precisará compilar nem manipular arquivos GGUF manualmente.

Por que tantas pessoas passam a usá-lo? Porque elimina todas as dificuldades técnicas de executar um LLM local: sem compilação, sem configuração manual de GPU, sem gerenciamento de versões do Python. Você instala, digita ollama run qwen3.5:9b, e funciona. É o equivalente ao Docker para LLMs: o modelo e seu ambiente de execução são empacotados em um formato único.

#Como funciona internamente

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Quando você executa Ollama, três camadas colaboram. Entender essas camadas muda radicalmente sua capacidade de diagnosticar um problema.

O daemon (ollama serve)
Um serviço que roda em segundo plano, escuta em http://localhost:11434 e gerencia o carregamento/descarregamento dos modelos na memória. No Windows e no macOS, ele é iniciado automaticamente após a instalação. No Linux, normalmente é um serviço systemd.
O mecanismo de inferência (llama.cpp)
É ele que executa os modelos. Ollama inclui uma versão pré-compilada com suporte a CUDA (NVIDIA), Metal (Apple Silicon) e CPU. Você não precisa compilar nada.
A CLI (ollama)
O programa de linha de comando que você executa. Ele não faz muita coisa por si só: envia requisições HTTP ao daemon e exibe as respostas.

Quando você digita ollama run qwen3.5:9b, o que realmente acontece é o seguinte: a CLI pede ao daemon para carregar esse modelo; se o modelo não estiver no disco, o daemon o baixa do registro do Ollama (um pouco como o Docker Hub); ele o carrega na VRAM se você tiver uma GPU compatível, caso contrário na RAM; e abre uma sessão de chat interativa. Todo o trabalho pesado acontece no daemon — a CLI é apenas um cliente.

→
A porta 11434
É a porta HTTP que todo mundo utiliza. Se um aplicativo afirmar "se conectar ao seu Ollama", ele se comunica com http://localhost:11434. Se o Ollama estiver em execução e você abrir essa URL em um navegador, verá a mensagem Ollama is running. É o teste de saúde mais simples.

#Os comandos: run, pull, list

Três comandos cobrem 90% do uso. Aprenda-os; o restante parecerá evidente.

#ollama run

O comando que você precisa conhecer primeiro. Ele baixa o modelo se ele não estiver presente, carrega-o na memória e, em seguida, abre uma conversa interativa no terminal.

Terminal
ollama run qwen3.5:9b
# Première fois : télécharge ~6.6 Go puis lance le chat
# Fois suivantes : charge le modèle déjà présent et démarre

Depois de entrar na sessão, digite sua pergunta e pressione Enter. Para sair, use /bye ou pressione Ctrl+D. Para alternar para o modo multilinha, comece com três aspas ("""). Tudo que começa com / é um comando interno (/show, /set, /clear, /save, /load).

Você também pode passar diretamente um prompt como argumento — útil para criar scripts:

Prompt one-shot
ollama run qwen3.5:9b "Résume ce texte en 3 points : [...]"

#ollama pull

Baixa um modelo sem iniciá-lo. Útil quando você quer preparar vários modelos com antecedência ou baixar uma variante específica (tamanho, quantização).

Terminal
ollama pull granite4.2:3b
ollama pull qwen3.5:9b
ollama pull qwen3.5:9b-q8_0

O nome segue o formato modele:tag. Sem tag, você obtém a versão padrão (geralmente um 8B/9B em quantização Q4_K_M). Com uma tag explícita, você escolhe o tamanho (2b, 4b, 9b, 27b, 30b) e a quantização (q4_K_M, q5_K_M, q8_0, fp16).

i
Quantização, em poucas palavras
Um modelo 'bruto' pesa 14 GB para 7 bilhões de parâmetros em FP16. A quantização compacta esses números em menos bits: Q4_K_M (4 bits) divide o tamanho por ~4 com perda mínima de qualidade. É o ponto ideal recomendado para começar. Q5_K_M é um pouco melhor em qualidade, Q8_0 é quase perfeito, mas 2x mais pesado, e FP16 fica reservado para GPUs potentes.

#ollama list

Exibe os modelos instalados na sua máquina, o tamanho deles no disco e a data de instalação.

Terminal
ollama list
# NAME               ID            SIZE    MODIFIED
# qwen3.5:9b         42182419e950  6.6 GB  2 days ago
# granite4.2:8b      f974a74358d6  5.3 GB  1 week ago

#Outros comandos úteis

ollama ps
Mostra os modelos atualmente carregados na memória (e quanta VRAM/RAM eles consomem). Essencial para diagnosticar situações em que "está tudo lento".
ollama rm <modelo>
Remove um modelo do disco. Útil quando a pasta dos modelos começa a ocupar 50 GB.
ollama show <modelo>
Exibe os metadados de um modelo: tamanho do contexto, quantização, template de prompt, capacidades (ferramentas, visão, etc.).
ollama serve
Inicia manualmente o daemon em primeiro plano. Útil no Linux ou para diagnóstico (você vê os logs em tempo real).
ollama create
Cria um modelo personalizado a partir de um Modelfile — é o equivalente a um Dockerfile para LLM. Assunto mais avançado.

#Onde os modelos são armazenados

Os modelos podem ocupar vários gigabytes. Saber onde eles ficam é essencial para fazer uma limpeza, mover a biblioteca para outro disco ou fazer backup.

Windows
%USERPROFILE%\.ollama\models — normalmente C:\Users\votrenom\.ollama\models
macOS
~/.ollama/models
Linux (instalação via script oficial)
/usr/share/ollama/.ollama/models — le démon tourne sous l'utilisateur ollama
Linux (instalação manual no nível do usuário)
~/.ollama/models

Dentro desse diretório, dois subdiretórios: blobs (os arquivos binários dos modelos, identificados por um hash) e manifests (os metadados que descrevem qual blob corresponde a qual tag). Não edite esses arquivos manualmente — use ollama rm e ollama pull para gerenciar.

→
Mover os modelos para outro disco
Se o seu SSD de sistema for pequeno e você tiver um disco secundário maior, defina a variável de ambiente OLLAMA_MODELS para apontar para outro local. Exemplo: OLLAMA_MODELS=D:\ollama-models no Windows, ou export OLLAMA_MODELS=/mnt/data/ollama-models no Linux. Reinicie o daemon para que a variável seja aplicada.

#Configuração mínima para começar

A pergunta “o que é Ollama e minha máquina consegue rodá-lo?” aparece o tempo todo. Aqui estão os patamares reais, não os requisitos mínimos de marketing.

RAM de 8 GB, sem GPU
Limitado a modelos de 2–3B em Q4 (Qwen 3.5 2B, Granite 4.2 3B). 5–10 tokens por segundo em uma CPU moderna. Usável para testar e aprender.
16 GB de RAM, sem GPU
Os modelos de 8B são quantizados em Q4 (Granite 4.2 8B, Qwen 3.5 9B). Espere de 4 a 8 tokens por segundo. É lento para uso interativo contínuo, mas funciona.
GPU com 8 GB de VRAM
Funciona com folga com modelos de 8B em Q4 (Qwen 3.5 9B, Granite 4.2 8B — 30–50 tokens/s). Atinge o limite com modelos de 12-14B.
GPU com 12 GB de VRAM (RTX 3060, 4070)
O ponto ideal para começar em 2026. Todos os modelos de 8B rodam com fluidez, o Gemma 4 12B em Q4 roda com folga, ou o Qwen 3.5 9B em Q8 oferece a qualidade máxima nessa faixa.
GPU de 16 GB (RTX 4080, 5080) ou Mac M-Pro com 32 GB unificados
Podemos passar para modelos de 24B em Q4 (Mistral Small 24B, Devstral 24B, gpt-oss 20B) ou para o Qwen 3.5 9B em Q8 para priorizar a qualidade.
GPU de 24 GB (RTX 3090, 4090) ou Mac M-Max de 48 GB+
Já é possível rodar modelos de 27–35B com conforto (Qwen 3.8 27B, Qwen 3.6 35B-A3B), e grandes modelos MoE em Q4 com um pouco de paciência.

Para o espaço em disco, reserve 10 GB por modelo 7B em Q4 e 30 GB por modelo 32B. Ter entre 50 e 100 GB livres desde o início evita ter que fazer uma limpeza cedo demais.

!
A armadilha da "GPU detectada", mas não utilizada
No Windows e no Linux, o Ollama detecta a GPU automaticamente — a menos que seus drivers NVIDIA sejam muito antigos ou que você tenha uma GPU AMD sem o ROCm corretamente instalado. Verifique com ollama ps: se a coluna PROCESSOR indicar 100% CPU mesmo que você tenha uma GPU, a aceleração de hardware não está ativa. No macOS com Apple Silicon, a aceleração Metal é automática e está sempre ativa.

#Primeiro modelo recomendado

Quando você conhece o Ollama, o reflexo é testar o maior modelo possível "para ver". Isso é um erro — você satura a VRAM, parte do modelo passa para a RAM, fica lento e você desiste. Comece pequeno.

  1. 01
    Qwen 3.5 9B — uma escolha padrão sensata
    ollama run qwen3.5:9b baixa a versão Q4_K_M do Qwen 3.5 9B (6,6 GB). Boa qualidade geral, francês sólido, entrada de visão, janela de contexto de 256k. É a escolha para 8 GB de 2026 e um excelente parâmetro para avaliar o que sua máquina consegue fazer.
  2. 02
    Granite 4.2 8B — a alternativa discreta
    ollama run granite4.2:8b para o modelo da IBM (5,3 GB, Apache 2.0). Um pouco mais leve, muito econômico em tokens, contexto 128k. Um bom compromisso se sua placa estiver no limite da VRAM. Para um francês muito natural com mais VRAM, Mistral Small 24B (ollama run mistral-small) continua sendo uma escolha segura.
  3. 03
    Qwen 3.5 4B — o pequeno modelo polivalente em ascensão
    ollama run qwen3.5:4b para o novo pequeno modelo padrão (3,4 GB, Apache 2.0). Surpreendentemente capaz para seu tamanho, adequado para código leve e extração. Muitos o adotam como padrão quando a VRAM é limitada.
  4. 04
    Granite 4.2 3B — se o seu computador for modesto
    ollama run granite4.2:3b para um modelo que cabe em 4 GB de RAM (2,2 GB, Apache 2.0). Menos capaz, mas utilizável para tarefas simples e para aprender o funcionamento do Ollama sem sofrer com os tempos de carregamento.
→
Execute ollama ps durante um chat
Em outro terminal, enquanto você conversa, execute ollama ps. Você verá o modelo carregado, a memória utilizada e a distribuição entre GPU/CPU. É a melhor maneira de entender concretamente o que está acontecendo.

#Dicas e armadilhas

O modelo é descarregado após 5 minutos de inatividade
Esse é o valor padrão de OLLAMA_KEEP_ALIVE. Se você quiser manter o modelo na VRAM por mais tempo, defina OLLAMA_KEEP_ALIVE=2h (ou -1 para nunca descarregá-lo). Por outro lado, defina 0 se quiser liberar a VRAM assim que a requisição terminar.
Respostas truncadas depois de algumas frases
O valor padrão do parâmetro num_ctx (janela de contexto) é de 4096 tokens, independentemente do que o modelo suporte. Para uso com RAG ou documentos longos, crie um Modelfile com PARAMETER num_ctx 32768 e execute ollama create. Atenção: o consumo de VRAM aumenta rapidamente.
Sem autocompletação no shell
Digite ollama help para ver todos os comandos e ollama help <comando> para ver os detalhes de cada um. A documentação está na CLI.
Conexão recusada ao tentar acessar a partir de outra máquina da rede
Por padrão, o Ollama escuta apenas em 127.0.0.1. Para expô-lo na rede local, defina OLLAMA_HOST=0.0.0.0:11434 antes de iniciar o daemon. Lembre-se do firewall.
Um mesmo nome de modelo, várias versões
ollama pull qwen3.5:9b e ollama pull qwen3.5:9b-q8_0 baixam duas variantes separadas. Monitore seu disco com ollama list.
i
Uma interface gráfica em 5 minutos
A CLI é suficiente para entender, mas, para uso diário, conecte o Open WebUI (interface web do tipo ChatGPT) ou o LM Studio em modo cliente ao daemon do Ollama. Essas ferramentas detectam automaticamente o servidor em localhost:11434 e disponibilizam todos os seus modelos em uma interface limpa.

#Para se aprofundar

Você entendeu o que é o Ollama e seu funcionamento básico. Os próximos passos naturais são:

Instalá-lo de verdade no seu sistema operacional
O guia para instalar Ollama no Windows (ou macOS, ou Linux) explica passo a passo a instalação, a verificação da GPU e o primeiro modelo em um ambiente limpo.
Escolher a quantização certa
O guia Escolha sua quantização (Q4, Q5, Q8, FP16) compara visualmente as perdas reais de qualidade e ajuda você a equilibrar qualidade e VRAM.
Conectar uma interface gráfica de verdade
O guia Open WebUI com Ollama instala em 10 minutos uma interface semelhante à do ChatGPT, com suporte a vários usuários e RAG integrado, sobre o daemon que você já tem em execução.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.