Compartilhar o Ollama na sua rede local (família, equipe)
Executar o Ollama como um servidor na rede local muda tudo: uma única GPU, vários usuários. O cônjuge no seu MacBook, o desenvolvedor no seu computador de mesa, a criança no tablet — todos acessam o mesmo daemon, sem duplicar 30 GB de modelos. Este guia mostra como disponibilizar o Ollama na rede local corretamente, sem expô-lo ao mundo inteiro.
#Por que usar um servidor Ollama em rede local?
Por padrão, Ollama escuta apenas em 127.0.0.1:11434 — ou seja, apenas a máquina em que está rodando pode acessá-lo. Isso é seguro, mas desperdiça uma GPU. Uma RTX 4090 ou um Mac Studio M4 Max atende de 3 a 5 usuários simultâneos sem problemas com modelos de 7B a 14B Q4.
- Compartilhar a VRAM
- Um único modelo carregado na memória para toda a casa ou a equipe — sem cópias redundantes.
- Centralizar os modelos
- 150 GB de GGUF armazenados uma vez no servidor, nunca nos laptops.
- Padronizar as versões
- Todo mundo usa o mesmo Qwen 3.5 9B Q4 — acabaram as diferenças de qualidade entre as máquinas.
- Economizar a bateria
- Os laptops não calculam nada — eles enviam um POST HTTP para o servidor fixo.
#Pré-requisitos
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
- Ollama instalado
- Na máquina que hospedará o servidor (Linux, macOS ou Windows). Idealmente, a máquina com o melhor GPU.
- IP fixo ou DNS local
- O servidor deve manter o mesmo endereço IP. Reserva DHCP no roteador ou IP estático. Como alternativa, hostname.local via mDNS.
- Rede de confiança
- Wi-Fi doméstico com WPA2/3 ou VLAN de equipe. Sem Wi-Fi público compartilhado.
- Permissões de administrador
- Para modificar o firewall e o serviço do sistema (systemd, launchd, services.msc).
#1. Expor Ollama com OLLAMA_HOST=0.0.0.0
Ollama lê duas variáveis de ambiente essenciais: OLLAMA_HOST define a interface de escuta, OLLAMA_ORIGINS define as origens CORS autorizadas. Para passar ao modo servidor, altera-se OLLAMA_HOST de 127.0.0.1 para 0.0.0.0 (todas as interfaces).
#Linux (systemd)
Nas distribuições modernas, o Ollama roda via systemd. Edita-se o override do serviço em vez do arquivo original — assim, a configuração é preservada nas atualizações do pacote.
No editor que abre, cole este bloco entre as linhas comentadas:
Verifique se ss -tlnp mostra o Ollama em 0.0.0.0:11434, e não mais apenas em 127.0.0.1:11434.
#Windows
No Windows, o Ollama lê as variáveis de ambiente do usuário ao iniciar. O método correto: adicionar OLLAMA_HOST às variáveis do usuário e depois reiniciar o serviço pela barra de tarefas (clicar com o botão direito no ícone → Quit Ollama e depois iniciar novamente).
#2. Abrir o firewall para a rede local
Quando o Ollama estiver escutando em 0.0.0.0, o firewall deve permitir acesso à porta 11434 — mas apenas a partir da rede local. Nunca abrir a porta 11434 para a Internet: o Ollama não possui autenticação nativa.
#UFW (Ubuntu, Debian)
Adapte 192.168.1.0/24 à sua sub-rede real (use ip a para verificar). Se você deixar ufw allow 11434 sem restrição de origem e a máquina estiver exposta por meio de um redirecionamento de porta, você disponibiliza o Ollama para o mundo inteiro — com acesso anônimo.
#iptables (sem UFW)
#Firewall do Windows Defender
#3. Particularidades do macOS
No macOS, Ollama funciona como um aplicativo de interface gráfica (ícone na barra de menus) que inicia o daemon em segundo plano. As variáveis de ambiente definidas no shell não são vistas pelo aplicativo GUI — é necessário usar o launchctl ou modificar o aplicativo.
- 01Sair completamente do OllamaClique no ícone da lhama na barra de menus → Quit Ollama. Verifique com ps aux | grep ollama que nada mais está em execução.
- 02Definir a variável no nível do launchctlNo terminal: launchctl setenv OLLAMA_HOST "0.0.0.0:11434" depois launchctl setenv OLLAMA_ORIGINS "*". Essas variáveis são herdadas por todas as aplicações GUI lançadas posteriormente.
- 03Reiniciar o Ollama.appAbra Aplicativos → Ollama.app. O app vai reler o ambiente e escutar em 0.0.0.0.
- 04Manter após a reinicializaçãolaunchctl setenv não sobrevive ao reinício. Para torná-lo permanente, crie um LaunchAgent em ~/Library/LaunchAgents/com.ollama.env.plist (ver documentação Apple) ou reexecute os setenv a partir de um script de inicialização.
#4. Conectar os clientes
A partir de outra máquina da LAN, o IP do servidor substitui localhost em todos os comandos e configurações.
Para a CLI Ollama em si, exporta-se OLLAMA_HOST no lado do cliente — a comando ollama run pointe então para o servidor remoto.
- Open WebUI
- Em Settings → Connections, adicione a URL http://192.168.1.42:11434 como Ollama API URL. A interface roda em qualquer máquina da rede local.
- Continue.dev (VS Code)
- No config.json, o campo apiBase do provedor ollama aponta para http://192.168.1.42:11434.
- LangChain Python
- Ollama(base_url="http://192.168.1.42:11434", model="qwen3.5:9b") — igual ao localhost localmente.
#5. Proxy reverso Nginx + autenticação básica
Expor o Ollama sem proteção na rede local é aceitável para a família, mas, para uma equipe, é melhor adicionar pelo menos autenticação HTTP Basic e algum registro de logs. O Nginx faz isso em 20 linhas.
Importante: com esta configuração, o Ollama deve voltar para 127.0.0.1:11434 (não para 0.0.0.0). O Nginx escuta publicamente na porta 8080, verifica o endereço IP e a senha, depois encaminha as solicitações para o Ollama localmente. Os clientes agora acessam http://alice:motdepasse@192.168.1.42:8080.
#Boas práticas de segurança
- Restringir por IP de origem no firewall
- Segurança redobrada: mesmo com Nginx, mantenha a regra UFW/iptables. Um bug no Nginx ou um bind incorreto pode expor diretamente a porta 11434.
- Desativar o acesso externo a /api/create
- Esta rota permite enviar um Modelfile arbitrário. Com Nginx, adicione location /api/create { return 403; }.
- Registrar as requisições em logs
- O access_log do Nginx mostra quem chama o quê. Útil para detectar a exposição do IP do servidor ou um cliente mal configurado que envia requisições em excesso.
- Quotas por usuário
- Ollama não oferece isso nativamente. Para limitar o Bob quando ele inicia uma tarefa pesada de geração às 3h da manhã, considere LiteLLM ou Open WebUI como camada de middleware.
- Fazer backup de ~/.ollama
- O servidor centralizado torna-se um único ponto de falha. O diretório dos modelos pode pesar 100+ GB — pelo menos um script rsync para um disco externo.
#Solução de problemas
- Erro "Connection refused" ao conectar a partir de um cliente
- Ollama ainda está escutando em 127.0.0.1. Verifique ss -tlnp | grep 11434 no servidor — se exibir 127.0.0.1:11434, a variável OLLAMA_HOST não está sendo reconhecida pelo serviço. Confira novamente systemctl show ollama | grep Environment.
- Connection timed out
- O firewall está bloqueando. Teste nc -zv 192.168.1.42 11434 do cliente: se houver timeout, é o firewall. Se for recusado, é Ollama que não está ouvindo.
- Erro CORS no Open WebUI
- OLLAMA_ORIGINS=* faltando ou não aplicado. Para debug: curl -H "Origin: http://autre-machine" -I http://192.168.1.42:11434 — a resposta deve conter Access-Control-Allow-Origin.
- macOS: variável ignorada após reinício
- launchctl setenv não persiste. É necessário um LaunchAgent. Alternativa prática: um script ~/start-ollama.sh que faça launchctl setenv + open Ollama.app, a ser executado manualmente após cada reinício.
- Lentidão repentina com múltiplos usuários
- Ollama processa as requisições em fila por modelo. Com 3 usuários simultâneos em um 14B, o 3º espera. OLLAMA_NUM_PARALLEL=2 (variável de ambiente) permite 2 requisições em paralelo ao custo de um maior consumo de VRAM.
- O modelo é descarregado da memória entre as requisições
- Por padrão, Ollama descarrega um modelo 5 minutos após a última requisição. OLLAMA_KEEP_ALIVE=24h mantém o modelo na VRAM — essencial para um servidor compartilhado.
#Para se aprofundar
O servidor Ollama compartilhado é a base de uma configuração multiusuário. A partir daí, há três caminhos naturais:
- Adicionar uma interface de chat compartilhada
- O guia Open WebUI com Ollama: guia completo detalha a configuração de uma interface semelhante ao ChatGPT, com suporte a vários usuários, que se conecta a este servidor.
- Implantar em produção com Docker
- O guia 'Implantar um LLM em produção com Docker Compose' mostra a mesma arquitetura em contêineres, com Traefik e HTTPS.
- Expandir para um chatbot de intranet
- O guia Implantar um chatbot de IA para sua equipe na intranet acrescenta autenticação SSO, monitoramento e backup das conversas.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.