Uma IA off-line: usar um LLM sem conexão internet
Um LLM local só precisa da internet para ser baixado. Depois que o modelo está no seu disco, uma IA off-line funciona inteiramente sem conexão: em um avião, em áreas sem sinal, em trilhas ou em um computador isolado da rede. Este guia mostra como preparar sua máquina antes de sair, quais modelos compactos levar e como verificar tudo para não ficar sem poder usar a IA no momento errado.
#Por que uma IA off-line
Os assistentes na nuvem (ChatGPT, Claude, Gemini) param imediatamente assim que a conexão cai. Uma IA off-line, por sua vez, funciona inteiramente na sua máquina: o modelo é carregado na memória e calcula suas respostas localmente, sem nunca consultar um servidor remoto. É o mesmo princípio de um LLM local clássico, levado à sua conclusão lógica — nenhuma dependência da rede depois de concluída a preparação.
As situações em que isso muda tudo são mais frequentes do que se imagina: um voo de longa distância, uma viagem de trem sem 4G, uma missão em uma área sem cobertura, um canteiro de obras ou uma instalação industrial sem Wi-Fi, ou ainda um computador deliberadamente desconectado da internet por motivos de confidencialidade. Em todos esses casos, uma IA offline bem preparada continua plenamente operacional.
- Autonomia total
- Nenhuma interrupção quando a conexão de rede desaparece: avião, túnel, zona rural, subsolo.
- Privacidade
- Nada sai da máquina. Ideal para dados sensíveis ou um computador fisicamente isolado das redes.
- Nenhum custo recorrente
- Sem assinatura, sem cobrança por token, sem cota de uso.
- Latência estável
- A velocidade depende apenas do seu hardware, não de um servidor sobrecarregado no outro lado do mundo.
#O que precisa de rede (e o que não precisa)
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Entender a diferença entre « online » e « offline » evita surpresas ruins. Apenas um passo exige internet: o download. O resto é local.
- Necessidade de conexão à rede (uma vez)
- Baixar o aplicativo (Ollama, LM Studio), baixar os modelos (arquivos GGUF), obter as atualizações.
- 100 % offline
- Carregar um modelo já presente, conversar, gerar texto ou código, resumir um documento local, usar RAG em seus arquivos.
#Requisitos antes de começar
Uma IA off-line cabe em um notebook comum. O que importa é a RAM (ou a VRAM se você tiver um GPU) e o espaço em disco para armazenar os modelos.
- Espaço livre no disco
- Prever de 5 a 30 GB, dependendo dos modelos incluídos. Um modelo de 7B em Q4_K_M ocupa aproximadamente 4,5 GB, e um de 14B, cerca de 9 GB.
- RAM / VRAM
- 8 GB para um 3B, 16 GB para rodar um 7B com folga, 32 GB para quem pretende rodar um 14B. Referências de VRAM Q4: 3B≈2 GB · 7B≈5 GB · 14B≈9 GB.
- GPU (opcional)
- Um GPU acelera muito, mas não é obrigatório. Um MacBook Apple Silicon (série M) ou um PC com 16 GB de RAM são suficientes usando apenas a CPU.
- Bateria
- A inferência exige recursos da CPU/GPU: em um notebook fora da tomada, conte com uma autonomia reduzida. Prefira modelos compactos quando estiver em deslocamento.
#Baixar tudo antes de perder a conexão com a rede
É a etapa decisiva e a única que exige internet. Faça isso tranquilamente em casa ou no escritório, com Wi-Fi, algumas horas antes de sair — um modelo de vários GB não gosta de conexões instáveis. Segue o passo a passo com Ollama, a abordagem mais simples para uma IA offline.
- 01Instalar o Ollama enquanto você tiver conexão com a internetBaixe e instale o Ollama pelo site ollama.com. É o daemon que executará seus modelos localmente, escutando em http://localhost:11434. Instale-o antes de tudo, pois o próprio aplicativo precisa ser baixado pela internet.
- 02Baixar um ou dois modelos compactosUse o comando ollama pull para baixar os modelos para o disco. Escolha tamanhos adequados à sua máquina (ver seção seguinte). Um download com Wi-Fi estável leva de alguns minutos a um quarto de hora, dependendo da velocidade e do tamanho.
- 03Instalar uma interface gráfica (opcional)Se você preferir uma janela de chat a um terminal, instale o LM Studio (solução completa, que também gerencia o download) ou o Open WebUI. O LM Studio é especialmente prático quando você está em deslocamento: app + modelos + interface em uma única ferramenta.
- 04Aquecer cada modelo uma vezInicie uma conversa de teste com cada modelo baixado enquanto ainda tiver conexão. Isso confirma que o arquivo está completo e é carregado corretamente na memória.
#Modelos compactos que bastam para usar em movimento
Offline no celular, a economia é fundamental: um modelo pequeno, rápido e com baixo consumo de bateria é melhor do que um gigante que trava e vaza a bateria. Para a maioria dos usos em movimento — redação, resumo, perguntas gerais, ajuda no código — um modelo de 2B a 9B em Q4_K_M faz um ótimo trabalho.
- Qwen 3.5 2B
- ~1,9 GB. O mais leve: ideal para um laptop antigo ou para preservar a bateria. Multimodal, 256k de contexto, licença Apache 2.0. Suficiente para redigir, reformular, responder a perguntas simples.
- Qwen 3.5 9B
- ~6,6 GB. Excelente modelo versátil, bom em raciocínio, visão e código, com 256k de contexto. O melhor equilíbrio para um laptop com 16 GB de RAM — a opção de referência para 8 GB em 2026.
- Granite 4.2 8B
- ~5,3 GB. Sóbrio e eficiente no uso de tokens (IBM, Apache 2.0), contexto de 128k, respostas concisas. Uma opção confiável para escrever sem consumir muita bateria.
- Granite 4.2 3B
- ~2,2 GB. Compacto e ágil, muito econômico, feito para máquinas modestas sem deixar de ser competente.
A quantização Q4_K_M é a configuração recomendada por padrão: ela reduz bastante o tamanho do modelo e a memória necessária, com uma perda de qualidade mínima e imperceptível na maioria dos usos. Se você tiver folga na RAM/VRAM e buscar um pouco mais de refinamento, Q5_K_M é uma alternativa. Reserve Q8_0 e FP16 para máquinas muito bem equipadas.
#Verificar que tudo realmente funciona offline
Nunca confie em promessas: teste nas condições reais antes de se encontrar sem rede. Um teste de três minutos evita uma decepção a 10.000 metros de altitude.
- 01Desconectar a rede de verdadeAtive o modo avião, desative o Wi-Fi E a Ethernet. O objetivo é reproduzir exatamente a ausência total de conexão.
- 02Iniciar uma conversaAbra seu terminal ou LM Studio e converse com cada modelo baixado. Se o modelo responder, sua IA off-line está funcionando.
- 03Verificar se nenhum erro de rede está bloqueando o funcionamentoAlgumas interfaces exibem uma barra de aviso quando estão offline: enquanto a geração funcionar, ignore-a. Se o chat não iniciar, provavelmente o modelo não foi completamente baixado.
#Computador isolado e uso air-gapped
Algumas máquinas são intencionalmente mantidas sem conexão com a internet de forma permanente: estações de trabalho que processam dados confidenciais, ambientes industriais, laboratórios. Trata-se do uso "air-gapped" — a máquina de destino nunca terá acesso à rede, nem mesmo para a instalação.
O princípio: preparar os arquivos em uma máquina conectada e depois transferi-los por pendrive ou disco externo para o computador isolado. O Ollama armazena seus modelos em um diretório que pode ser copiado tal como está.
- Instaladores offline
- Baixe o binário de instalação do Ollama ou do LM Studio em uma máquina conectada, depois copie-o para o computador isolado.
- Arquivos de modelos
- No Linux/macOS, os modelos do Ollama ficam em ~/.ollama/models; no Windows, em %USERPROFILE%\.ollama\models. Copie essa pasta para o computador de destino, no mesmo local.
- Alternativa GGUF
- Com LM Studio, basta copiar os arquivos .gguf baixados para o diretório de modelos do app na máquina isolada.
#Atualizar seus modelos quando a conexão de rede voltar
De volta a uma área com cobertura, é hora de fazer a manutenção da sua instalação: baixar as novas versões dos modelos, adicionar novos modelos encontrados pelo caminho e atualizar o aplicativo. Nada disso pode ser feito offline, por isso é importante fazê-lo assim que a conexão voltar.
- 01Atualizar os modelos existentesUm ollama pull sur um modelo já presente só baixa as camadas modificadas se uma nova versão existir. Isso é rápido e mantém seus modelos atualizados.
- 02Atualizar o aplicativoExecute novamente o instalador do Ollama ou do LM Studio para receber as correções e o suporte a novos modelos. As atualizações são frequentes nesse ecossistema.
- 03Fazer a limpezaRemova os modelos que você não usa mais para liberar espaço em disco antes da sua próxima partida.
- 04Testar novamente no modo aviãoApós qualquer atualização, realize novamente um teste offline: uma nova versão do app pode introduzir um comportamento inesperado sem conexão com a rede.
#Solução de problemas
- « Model not found » offline
- O modelo não estava (completamente) baixado antes da interrupção. Conecte-se novamente, reinicie ollama pull jusqu após o sucesso do mensagem, depois verifique com o comando ollama list.
- O aplicativo se recusa a iniciar sem rede
- Algumas interfaces tentam uma verificação online ao iniciar. Aguarde alguns segundos até que ela expire, ou desative a verificação de atualização nas configurações.
- Respostas muito lentas fora de casa ou do escritório
- Usando apenas o CPU e com o computador funcionando na bateria, isso é normal. Passe para um modelo menor (3B) e feche os aplicativos que consomem muitos recursos. Conecte o notebook à tomada, se possível.
- Bateria que acaba a olhos vistos
- A inferência exige muito do processador. Reduza o tamanho do modelo, limite o comprimento das respostas e ative o modo de economia de energia para tarefas não urgentes.
- Modelo copiado que não carrega (air-gap)
- A cópia estava incompleta: faltavam blobs ou manifests. Copie novamente todo o diretório .ollama/models.
- Memória insuficiente
- O modelo excede a capacidade da sua RAM/VRAM. Escolha um tamanho menor ou uma quantização mais leve (Q4_K_M em vez de Q8_0).
#Para se aprofundar
Uma IA off-line se baseia nos mesmos fundamentos de uma instalação local convencional. Esses guias do site complementam a preparação:
- Instalar Ollama
- Para instalar o motor de inferência, etapa a realizar enquanto você ainda tem conexão de rede.
- Executar um LLM localmente sem GPU (somente CPU)
- Indispensável para usar em mobilidade: modelos e velocidades esperadas quando você usa apenas a CPU, com o computador funcionando na bateria.
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Para decidir entre tamanho no disco, memória e qualidade de acordo com a máquina que você leva
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.