Iniciante 8 minOffline

Uma IA off-line: usar um LLM sem conexão internet

Um LLM local só precisa da internet para ser baixado. Depois que o modelo está no seu disco, uma IA off-line funciona inteiramente sem conexão: em um avião, em áreas sem sinal, em trilhas ou em um computador isolado da rede. Este guia mostra como preparar sua máquina antes de sair, quais modelos compactos levar e como verificar tudo para não ficar sem poder usar a IA no momento errado.

Por Léa B.·Atualização 2026-08-27·Testado no Windows, macOS e Linux

#Por que uma IA off-line

Os assistentes na nuvem (ChatGPT, Claude, Gemini) param imediatamente assim que a conexão cai. Uma IA off-line, por sua vez, funciona inteiramente na sua máquina: o modelo é carregado na memória e calcula suas respostas localmente, sem nunca consultar um servidor remoto. É o mesmo princípio de um LLM local clássico, levado à sua conclusão lógica — nenhuma dependência da rede depois de concluída a preparação.

As situações em que isso muda tudo são mais frequentes do que se imagina: um voo de longa distância, uma viagem de trem sem 4G, uma missão em uma área sem cobertura, um canteiro de obras ou uma instalação industrial sem Wi-Fi, ou ainda um computador deliberadamente desconectado da internet por motivos de confidencialidade. Em todos esses casos, uma IA offline bem preparada continua plenamente operacional.

Autonomia total
Nenhuma interrupção quando a conexão de rede desaparece: avião, túnel, zona rural, subsolo.
Privacidade
Nada sai da máquina. Ideal para dados sensíveis ou um computador fisicamente isolado das redes.
Nenhum custo recorrente
Sem assinatura, sem cobrança por token, sem cota de uso.
Latência estável
A velocidade depende apenas do seu hardware, não de um servidor sobrecarregado no outro lado do mundo.

#O que precisa de rede (e o que não precisa)

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Entender a diferença entre « online » e « offline » evita surpresas ruins. Apenas um passo exige internet: o download. O resto é local.

Necessidade de conexão à rede (uma vez)
Baixar o aplicativo (Ollama, LM Studio), baixar os modelos (arquivos GGUF), obter as atualizações.
100 % offline
Carregar um modelo já presente, conversar, gerar texto ou código, resumir um documento local, usar RAG em seus arquivos.
i
A armadilha clássica
Muitas ferramentas tentam verificar se há atualizações ou fazer um 'pull' automático ao iniciar. Sem rede, isso não impede o funcionamento desde que o modelo já esteja baixado — mas o aplicativo pode exibir um erro enganoso. Teste sempre no modo avião ANTES de sair.

#Requisitos antes de começar

Uma IA off-line cabe em um notebook comum. O que importa é a RAM (ou a VRAM se você tiver um GPU) e o espaço em disco para armazenar os modelos.

Espaço livre no disco
Prever de 5 a 30 GB, dependendo dos modelos incluídos. Um modelo de 7B em Q4_K_M ocupa aproximadamente 4,5 GB, e um de 14B, cerca de 9 GB.
RAM / VRAM
8 GB para um 3B, 16 GB para rodar um 7B com folga, 32 GB para quem pretende rodar um 14B. Referências de VRAM Q4: 3B≈2 GB · 7B≈5 GB · 14B≈9 GB.
GPU (opcional)
Um GPU acelera muito, mas não é obrigatório. Um MacBook Apple Silicon (série M) ou um PC com 16 GB de RAM são suficientes usando apenas a CPU.
Bateria
A inferência exige recursos da CPU/GPU: em um notebook fora da tomada, conte com uma autonomia reduzida. Prefira modelos compactos quando estiver em deslocamento.
→
Sem GPU, ainda funciona
No avião ou no trem, você muitas vezes usará apenas a CPU. Um modelo de 3B ou 7B em Q4_K_M continua fluido em um laptop recente. O guia “LLM local sem GPU” detalha os modelos e as velocidades esperadas.

#Baixar tudo antes de perder a conexão com a rede

É a etapa decisiva e a única que exige internet. Faça isso tranquilamente em casa ou no escritório, com Wi-Fi, algumas horas antes de sair — um modelo de vários GB não gosta de conexões instáveis. Segue o passo a passo com Ollama, a abordagem mais simples para uma IA offline.

  1. 01
    Instalar o Ollama enquanto você tiver conexão com a internet
    Baixe e instale o Ollama pelo site ollama.com. É o daemon que executará seus modelos localmente, escutando em http://localhost:11434. Instale-o antes de tudo, pois o próprio aplicativo precisa ser baixado pela internet.
  2. 02
    Baixar um ou dois modelos compactos
    Use o comando ollama pull para baixar os modelos para o disco. Escolha tamanhos adequados à sua máquina (ver seção seguinte). Um download com Wi-Fi estável leva de alguns minutos a um quarto de hora, dependendo da velocidade e do tamanho.
  3. 03
    Instalar uma interface gráfica (opcional)
    Se você preferir uma janela de chat a um terminal, instale o LM Studio (solução completa, que também gerencia o download) ou o Open WebUI. O LM Studio é especialmente prático quando você está em deslocamento: app + modelos + interface em uma única ferramenta.
  4. 04
    Aquecer cada modelo uma vez
    Inicie uma conversa de teste com cada modelo baixado enquanto ainda tiver conexão. Isso confirma que o arquivo está completo e é carregado corretamente na memória.
Terminal — preparação (com rede)
# Vérifier qu'Ollama est bien installé
ollama --version

# Télécharger des modèles compacts pour la mobilité
ollama pull qwen3.5:2b         # ~1,9 Go, très léger
ollama pull qwen3.5:9b         # ~6,6 Go, LE polyvalent 2026
ollama pull granite4.2:8b      # ~5,3 Go, sobre et token-efficient

# Lister ce qui est déjà sur le disque
ollama list
!
Não saia com um pull parcial
Um ollama pull interrompu deixa um modelo incompleto que recusará o carregamento offline. Aguarde a mensagem «success» e confirme a presença do modelo com o comando ollama list antes de interromper a conexão com a rede.

#Modelos compactos que bastam para usar em movimento

Offline no celular, a economia é fundamental: um modelo pequeno, rápido e com baixo consumo de bateria é melhor do que um gigante que trava e vaza a bateria. Para a maioria dos usos em movimento — redação, resumo, perguntas gerais, ajuda no código — um modelo de 2B a 9B em Q4_K_M faz um ótimo trabalho.

Qwen 3.5 2B
~1,9 GB. O mais leve: ideal para um laptop antigo ou para preservar a bateria. Multimodal, 256k de contexto, licença Apache 2.0. Suficiente para redigir, reformular, responder a perguntas simples.
Qwen 3.5 9B
~6,6 GB. Excelente modelo versátil, bom em raciocínio, visão e código, com 256k de contexto. O melhor equilíbrio para um laptop com 16 GB de RAM — a opção de referência para 8 GB em 2026.
Granite 4.2 8B
~5,3 GB. Sóbrio e eficiente no uso de tokens (IBM, Apache 2.0), contexto de 128k, respostas concisas. Uma opção confiável para escrever sem consumir muita bateria.
Granite 4.2 3B
~2,2 GB. Compacto e ágil, muito econômico, feito para máquinas modestas sem deixar de ser competente.
→
Leve dois modelos, não dez
Um pequeno (2-3B) para economizar a bateria e responder rápido, um médio (8-9B) para tarefas exigentes. É suficiente para atender 95% das necessidades off-line sem saturar o disco.

A quantização Q4_K_M é a configuração recomendada por padrão: ela reduz bastante o tamanho do modelo e a memória necessária, com uma perda de qualidade mínima e imperceptível na maioria dos usos. Se você tiver folga na RAM/VRAM e buscar um pouco mais de refinamento, Q5_K_M é uma alternativa. Reserve Q8_0 e FP16 para máquinas muito bem equipadas.


#Verificar que tudo realmente funciona offline

Nunca confie em promessas: teste nas condições reais antes de se encontrar sem rede. Um teste de três minutos evita uma decepção a 10.000 metros de altitude.

  1. 01
    Desconectar a rede de verdade
    Ative o modo avião, desative o Wi-Fi E a Ethernet. O objetivo é reproduzir exatamente a ausência total de conexão.
  2. 02
    Iniciar uma conversa
    Abra seu terminal ou LM Studio e converse com cada modelo baixado. Se o modelo responder, sua IA off-line está funcionando.
  3. 03
    Verificar se nenhum erro de rede está bloqueando o funcionamento
    Algumas interfaces exibem uma barra de aviso quando estão offline: enquanto a geração funcionar, ignore-a. Se o chat não iniciar, provavelmente o modelo não foi completamente baixado.
Terminal — teste offline (modo avião ativado)
# Le daemon tourne en local, aucun réseau requis
ollama run qwen3.5:9b "Résume en trois points les avantages d'une IA hors ligne."

# Vérifier que le serveur local répond bien sur son port par défaut
curl http://localhost:11434/api/tags
i
O servidor permanece local
Ollama escuta em http://localhost:11434, um endereço interno da sua máquina. Isso não tem nada a ver com internet: funciona da mesma forma com ou sem conexão.

#Computador isolado e uso air-gapped

Algumas máquinas são intencionalmente mantidas sem conexão com a internet de forma permanente: estações de trabalho que processam dados confidenciais, ambientes industriais, laboratórios. Trata-se do uso "air-gapped" — a máquina de destino nunca terá acesso à rede, nem mesmo para a instalação.

O princípio: preparar os arquivos em uma máquina conectada e depois transferi-los por pendrive ou disco externo para o computador isolado. O Ollama armazena seus modelos em um diretório que pode ser copiado tal como está.

Instaladores offline
Baixe o binário de instalação do Ollama ou do LM Studio em uma máquina conectada, depois copie-o para o computador isolado.
Arquivos de modelos
No Linux/macOS, os modelos do Ollama ficam em ~/.ollama/models; no Windows, em %USERPROFILE%\.ollama\models. Copie essa pasta para o computador de destino, no mesmo local.
Alternativa GGUF
Com LM Studio, basta copiar os arquivos .gguf baixados para o diretório de modelos do app na máquina isolada.
Terminal — transferência para um computador isolado
# Sur la machine connectée : localiser les modèles
ls ~/.ollama/models

# Copier tout le dossier .ollama vers une clé USB
cp -r ~/.ollama /media/usb/ollama-backup

# Sur le poste air-gapped : restaurer au même emplacement
cp -r /media/usb/ollama-backup ~/.ollama

# Vérifier que les modèles sont bien reconnus
ollama list
!
Cópia completa obrigatória
A pasta models contém tanto os blobs (os pesos) quanto os manifests (os metadados). Copie a pasta inteira: um manifest sem seu blob, ou o inverso, torna o modelo inutilizável no computador de destino.

#Atualizar seus modelos quando a conexão de rede voltar

De volta a uma área com cobertura, é hora de fazer a manutenção da sua instalação: baixar as novas versões dos modelos, adicionar novos modelos encontrados pelo caminho e atualizar o aplicativo. Nada disso pode ser feito offline, por isso é importante fazê-lo assim que a conexão voltar.

  1. 01
    Atualizar os modelos existentes
    Um ollama pull sur um modelo já presente só baixa as camadas modificadas se uma nova versão existir. Isso é rápido e mantém seus modelos atualizados.
  2. 02
    Atualizar o aplicativo
    Execute novamente o instalador do Ollama ou do LM Studio para receber as correções e o suporte a novos modelos. As atualizações são frequentes nesse ecossistema.
  3. 03
    Fazer a limpeza
    Remova os modelos que você não usa mais para liberar espaço em disco antes da sua próxima partida.
  4. 04
    Testar novamente no modo avião
    Após qualquer atualização, realize novamente um teste offline: uma nova versão do app pode introduzir um comportamento inesperado sem conexão com a rede.
Terminal — manutenção (com rede)
# Mettre à jour un modèle vers sa dernière version
ollama pull qwen3.5:9b

# Supprimer un modèle devenu inutile
ollama rm qwen3.5:2b

# Voir l'espace occupé par chaque modèle
ollama list

#Solução de problemas

« Model not found » offline
O modelo não estava (completamente) baixado antes da interrupção. Conecte-se novamente, reinicie ollama pull jusqu após o sucesso do mensagem, depois verifique com o comando ollama list.
O aplicativo se recusa a iniciar sem rede
Algumas interfaces tentam uma verificação online ao iniciar. Aguarde alguns segundos até que ela expire, ou desative a verificação de atualização nas configurações.
Respostas muito lentas fora de casa ou do escritório
Usando apenas o CPU e com o computador funcionando na bateria, isso é normal. Passe para um modelo menor (3B) e feche os aplicativos que consomem muitos recursos. Conecte o notebook à tomada, se possível.
Bateria que acaba a olhos vistos
A inferência exige muito do processador. Reduza o tamanho do modelo, limite o comprimento das respostas e ative o modo de economia de energia para tarefas não urgentes.
Modelo copiado que não carrega (air-gap)
A cópia estava incompleta: faltavam blobs ou manifests. Copie novamente todo o diretório .ollama/models.
Memória insuficiente
O modelo excede a capacidade da sua RAM/VRAM. Escolha um tamanho menor ou uma quantização mais leve (Q4_K_M em vez de Q8_0).

#Para se aprofundar

Uma IA off-line se baseia nos mesmos fundamentos de uma instalação local convencional. Esses guias do site complementam a preparação:

Instalar Ollama
Para instalar o motor de inferência, etapa a realizar enquanto você ainda tem conexão de rede.
Executar um LLM localmente sem GPU (somente CPU)
Indispensável para usar em mobilidade: modelos e velocidades esperadas quando você usa apenas a CPU, com o computador funcionando na bateria.
Escolher sua quantização (Q4, Q5, Q8, FP16)
Para decidir entre tamanho no disco, memória e qualidade de acordo com a máquina que você leva
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.