Substituir ChatGPT por IA local: guia de migração (2026)
Sim, para a maioria dos usos comuns: redação, resumo, tradução, código, perguntas sobre seus documentos. A migração envolve quatro passos: instalar Ollama, adicionar uma interface como Open WebUI, escolher um modelo que caiba na sua memória e depois importar seu histórico do ChatGPT. O que você não conseguirá localmente é o nível dos maiores modelos de ponta; mantenha-os como reserva para as tarefas em que eles fazem a diferença.
Sair do ChatGPT não significa abandonar suas rotinas. Uma interface de chat, histórico, assistentes pré-configurados, análise de arquivos, pesquisa na web e voz estão todos disponíveis localmente. Este guia mostra a correspondência por função, indica qual modelo escolher de acordo com sua memória e detalha o procedimento para transferir suas conversas.
#O que você ganha, o que você perde
Localmente, suas conversas e seus arquivos permanecem na sua máquina: nada passa por um serviço de terceiros, e o assistente funciona sem conexão depois que o modelo é baixado. Não há assinatura nem limite de mensagens: o custo é o do hardware e da eletricidade. Você também escolhe o modelo, seus ajustes e suas instruções. Em contrapartida, você perde o acesso automático aos maiores modelos de ponta, que não cabem em um computador pessoal, e parte da integração pronta para uso: aplicativos móveis, voz fluida, agentes conectados às suas contas. O comparativo com números de desempenho e custos está no nosso guia “IA local vs ChatGPT”.
| Função ChatGPT | Equivalente local | O que você precisa saber |
|---|---|---|
| Chat com histórico | Open WebUI, LM Studio, Jan, Msty | Open WebUI conserva as conversas em um volume Docker |
| Importação de suas conversas anteriores | Import Chats do Open WebUI | O formato ChatGPT é detectado automaticamente |
| GPTs personalizados | Modelos personalizados de Open WebUI | Instruções, ferramentas e conhecimentos em um mesmo pacote |
| Memória | Memória do Open WebUI | Fatos mantidos de uma conversa para outra |
| Arquivos anexos, análise de documentos | Base de conhecimento (RAG) | O contexto do modelo permanece limitado: veja abaixo |
| Pesquisa web | Pesquisa na web do Open WebUI, SearXNG | Fontes citadas; depende do motor configurado |
| Voz | Reconhecimento e síntese de voz do Open WebUI | Latência maior que a de um serviço em nuvem |
| Imagens | ComfyUI ou Stable Diffusion | Modelo e GPU distintos do modelo de texto |
| Modelo de ponta | Nenhum equivalente completo | Mantenha uma API ou uma assinatura como reserva |
#Escolher o modelo de acordo com sua memória
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
A regra é escolher o maior modelo que caiba com folga em Q4 na sua VRAM ou memória unificada, incluindo o contexto. O catálogo QuelLLM informa, para cada modelo, o consumo de memória em Q4 apenas dos pesos: os números abaixo foram extraídos desse catálogo. Adicione o cache KV e uma margem de 20%; o guia sobre a janela de contexto explica o cálculo.
| Memória disponível | Modelo possível | Pesos em Q4 | Para que serve |
|---|---|---|---|
| 8 GB | Qwen 3.5 9B | cerca de 6 GB | Redação, resumo, perguntas comuns |
| 12 GB | Gemma 4 12B | aproximadamente 7 GB | Assistente geral com margem de contexto |
| 16 GB | Mistral Small 3.2 24B ou gpt-oss 20B | 14 a 13 GB | Raciocínio e contexto mais longo |
| 24 GB | Qwen 3.8 27B | aproximadamente 16 GB | Uso diário exigente, código |
| 32 GB | Qwen 3.6 35B-A3B (MoE) | cerca de 21 GB | Velocidade elevada para o tamanho, contextos longos |
| 64 GB ou mais | Llama 3.3 70B ou gpt-oss 120B | 40 a 70 GB | Qualidade próxima à dos modelos comuns na nuvem |
#Voltar a ter uma interface de chat
- Open WebUI
- A interface web mais próxima de ChatGPT: histórico, prompts de sistema, arquivos anexados, pesquisa web, memória e modelos personalizados. Ela se conecta a Ollama ou a qualquer API compatível com OpenAI.
- LM Studio
- Aplicativo para desktop que baixa os modelos e oferece um chat: a forma mais rápida de começar sem terminal.
- Jan
- Aplicativo de desktop simples, focado em privacidade, com chat e gerenciamento de modelos.
- Msty
- Interface bem-acabada para Mac, Windows e Linux, com vários modelos lado a lado.
Para uma primeira instalação, LM Studio ou Jan são suficientes. Escolha Open WebUI se várias pessoas precisarem usá-la, se você quiser memória, modelos personalizados ou importação do seu histórico.
#Importar seu histórico do ChatGPT
Open WebUI sabe ler a exportação do ChatGPT sem conversão prévia: a documentação especifica que o formato ChatGPT é detectado e convertido automaticamente. Suas conversas são adicionadas às existentes, e cada importação recebe um novo identificador: reimportar o mesmo arquivo cria duplicatas. Portanto, importe apenas uma vez, após verificar o arquivo.
- 01Solicitar a exportação ao ChatGPTNo ChatGPT, abra Configurações, Controle de dados (Data controls), depois Exportar dados (Export data) e Solicitar exportação. Você receberá por e-mail um link de download; o texto exato das opções depende do idioma da interface.
- 02Extrair o arquivo compactadoDescompacte o arquivo recebido e localize o arquivo conversations.json, que contém o histórico.
- 03Fazer backup do Open WebUIAntes de importar, exporte suas conversas existentes no Open WebUI em Configurações, Controle de Dados, Exportar Discussões, para poder voltar atrás.
- 04ImportarNo Open WebUI: nome de usuário no canto inferior esquerdo, Configurações, Controle de dados, Importar conversas, depois escolha conversations.json. O rótulo varia conforme o idioma.
- 05VerificarAbra algumas conversas antigas: as mensagens devem aparecer na ordem correta. O modelo exibido em uma conversa importada não reflete necessariamente o modelo original.
#Instalar a pilha: Ollama, Open WebUI, um modelo
O procedimento abaixo assume o Docker instalado para Open WebUI. Sem Docker, LM Studio ou Jan substituem o conjunto em uma única aplicação.
- 01Instalar OllamaSiga o guia de instalação do seu sistema. Ollama escuta por padrão em http://localhost:11434.
- 02Baixar um modeloEscolha conforme a tabela acima, por exemplo usando ollama pull seguido do nome do modelo. Verifique seu tamanho antes de baixá-lo.
- 03Iniciar o Open WebUIA documentação oficial propõe um comando Docker que monta um volume para preservar seus dados e permite que o Open WebUI acesse o Ollama na máquina hospedeira.
- 04Ajustar o contextoCom menos de 24 GiB de VRAM, o Ollama usa um contexto de cerca de 4.000 tokens, o que trunca documentos longos. Aumente conforme a memória disponível.
A opção de volume preserva suas conversas durante atualizações e a chave secreta deve ser definida apenas uma vez: sem uma chave estável, cada recriação do container desconecta os usuários, conforme explica a documentação. Substitua your-secret-key por um valor gerado, por exemplo com openssl rand -hex 32. A interface então responde na porta 3000 da sua máquina.
#Retomar suas formas de uso, uma a uma
- Conversar, escrever, traduzir
- Disponível assim que um modelo é carregado. A qualidade depende do tamanho do modelo: um 9B é suficiente para um e-mail, um 27B ou mais para um texto longo e com nuances.
- Analisar seus documentos
- As bases de conhecimento do Open WebUI, do AnythingLLM ou do PrivateGPT recuperam os trechos úteis em vez de enviar tudo para o modelo. Essa é a abordagem adequada assim que seus documentos ultrapassam a janela.
- Coder
- Extensões como Cline ou Continue se conectam ao Ollama. O Ollama recomenda pelo menos 64.000 tokens de contexto para ferramentas de programação.
- Encontre seus GPTs
- Recrie cada GPT como um modelo personalizado: instruções de sistema, ferramentas e conhecimentos reunidos. Copie suas instruções do ChatGPT.
- Pesquisar na web
- Ative a pesquisa na web do Open WebUI ou conecte o SearXNG para que o modelo cite fontes.
#Quando manter o ChatGPT ou uma API na nuvem como alternativa de reserva
Três situações justificam não abandonar completamente a nuvem: um raciocínio muito longo sobre um problema difícil, uma tarefa que exige um contexto de várias centenas de milhares de tokens ou um uso móvel com voz contínua. Uma abordagem híbrida funciona bem: a IA local para tudo o que for confidencial ou repetitivo, a nuvem para as exceções, sem nunca colar dados sensíveis nela. O Open WebUI permite conectar um provedor externo junto ao Ollama e comparar dois modelos lado a lado, o que ajuda a avaliar se a IA local é suficiente para o seu caso.
#Migrar sem risco: primeiro um teste em paralelo
Não cancele nada no primeiro dia. O mais seguro é usar as duas ferramentas lado a lado por uma ou duas semanas, fazendo a mesma pergunta a ambas sempre que o resultado for importante. Anote os casos em que o assistente local decepciona: eles indicam se é necessário um modelo maior, uma janela maior, um prompt melhor ou, francamente, se aquele uso deve permanecer na nuvem.
- 01Dias 1 e 2: instalar e testarInstale a pilha, carregue o modelo adequado à sua memória e repita cinco conversas típicas do seu histórico ChatGPT.
- 02Dias 3 a 7: complementar o ChatGPTUse a IA local para todas as tarefas rotineiras; recorra ao ChatGPT apenas quando a resposta local não for suficiente e anote o motivo.
- 03Semana 2: importar e recriarImporte seu histórico uma vez, recrie seus GPTs mais usados como modelos personalizados, ative a pesquisa na web se precisar.
- 04Fim do período: decidirConte os casos em que você teve que voltar para a nuvem. Se for raro, o plano pode ser encerrado; caso contrário, mantenha ou mude para uma API cobrada por uso.
#Desapontamentos comuns após a migração
- O contexto corta seus documentos
- Ollama inicia com cerca de 4.000 tokens em uma placa de menos de 24 GiB: um longo PDF colado no chat é cortado sem aviso evidente. Aumente a janela, dentro dos limites da sua memória.
- Um modelo pequeno demais ou comprimido demais
- Um modelo de 3B ou 7B em 2 bits dará a impressão de que a IA local é medíocre. Aumente o tamanho do modelo antes de tirar conclusões e evite quantizações abaixo de 4 bits.
- Um modelo de raciocínio lento
- Alguns modelos pensam por muito tempo antes de responder: a resposta chega após dezenas de segundos. Escolha um modelo sem raciocínio para conversas comuns.
- Prompts escritos para ChatGPT
- Um modelo local tem mais dificuldade em seguir instruções vagas. Especifique o papel, o formato e o idioma da resposta no prompt de sistema.
#O que ainda sai da sua máquina
Local não significa isolado do mundo externo. A pesquisa na web do Open WebUI envia suas consultas ao mecanismo de busca configurado; um modelo cuja tag no Ollama termina em cloud é executado nos servidores do fornecedor, como kimi-k3:cloud na biblioteca do Ollama; e conectar um fornecedor externo junto com o Ollama, algo que o Open WebUI permite, envia suas mensagens a esse fornecedor. Para garantir a confidencialidade de fato, desative essas opções ou reserve-as para um perfil separado e verifique a lista de modelos instalados antes de processar documentos sensíveis.
É possível realmente substituir o ChatGPT por uma IA local?+
Como recuperar minhas conversas com o ChatGPT?+
Qual interface mais se parece com o ChatGPT?+
Qual modelo pegar com 16 GB de memória?+
E meus GPTs personalizados?+
É realmente gratuito?+
#Para se aprofundar
- Instalar Ollama em 5 minutos
- Open WebUI com Ollama: guia completo
- IA local vs ChatGPT: comparação
- Compreender a janela de contexto
- RAG local com Ollama sem programar
- SearXNG: pesquisa na web para um modelo local
- Fonte: Open WebUI, importação e exportação de conversas
- Fonte: Open WebUI, funcionalidades
- Fonte: Open WebUI, início rápido
- Fonte: Ollama, comprimento de contexto
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.