Intermediário 11 minMigração

Substituir ChatGPT por IA local: guia de migração (2026)

Resposta direta

Sim, para a maioria dos usos comuns: redação, resumo, tradução, código, perguntas sobre seus documentos. A migração envolve quatro passos: instalar Ollama, adicionar uma interface como Open WebUI, escolher um modelo que caiba na sua memória e depois importar seu histórico do ChatGPT. O que você não conseguirá localmente é o nível dos maiores modelos de ponta; mantenha-os como reserva para as tarefas em que eles fazem a diferença.

Sair do ChatGPT não significa abandonar suas rotinas. Uma interface de chat, histórico, assistentes pré-configurados, análise de arquivos, pesquisa na web e voz estão todos disponíveis localmente. Este guia mostra a correspondência por função, indica qual modelo escolher de acordo com sua memória e detalha o procedimento para transferir suas conversas.

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux

#O que você ganha, o que você perde

Localmente, suas conversas e seus arquivos permanecem na sua máquina: nada passa por um serviço de terceiros, e o assistente funciona sem conexão depois que o modelo é baixado. Não há assinatura nem limite de mensagens: o custo é o do hardware e da eletricidade. Você também escolhe o modelo, seus ajustes e suas instruções. Em contrapartida, você perde o acesso automático aos maiores modelos de ponta, que não cabem em um computador pessoal, e parte da integração pronta para uso: aplicativos móveis, voz fluida, agentes conectados às suas contas. O comparativo com números de desempenho e custos está no nosso guia “IA local vs ChatGPT”.

O que você usa no ChatGPT e seu equivalente local
Função ChatGPTEquivalente localO que você precisa saber
Chat com históricoOpen WebUI, LM Studio, Jan, MstyOpen WebUI conserva as conversas em um volume Docker
Importação de suas conversas anterioresImport Chats do Open WebUIO formato ChatGPT é detectado automaticamente
GPTs personalizadosModelos personalizados de Open WebUIInstruções, ferramentas e conhecimentos em um mesmo pacote
MemóriaMemória do Open WebUIFatos mantidos de uma conversa para outra
Arquivos anexos, análise de documentosBase de conhecimento (RAG)O contexto do modelo permanece limitado: veja abaixo
Pesquisa webPesquisa na web do Open WebUI, SearXNGFontes citadas; depende do motor configurado
VozReconhecimento e síntese de voz do Open WebUILatência maior que a de um serviço em nuvem
ImagensComfyUI ou Stable DiffusionModelo e GPU distintos do modelo de texto
Modelo de pontaNenhum equivalente completoMantenha uma API ou uma assinatura como reserva

#Escolher o modelo de acordo com sua memória

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

A regra é escolher o maior modelo que caiba com folga em Q4 na sua VRAM ou memória unificada, incluindo o contexto. O catálogo QuelLLM informa, para cada modelo, o consumo de memória em Q4 apenas dos pesos: os números abaixo foram extraídos desse catálogo. Adicione o cache KV e uma margem de 20%; o guia sobre a janela de contexto explica o cálculo.

Modelos recomendados de acordo com a memória disponível (catálogo QuelLLM, Q4, pesos apenas)
Memória disponívelModelo possívelPesos em Q4Para que serve
8 GBQwen 3.5 9Bcerca de 6 GBRedação, resumo, perguntas comuns
12 GBGemma 4 12Baproximadamente 7 GBAssistente geral com margem de contexto
16 GBMistral Small 3.2 24B ou gpt-oss 20B14 a 13 GBRaciocínio e contexto mais longo
24 GBQwen 3.8 27Baproximadamente 16 GBUso diário exigente, código
32 GBQwen 3.6 35B-A3B (MoE)cerca de 21 GBVelocidade elevada para o tamanho, contextos longos
64 GB ou maisLlama 3.3 70B ou gpt-oss 120B40 a 70 GBQualidade próxima à dos modelos comuns na nuvem
i
Um MoE se comporta de forma diferente
Um modelo com múltiplos especialistas como Qwen 3.6 35B-A3B exige a memória de seus 35 bilhões de parâmetros, mas ativa apenas 3 bilhões por token: ele gera muito mais rápido que um modelo denso de mesmo tamanho. Veja o guia sobre MoE.

#Voltar a ter uma interface de chat

Open WebUI
A interface web mais próxima de ChatGPT: histórico, prompts de sistema, arquivos anexados, pesquisa web, memória e modelos personalizados. Ela se conecta a Ollama ou a qualquer API compatível com OpenAI.
LM Studio
Aplicativo para desktop que baixa os modelos e oferece um chat: a forma mais rápida de começar sem terminal.
Jan
Aplicativo de desktop simples, focado em privacidade, com chat e gerenciamento de modelos.
Msty
Interface bem-acabada para Mac, Windows e Linux, com vários modelos lado a lado.

Para uma primeira instalação, LM Studio ou Jan são suficientes. Escolha Open WebUI se várias pessoas precisarem usá-la, se você quiser memória, modelos personalizados ou importação do seu histórico.

#Importar seu histórico do ChatGPT

Open WebUI sabe ler a exportação do ChatGPT sem conversão prévia: a documentação especifica que o formato ChatGPT é detectado e convertido automaticamente. Suas conversas são adicionadas às existentes, e cada importação recebe um novo identificador: reimportar o mesmo arquivo cria duplicatas. Portanto, importe apenas uma vez, após verificar o arquivo.

  1. 01
    Solicitar a exportação ao ChatGPT
    No ChatGPT, abra Configurações, Controle de dados (Data controls), depois Exportar dados (Export data) e Solicitar exportação. Você receberá por e-mail um link de download; o texto exato das opções depende do idioma da interface.
  2. 02
    Extrair o arquivo compactado
    Descompacte o arquivo recebido e localize o arquivo conversations.json, que contém o histórico.
  3. 03
    Fazer backup do Open WebUI
    Antes de importar, exporte suas conversas existentes no Open WebUI em Configurações, Controle de Dados, Exportar Discussões, para poder voltar atrás.
  4. 04
    Importar
    No Open WebUI: nome de usuário no canto inferior esquerdo, Configurações, Controle de dados, Importar conversas, depois escolha conversations.json. O rótulo varia conforme o idioma.
  5. 05
    Verificar
    Abra algumas conversas antigas: as mensagens devem aparecer na ordem correta. O modelo exibido em uma conversa importada não reflete necessariamente o modelo original.

#Instalar a pilha: Ollama, Open WebUI, um modelo

O procedimento abaixo assume o Docker instalado para Open WebUI. Sem Docker, LM Studio ou Jan substituem o conjunto em uma única aplicação.

  1. 01
    Instalar Ollama
    Siga o guia de instalação do seu sistema. Ollama escuta por padrão em http://localhost:11434.
  2. 02
    Baixar um modelo
    Escolha conforme a tabela acima, por exemplo usando ollama pull seguido do nome do modelo. Verifique seu tamanho antes de baixá-lo.
  3. 03
    Iniciar o Open WebUI
    A documentação oficial propõe um comando Docker que monta um volume para preservar seus dados e permite que o Open WebUI acesse o Ollama na máquina hospedeira.
  4. 04
    Ajustar o contexto
    Com menos de 24 GiB de VRAM, o Ollama usa um contexto de cerca de 4.000 tokens, o que trunca documentos longos. Aumente conforme a memória disponível.
Open WebUI com Docker (comando da documentação oficial)
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data -e WEBUI_SECRET_KEY=your-secret-key --name open-webui --restart always ghcr.io/open-webui/open-webui:main

A opção de volume preserva suas conversas durante atualizações e a chave secreta deve ser definida apenas uma vez: sem uma chave estável, cada recriação do container desconecta os usuários, conforme explica a documentação. Substitua your-secret-key por um valor gerado, por exemplo com openssl rand -hex 32. A interface então responde na porta 3000 da sua máquina.

#Retomar suas formas de uso, uma a uma

Conversar, escrever, traduzir
Disponível assim que um modelo é carregado. A qualidade depende do tamanho do modelo: um 9B é suficiente para um e-mail, um 27B ou mais para um texto longo e com nuances.
Analisar seus documentos
As bases de conhecimento do Open WebUI, do AnythingLLM ou do PrivateGPT recuperam os trechos úteis em vez de enviar tudo para o modelo. Essa é a abordagem adequada assim que seus documentos ultrapassam a janela.
Coder
Extensões como Cline ou Continue se conectam ao Ollama. O Ollama recomenda pelo menos 64.000 tokens de contexto para ferramentas de programação.
Encontre seus GPTs
Recrie cada GPT como um modelo personalizado: instruções de sistema, ferramentas e conhecimentos reunidos. Copie suas instruções do ChatGPT.
Pesquisar na web
Ative a pesquisa na web do Open WebUI ou conecte o SearXNG para que o modelo cite fontes.

#Quando manter o ChatGPT ou uma API na nuvem como alternativa de reserva

Três situações justificam não abandonar completamente a nuvem: um raciocínio muito longo sobre um problema difícil, uma tarefa que exige um contexto de várias centenas de milhares de tokens ou um uso móvel com voz contínua. Uma abordagem híbrida funciona bem: a IA local para tudo o que for confidencial ou repetitivo, a nuvem para as exceções, sem nunca colar dados sensíveis nela. O Open WebUI permite conectar um provedor externo junto ao Ollama e comparar dois modelos lado a lado, o que ajuda a avaliar se a IA local é suficiente para o seu caso.

#Migrar sem risco: primeiro um teste em paralelo

Não cancele nada no primeiro dia. O mais seguro é usar as duas ferramentas lado a lado por uma ou duas semanas, fazendo a mesma pergunta a ambas sempre que o resultado for importante. Anote os casos em que o assistente local decepciona: eles indicam se é necessário um modelo maior, uma janela maior, um prompt melhor ou, francamente, se aquele uso deve permanecer na nuvem.

  1. 01
    Dias 1 e 2: instalar e testar
    Instale a pilha, carregue o modelo adequado à sua memória e repita cinco conversas típicas do seu histórico ChatGPT.
  2. 02
    Dias 3 a 7: complementar o ChatGPT
    Use a IA local para todas as tarefas rotineiras; recorra ao ChatGPT apenas quando a resposta local não for suficiente e anote o motivo.
  3. 03
    Semana 2: importar e recriar
    Importe seu histórico uma vez, recrie seus GPTs mais usados como modelos personalizados, ative a pesquisa na web se precisar.
  4. 04
    Fim do período: decidir
    Conte os casos em que você teve que voltar para a nuvem. Se for raro, o plano pode ser encerrado; caso contrário, mantenha ou mude para uma API cobrada por uso.

#Desapontamentos comuns após a migração

O contexto corta seus documentos
Ollama inicia com cerca de 4.000 tokens em uma placa de menos de 24 GiB: um longo PDF colado no chat é cortado sem aviso evidente. Aumente a janela, dentro dos limites da sua memória.
Um modelo pequeno demais ou comprimido demais
Um modelo de 3B ou 7B em 2 bits dará a impressão de que a IA local é medíocre. Aumente o tamanho do modelo antes de tirar conclusões e evite quantizações abaixo de 4 bits.
Um modelo de raciocínio lento
Alguns modelos pensam por muito tempo antes de responder: a resposta chega após dezenas de segundos. Escolha um modelo sem raciocínio para conversas comuns.
Prompts escritos para ChatGPT
Um modelo local tem mais dificuldade em seguir instruções vagas. Especifique o papel, o formato e o idioma da resposta no prompt de sistema.

#O que ainda sai da sua máquina

Local não significa isolado do mundo externo. A pesquisa na web do Open WebUI envia suas consultas ao mecanismo de busca configurado; um modelo cuja tag no Ollama termina em cloud é executado nos servidores do fornecedor, como kimi-k3:cloud na biblioteca do Ollama; e conectar um fornecedor externo junto com o Ollama, algo que o Open WebUI permite, envia suas mensagens a esse fornecedor. Para garantir a confidencialidade de fato, desative essas opções ou reserve-as para um perfil separado e verifique a lista de modelos instalados antes de processar documentos sensíveis.

FAQ
É possível realmente substituir o ChatGPT por uma IA local?+
Para a maioria dos usos comuns, sim: redação, resumo, tradução, código e perguntas sobre seus documentos funcionam bem com um modelo de 9 a 30 bilhões de parâmetros. As tarefas de raciocínio muito difíceis ainda são exclusivas dos maiores modelos na nuvem. Teste em seus próprios casos antes de cancelar uma assinatura.
Como recuperar minhas conversas com o ChatGPT?+
No ChatGPT, solicite a exportação em Configurações, Controle de Dados, Exportar Dados. Você receberá por e-mail um arquivo compactado contendo conversations.json. Importe esse arquivo no Open WebUI usando Importar Discussões: o formato é detectado automaticamente. Importe-o apenas uma vez, caso contrário você criará duplicatas.
Qual interface mais se parece com o ChatGPT?+
Open WebUI é a interface mais completa: histórico, arquivos anexados, busca na web, memória, modelos personalizados e importação direta dos dados exportados pelo ChatGPT. LM Studio e Jan são mais fáceis de instalar, sem Docker nem terminal, mas oferecem menos funcionalidades de trabalho em equipe e personalização.
Qual modelo pegar com 16 GB de memória?+
De acordo com o catálogo QuelLLM, Mistral Small 3.2 24B e gpt-oss 20B cabem em Q4 com pesos que ocupam cerca de 14 e 13 GB. Isso deixa pouca margem para o contexto: limite a janela ou escolha um modelo com entre 9 e 12 bilhões de parâmetros para uso com contexto longo.
E meus GPTs personalizados?+
Não é possível exportá-los tal como estão. Copie suas instruções e recrie cada um como um modelo personalizado no Open WebUI, vinculando a ele seus arquivos de conhecimento. Esse trabalho leva alguns minutos por assistente, e depois você pode escolher o modelo subjacente, o que o ChatGPT não permite.
É realmente gratuito?+
Os softwares mencionados são gratuitos e livres na maioria dos casos, e você não precisa de assinatura. Resta o custo do hardware, da eletricidade e do seu tempo de configuração. Se a sua máquina atual carrega apenas um modelo pequeno, o resultado será mais limitado que ChatGPT.

#Para se aprofundar

Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.