GPT4All: primeiros passos
O GPT4All é um aplicativo de desktop gratuito (licença MIT, distribuído pela Nomic) que executa um modelo de linguagem no seu computador, sem exigir GPU nem conta. Você o instala, baixa um modelo GGUF e começa a conversar. Sua versão mais recente, a 3.10.0, é de fevereiro de 2025: ela funciona, mas seu catálogo é antigo e o LocalDocs continua limitado. É um bom ponto de partida em um computador modesto; caso contrário, compare com Jan ou LM Studio.
GPT4All (frequentemente digitado como "GPT for All") é um dos aplicativos de chat local mais antigos voltados ao público em geral. Este guia explica o que ele faz hoje, como instalá-lo e carregar um primeiro modelo, o que LocalDocs e o servidor local realmente oferecem e em quais casos é melhor escolher outra opção.
#O que é o GPT4All e qual é seu estado em 2026
O GPT4All é desenvolvido pela Nomic AI. O repositório oficial o descreve como uma ferramenta que executa modelos de linguagem de forma privada em computadores de mesa e portáteis, sem chamadas de API e sem exigir GPU. O repositório conta com cerca de 77.000 estrelas e a licença é MIT. O aplicativo se baseia em llama.cpp e consegue carregar modelos no formato GGUF.
O estado do projeto é a primeira coisa que você precisa saber. A última versão publicada é a 3.10.0, de 25 de fevereiro de 2025, ou seja, mais de um ano e meio antes deste artigo. O site histórico gpt4all.io agora redireciona para uma página da Nomic voltada à sua plataforma para empresas. O aplicativo continua utilizável, e nada indica que deixe de funcionar, mas você não deve esperar novas funcionalidades nem um motor de inferência atualizado.
#1. Instalação
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Os instaladores estão disponíveis na página do repositório oficial nomic-ai/gpt4all (Windows, Windows ARM, macOS, Ubuntu). Baixe-os apenas dessa fonte: a página que abre no endereço histórico gpt4all.io não é mais a do software. Os pré-requisitos indicados pelo repositório: para Windows e Linux, um processador Intel Core i3 de segunda geração, AMD Bulldozer ou melhor; a compilação Linux é apenas x86-64; para macOS, Monterey 12.6 ou versão mais recente, com melhores resultados nos chips Apple Silicon da série M.
| Sistema | Instalador | Pré-requisitos indicados pelo repositório |
|---|---|---|
| Windows | Instalador do Windows (e versão ARM) | Intel Core i3 de 2ª geração, AMD Bulldozer ou superior; ARM: Snapdragon, SQ1, SQ2 |
| macOS | Instalador do macOS | Monterey 12.6 ou mais recente; Apple Silicon recomendado |
| Linux | Instalador do Ubuntu | Somente processador x86-64, sem ARM |
#2. Primeiro modelo
Na primeira inicialização, o aplicativo sugere um modelo padrão. A documentação recomenda começar pelo Llama 3, que você baixa pelo botão de adição de modelo. Ela esclarece que o GPT4All se conecta a modelos do Hugging Face com um mecanismo llama.cpp e que a maioria deles usa a extensão .gguf.
- 01Abrir ModelsNo menu à esquerda, clique em Models e depois em + Add Model para acessar a página Explore Models.
- 02Pesquisar um modeloPesquise entre os modelos disponíveis online ou classifique os resultados por popularidade, downloads ou data usando o ícone de engrenagem.
- 03BaixarClique em Download. O arquivo é salvo no seu disco; não é necessário fazer cadastro.
- 04Carregar e conversarAcesse Chats, clique em Load Default Model (Llama 3 ou o modelo que você acabou de baixar) e faça sua primeira pergunta.
A tabela abaixo reproduz os exemplos da documentação oficial, com a memória RAM indicada pelo desenvolvedor. A coluna « Licença » é importante: o GPT4All lista modelos com condições muito diferentes, incluindo um sob licença não comercial.
| Modelo | Arquivo | RAM necessária | Tamanho | Licença |
|---|---|---|---|---|
| Llama 3 Instruct | 4,66 GB | 8 GB | 8 bilhões, q4_0 | Meta Llama 3 License |
| Nous Hermes 2 Mistral DPO | 4,11 GB | 8 GB | 7 bilhões, q4_0 | Apache 2.0 |
| Phi-3 Mini Instruct | 2,18 GB | 4 GB | 4 bilhões, q4_0 | MIT |
| Mini Orca (Small) | 1,98 GB | 4 GB | 3 bilhões, q4_0 | CC-BY-NC-SA-4.0 (uso não comercial) |
Onde ficam armazenados os modelos? A pasta de download pode ser definida nas configurações e, por padrão, fica em AppData\Local\nomic.ai\GPT4All no Windows, em Library/Application Support/nomic.ai/GPT4All no macOS e em .local/share/nomic.ai/GPT4All no Linux. Um modelo de 4 a 5 GB ocupa esse mesmo espaço no disco: se o seu disco do sistema for pequeno, redirecione essa pasta para um disco secundário antes de baixar vários modelos.
#GPT4All em francês
O aplicativo oferece um ajuste de idioma e de configurações regionais para a interface. Para as respostas, tudo depende do modelo: Llama 3 e os modelos derivados de Mistral compreendem e escrevem em francês, com qualidade variável. Não se baseie em um ranking em inglês: formule três perguntas na sua área, em francês, e avalie a resposta. Se o francês for o seu idioma principal de uso, os modelos Mistral e Qwen do catálogo QuelLLM são candidatos melhores, desde que possam ser carregados no motor de execução congelado.
#Muita RAM com um processador: o que isso muda
Uma máquina com 256 GB de memória RAM sem placa gráfica pode carregar modelos muito grandes, mas a velocidade de geração depende da largura de banda da memória, não da capacidade. Ordem de grandeza teórica: tokens por segundo limitados pela largura de banda em GB/s dividida pelo peso do modelo em GB. Como ilustração aritmética, 80 GB/s divididos por 40 GB de peso resultam em no máximo 2 tokens por segundo. Isso não é uma medição, apenas um teto.
A única configuração que pode ajudar é o número de threads do processador. Nas configurações avançadas, o GPT4All definiu esse número como 4 por padrão; a documentação indica que mais threads podem acelerar as respostas. Aumente-o gradualmente, mantendo alguns núcleos livres para o sistema. Se você tiver uma placa gráfica, o dispositivo pode ser configurado como Auto, Metal, CPU ou GPU.
#3. O chat e as configurações que importam
A interface é a de um aplicativo de mensagens: conversa no centro, mensagem na parte inferior e ajustes do modelo nas configurações. Três valores padrão merecem atenção. O tamanho do contexto é de 2.048 tokens, muito curto para um documento longo. A temperatura é de 0,7. E o número de camadas colocadas na memória de vídeo está definido em 32, a ajustar conforme a sua placa.
#4. LocalDocs: o RAG integrado, com suas limitações
O LocalDocs permite conversar com seus arquivos sem escrever uma linha de código. Você cria uma coleção apontando para uma pasta; o aplicativo divide seus arquivos em trechos e os indexa com os modelos de embeddings da Nomic, executados na sua máquina. Em um chat, você ativa a coleção, e o modelo recebe na instrução os trechos semanticamente próximos da sua pergunta, com a exibição das fontes abaixo da resposta.
- 01Criar a coleçãoAbra LocalDocs, dê um nome à coleção e escolha a pasta, depois clique em Create Collection.
- 02Aguardar a indexaçãoO progresso é exibido; um indicador verde Ready sinaliza a conclusão. Você já pode fazer perguntas aos arquivos prontos.
- 03Ativá-lo em um chatAbra o LocalDocs com o botão no canto superior direito do chat e marque a coleção.
- 04Verificar as fontesClique em Sources abaixo da resposta para ver quais arquivos foram utilizados.
#O que o LocalDocs não faz
Três limitações documentadas explicam as decepções. Primeiro, os tipos de arquivo indexados por padrão são .txt, .pdf, .md e .rst: um arquivo do Word precisa ser convertido antes. Depois, cada trecho tem 512 caracteres por padrão, e o aplicativo insere no máximo três por consulta: portanto, o modelo vê apenas cerca de 1.500 caracteres dos seus documentos a cada pergunta. Por fim, essa abordagem responde bem a uma pergunta específica (“o que diz a cláusula 4?”) e mal a uma síntese de todo um dossiê.
As configurações avançadas permitem aumentar o tamanho e a quantidade dos trechos, com a ressalva indicada na documentação: isso pode melhorar a confiabilidade das respostas, mas reduz a velocidade de geração e consome contexto, já limitado a 2.048 tokens por padrão. Se você precisa conversar com uma verdadeira base de documentos, uma ferramenta como AnythingLLM ou Open WebUI é mais adequada.
#5. O servidor local compatível com OpenAI
O GPT4All inclui um servidor de API compatível com a OpenAI, desativado por padrão. Para ativá-lo: Configurações, Aplicativo, seção Avançado, depois marque a caixa “Enable Local API Server”. Ele escuta na porta 4891, apenas no localhost (127.0.0.1), e aceita apenas HTTP, não HTTPS. A URL base é http://localhost:4891/v1.
Os endpoints disponíveis são /v1/models, /v1/models/nom-du-modèle, /v1/completions e /v1/chat/completions. O nome do modelo na requisição deve corresponder ao exibido no aplicativo. Uma dica documentada: o LocalDocs pode ser ativado para o chat do servidor pela interface (não pela API), e as referências utilizadas são retornadas na resposta, em choices[0].references.
#Privacidade: três configurações que você precisa conhecer
Por padrão, tudo permanece na sua máquina. Três opções mudam isso e é importante saber onde elas estão. A opção Datalake, que compartilha anonimamente suas interações com a comunidade GPT4All, está desativada por padrão. A opção « Use Nomic Embed API », que cria coleções LocalDocs fora do dispositivo usando a API do Nomic, está desativada por padrão e exige uma chave. Por fim, adicionar um « Model API » (uma chave de um fornecedor remoto) faz com que seus prompts sejam enviados para esse fornecedor, o que a documentação esclarece sem ambiguidade.
#Vantagens, limitações e alternativas
| Sua situação | O GPT4All é adequado? | Alternativa a considerar |
|---|---|---|
| Máquina modesta, primeira tentativa, sem linha de comando | Sim, esse é o caso de uso | Jan se você quiser um projeto mais ativo |
| Conversar com alguns arquivos de texto ou PDF | Sim, para perguntas específicas | AnythingLLM para uma verdadeira base documental |
| Modelos muito recentes (2025 e posteriores) | Não garantido, motor com desenvolvimento congelado | LM Studio ou Ollama, atualizados regularmente |
| Servidor compartilhado para uma equipe | Não: apenas localhost, HTTP | Ollama e Open WebUI |
- Pontos fortes
- Ciclo curto de « baixar e conversar », sem conta, LocalDocs sem código, servidor compatível com OpenAI, funciona sem GPU.
- Pontos fracos
- Motor sem alterações desde fevereiro de 2025, contexto padrão de 2.048 tokens, LocalDocs limitado a três trechos de 512 caracteres, catálogo envelhecendo.
- Ollama vs LM Studio vs Jan vs GPT4All
- Jan: a alternativa open source ao ChatGPT
- Começar com o LM Studio
- AnythingLLM: RAG local pronto para produção
- Open WebUI com Ollama: guia completo
- Fonte: repositório do GPT4All
- Fonte: documentação do GPT4All, modelos
- Fonte: documentação do GPT4All, configurações
O GPT4All é gratuito e funciona offline?+
O GPT4All ainda é mantido em 2026?+
Quais modelos usar com o GPT4All?+
O GPT4All funciona em francês?+
Uma máquina com 256 GB de RAM faz alguma diferença?+
Como consultar meus documentos com o GPT4All?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.