Iniciante 11 minOutras ferramentas

GPT4All: primeiros passos

Resposta direta

O GPT4All é um aplicativo de desktop gratuito (licença MIT, distribuído pela Nomic) que executa um modelo de linguagem no seu computador, sem exigir GPU nem conta. Você o instala, baixa um modelo GGUF e começa a conversar. Sua versão mais recente, a 3.10.0, é de fevereiro de 2025: ela funciona, mas seu catálogo é antigo e o LocalDocs continua limitado. É um bom ponto de partida em um computador modesto; caso contrário, compare com Jan ou LM Studio.

GPT4All (frequentemente digitado como "GPT for All") é um dos aplicativos de chat local mais antigos voltados ao público em geral. Este guia explica o que ele faz hoje, como instalá-lo e carregar um primeiro modelo, o que LocalDocs e o servidor local realmente oferecem e em quais casos é melhor escolher outra opção.

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux

#O que é o GPT4All e qual é seu estado em 2026

O GPT4All é desenvolvido pela Nomic AI. O repositório oficial o descreve como uma ferramenta que executa modelos de linguagem de forma privada em computadores de mesa e portáteis, sem chamadas de API e sem exigir GPU. O repositório conta com cerca de 77.000 estrelas e a licença é MIT. O aplicativo se baseia em llama.cpp e consegue carregar modelos no formato GGUF.

O estado do projeto é a primeira coisa que você precisa saber. A última versão publicada é a 3.10.0, de 25 de fevereiro de 2025, ou seja, mais de um ano e meio antes deste artigo. O site histórico gpt4all.io agora redireciona para uma página da Nomic voltada à sua plataforma para empresas. O aplicativo continua utilizável, e nada indica que deixe de funcionar, mas você não deve esperar novas funcionalidades nem um motor de inferência atualizado.

!
Consequência prática: a compatibilidade com modelos recentes não é garantida
O GPT4All usa um mecanismo llama.cpp congelado em sua versão mais recente. Os modelos publicados desde fevereiro de 2025 podem usar arquiteturas que esse mecanismo não conhece. A busca do Hugging Face no aplicativo mostrará modelos recentes sem garantir que eles sejam carregados: sempre teste um modelo antes de contar com ele e permaneça nas famílias comprovadas (Llama 3, Mistral, Phi-3) se quiser evitar surpresas.

#1. Instalação

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Os instaladores estão disponíveis na página do repositório oficial nomic-ai/gpt4all (Windows, Windows ARM, macOS, Ubuntu). Baixe-os apenas dessa fonte: a página que abre no endereço histórico gpt4all.io não é mais a do software. Os pré-requisitos indicados pelo repositório: para Windows e Linux, um processador Intel Core i3 de segunda geração, AMD Bulldozer ou melhor; a compilação Linux é apenas x86-64; para macOS, Monterey 12.6 ou versão mais recente, com melhores resultados nos chips Apple Silicon da série M.

Pré-requisitos de instalação por sistema
SistemaInstaladorPré-requisitos indicados pelo repositório
WindowsInstalador do Windows (e versão ARM)Intel Core i3 de 2ª geração, AMD Bulldozer ou superior; ARM: Snapdragon, SQ1, SQ2
macOSInstalador do macOSMonterey 12.6 ou mais recente; Apple Silicon recomendado
LinuxInstalador do UbuntuSomente processador x86-64, sem ARM

#2. Primeiro modelo

Na primeira inicialização, o aplicativo sugere um modelo padrão. A documentação recomenda começar pelo Llama 3, que você baixa pelo botão de adição de modelo. Ela esclarece que o GPT4All se conecta a modelos do Hugging Face com um mecanismo llama.cpp e que a maioria deles usa a extensão .gguf.

  1. 01
    Abrir Models
    No menu à esquerda, clique em Models e depois em + Add Model para acessar a página Explore Models.
  2. 02
    Pesquisar um modelo
    Pesquise entre os modelos disponíveis online ou classifique os resultados por popularidade, downloads ou data usando o ícone de engrenagem.
  3. 03
    Baixar
    Clique em Download. O arquivo é salvo no seu disco; não é necessário fazer cadastro.
  4. 04
    Carregar e conversar
    Acesse Chats, clique em Load Default Model (Llama 3 ou o modelo que você acabou de baixar) e faça sua primeira pergunta.

A tabela abaixo reproduz os exemplos da documentação oficial, com a memória RAM indicada pelo desenvolvedor. A coluna « Licença » é importante: o GPT4All lista modelos com condições muito diferentes, incluindo um sob licença não comercial.

Modelos de exemplo da documentação do GPT4All
ModeloArquivoRAM necessáriaTamanhoLicença
Llama 3 Instruct4,66 GB8 GB8 bilhões, q4_0Meta Llama 3 License
Nous Hermes 2 Mistral DPO4,11 GB8 GB7 bilhões, q4_0Apache 2.0
Phi-3 Mini Instruct2,18 GB4 GB4 bilhões, q4_0MIT
Mini Orca (Small)1,98 GB4 GB3 bilhões, q4_0CC-BY-NC-SA-4.0 (uso não comercial)

Onde ficam armazenados os modelos? A pasta de download pode ser definida nas configurações e, por padrão, fica em AppData\Local\nomic.ai\GPT4All no Windows, em Library/Application Support/nomic.ai/GPT4All no macOS e em .local/share/nomic.ai/GPT4All no Linux. Um modelo de 4 a 5 GB ocupa esse mesmo espaço no disco: se o seu disco do sistema for pequeno, redirecione essa pasta para um disco secundário antes de baixar vários modelos.

#GPT4All em francês

O aplicativo oferece um ajuste de idioma e de configurações regionais para a interface. Para as respostas, tudo depende do modelo: Llama 3 e os modelos derivados de Mistral compreendem e escrevem em francês, com qualidade variável. Não se baseie em um ranking em inglês: formule três perguntas na sua área, em francês, e avalie a resposta. Se o francês for o seu idioma principal de uso, os modelos Mistral e Qwen do catálogo QuelLLM são candidatos melhores, desde que possam ser carregados no motor de execução congelado.

#Muita RAM com um processador: o que isso muda

Uma máquina com 256 GB de memória RAM sem placa gráfica pode carregar modelos muito grandes, mas a velocidade de geração depende da largura de banda da memória, não da capacidade. Ordem de grandeza teórica: tokens por segundo limitados pela largura de banda em GB/s dividida pelo peso do modelo em GB. Como ilustração aritmética, 80 GB/s divididos por 40 GB de peso resultam em no máximo 2 tokens por segundo. Isso não é uma medição, apenas um teto.

A única configuração que pode ajudar é o número de threads do processador. Nas configurações avançadas, o GPT4All definiu esse número como 4 por padrão; a documentação indica que mais threads podem acelerar as respostas. Aumente-o gradualmente, mantendo alguns núcleos livres para o sistema. Se você tiver uma placa gráfica, o dispositivo pode ser configurado como Auto, Metal, CPU ou GPU.

#3. O chat e as configurações que importam

A interface é a de um aplicativo de mensagens: conversa no centro, mensagem na parte inferior e ajustes do modelo nas configurações. Três valores padrão merecem atenção. O tamanho do contexto é de 2.048 tokens, muito curto para um documento longo. A temperatura é de 0,7. E o número de camadas colocadas na memória de vídeo está definido em 32, a ajustar conforme a sua placa.

→
Aumente o tamanho do contexto antes de colar um texto longo
Com 2 048 tokens, uma página de texto basta para saturar a janela. Aumente o valor nas configurações do modelo, monitorando a memória: um contexto mais longo consome mais RAM e torna a geração mais lenta.

#4. LocalDocs: o RAG integrado, com suas limitações

O LocalDocs permite conversar com seus arquivos sem escrever uma linha de código. Você cria uma coleção apontando para uma pasta; o aplicativo divide seus arquivos em trechos e os indexa com os modelos de embeddings da Nomic, executados na sua máquina. Em um chat, você ativa a coleção, e o modelo recebe na instrução os trechos semanticamente próximos da sua pergunta, com a exibição das fontes abaixo da resposta.

  1. 01
    Criar a coleção
    Abra LocalDocs, dê um nome à coleção e escolha a pasta, depois clique em Create Collection.
  2. 02
    Aguardar a indexação
    O progresso é exibido; um indicador verde Ready sinaliza a conclusão. Você já pode fazer perguntas aos arquivos prontos.
  3. 03
    Ativá-lo em um chat
    Abra o LocalDocs com o botão no canto superior direito do chat e marque a coleção.
  4. 04
    Verificar as fontes
    Clique em Sources abaixo da resposta para ver quais arquivos foram utilizados.

#O que o LocalDocs não faz

Três limitações documentadas explicam as decepções. Primeiro, os tipos de arquivo indexados por padrão são .txt, .pdf, .md e .rst: um arquivo do Word precisa ser convertido antes. Depois, cada trecho tem 512 caracteres por padrão, e o aplicativo insere no máximo três por consulta: portanto, o modelo vê apenas cerca de 1.500 caracteres dos seus documentos a cada pergunta. Por fim, essa abordagem responde bem a uma pergunta específica (“o que diz a cláusula 4?”) e mal a uma síntese de todo um dossiê.

As configurações avançadas permitem aumentar o tamanho e a quantidade dos trechos, com a ressalva indicada na documentação: isso pode melhorar a confiabilidade das respostas, mas reduz a velocidade de geração e consome contexto, já limitado a 2.048 tokens por padrão. Se você precisa conversar com uma verdadeira base de documentos, uma ferramenta como AnythingLLM ou Open WebUI é mais adequada.

#5. O servidor local compatível com OpenAI

O GPT4All inclui um servidor de API compatível com a OpenAI, desativado por padrão. Para ativá-lo: Configurações, Aplicativo, seção Avançado, depois marque a caixa “Enable Local API Server”. Ele escuta na porta 4891, apenas no localhost (127.0.0.1), e aceita apenas HTTP, não HTTPS. A URL base é http://localhost:4891/v1.

Exemplo de chamada presente na documentação oficial
curl -X POST http://localhost:4891/v1/chat/completions -d '{
  "model": "Phi-3 Mini Instruct",
  "messages": [{"role":"user","content":"Who is Lionel Messi?"}],
  "max_tokens": 50,
  "temperature": 0.28
}'

Os endpoints disponíveis são /v1/models, /v1/models/nom-du-modèle, /v1/completions e /v1/chat/completions. O nome do modelo na requisição deve corresponder ao exibido no aplicativo. Uma dica documentada: o LocalDocs pode ser ativado para o chat do servidor pela interface (não pela API), e as referências utilizadas são retornadas na resposta, em choices[0].references.

#Privacidade: três configurações que você precisa conhecer

Por padrão, tudo permanece na sua máquina. Três opções mudam isso e é importante saber onde elas estão. A opção Datalake, que compartilha anonimamente suas interações com a comunidade GPT4All, está desativada por padrão. A opção « Use Nomic Embed API », que cria coleções LocalDocs fora do dispositivo usando a API do Nomic, está desativada por padrão e exige uma chave. Por fim, adicionar um « Model API » (uma chave de um fornecedor remoto) faz com que seus prompts sejam enviados para esse fornecedor, o que a documentação esclarece sem ambiguidade.

#Vantagens, limitações e alternativas

GPT4All ou uma alternativa dependendo da sua situação
Sua situaçãoO GPT4All é adequado?Alternativa a considerar
Máquina modesta, primeira tentativa, sem linha de comandoSim, esse é o caso de usoJan se você quiser um projeto mais ativo
Conversar com alguns arquivos de texto ou PDFSim, para perguntas específicasAnythingLLM para uma verdadeira base documental
Modelos muito recentes (2025 e posteriores)Não garantido, motor com desenvolvimento congeladoLM Studio ou Ollama, atualizados regularmente
Servidor compartilhado para uma equipeNão: apenas localhost, HTTPOllama e Open WebUI
Pontos fortes
Ciclo curto de « baixar e conversar », sem conta, LocalDocs sem código, servidor compatível com OpenAI, funciona sem GPU.
Pontos fracos
Motor sem alterações desde fevereiro de 2025, contexto padrão de 2.048 tokens, LocalDocs limitado a três trechos de 512 caracteres, catálogo envelhecendo.
Perguntas frequentes
O GPT4All é gratuito e funciona offline?+
Sim: o código está sob licença MIT e o aplicativo não exige conta nem assinatura. Após o download de um modelo, ele funciona sem conexão. Preste atenção apenas às opções que enviam dados: Datalake, a API de embeddings da Nomic e as conexões com fornecedores de modelos remotos, todas desativadas por padrão ou de adesão voluntária.
O GPT4All ainda é mantido em 2026?+
A última versão publicada, a 3.10.0, é de fevereiro de 2025, e o site histórico redireciona para uma plataforma empresarial da Nomic. O aplicativo funciona, mas sem nenhuma nova função anunciada. Para um uso duradouro com modelos recentes, prefira um aplicativo atualizado regularmente, como LM Studio ou Jan.
Quais modelos usar com o GPT4All?+
Comece com os citados na documentação: Llama 3 Instruct (4,66 GB, 8 GB de RAM), Nous Hermes 2 Mistral DPO ou Phi-3 Mini para uma máquina pequena. A compatibilidade com modelos GGUF recentes não é garantida, pois o motor não recebe mais atualizações. Verifique a licença: alguns modelos listados são restritos ao uso não comercial.
O GPT4All funciona em francês?+
A interface oferece uma configuração de idioma, e os modelos Llama 3 ou derivados de Mistral escrevem em francês com qualidade variável. Teste três perguntas da sua área antes de escolher um modelo. Se o francês for prioritário, compare com os modelos Mistral e Qwen de um catálogo atualizado.
Uma máquina com 256 GB de RAM faz alguma diferença?+
Ela permite carregar modelos muito grandes, mas, ao usar o processador, a velocidade depende da largura de banda da memória, não da capacidade. O limite teórico é essa largura de banda dividida pelo tamanho do modelo. Aumente o número de threads nas configurações avançadas, cujo valor padrão é 4, e teste com um modelo de tamanho médio.
Como consultar meus documentos com o GPT4All?+
Crie uma coleção LocalDocs apontando para uma pasta de arquivos .txt, .pdf, .md ou .rst, aguarde o indicador Ready e depois ative-a em um chat. O modelo recebe, no máximo, três trechos de 512 caracteres por pergunta: isso é adequado para perguntas precisas, não para a síntese de um conjunto completo de documentos.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.