Melhor IA local gratuita: top de 2026, mesmo sem GPU
Sim: Ollama, LM Studio, Jan e GPT4All podem ser baixados gratuitamente, e Qwen 3.5, Gemma 4, Granite 4.2 ou gpt-oss são publicados sob a licença Apache 2.0. A escolha certa depende da memória: um arquivo de 2 a 4 GB é adequado para uma máquina de 8 GB, arquivos de 6 a 8 GB exigem 16 GB, e acima de 14 GB são necessários 24 GB de VRAM ou 32 GB de memória.
Uma IA local gratuita se resume a dois downloads: um software (Ollama, LM Studio, Jan) e um modelo de linguagem com pesos abertos. O verdadeiro critério de escolha não é o nome do modelo, mas o tamanho do arquivo em comparação com sua memória. Esta página apresenta os tamanhos reais publicados pelo Ollama, um cálculo de velocidade para máquinas sem placa de vídeo e os casos em que uma IA dita “local” ainda assim envia seus dados para outros lugares.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
#Começar gratuitamente de acordo com sua máquina
Não existe uma única melhor IA local gratuita: a escolha certa é o maior modelo cujo arquivo cabe na sua memória com margem, executado pelo Ollama ou pelo LM Studio. Em uma máquina de 8 GB sem placa de vídeo, busque um arquivo de 2 a 4 GB, como Granite 4.2 3B (2,2 GB) ou Qwen 3.5 4B (3,4 GB). Com 16 GB, Qwen 3.5 9B (6,6 GB), Granite 4.2 8B (5,3 GB) ou Gemma 4 12B (7,6 GB) são pontos de partida razoáveis. A partir de 24 GB de VRAM ou 32 GB de memória, gpt-oss 20B (14 GB) e os modelos de 27 bilhões de parâmetros (18 GB) tornam-se acessíveis. Esses tamanhos são os dos arquivos anunciados pelo Ollama, não os bilhões de parâmetros indicados no nome: é o arquivo, mais o contexto e a margem do sistema, que precisa caber. São sugestões iniciais, não garantias de qualidade nem de velocidade: teste o modelo nas suas próprias tarefas.
| Memória da máquina | Modelos para experimentar (tag Ollama) | Tamanho do arquivo | Contexto anunciado |
|---|---|---|---|
| 8 GB, sem GPU | granite4.2:3b; qwen3.5:4b | 2,2 GB; 3,4 GB | 128 k; 256 k tokens |
| 16 GB | granite4.2:8b; qwen3.5:9b; gemma4:12b | 5,3 GB; 6,6 GB; 7,6 GB | 128 k; 256 k; 256 k tokens |
| 24 GB de VRAM ou 32 GB de memória | gpt-oss:20b; qwen3.6:27b; qwen3.8:27b; gemma4:26b | 14 GB; 18 GB; 18 GB; 19 GB | 128 k; 256 k; 256 k; 256 k tokens |
| 32 GB ou mais, para programar | qwen3-coder:30b | 19 GB | 256 k tokens |
O contexto anunciado é um máximo, não o que será alocado. Ollama começa com 4 k tokens quando a placa de vídeo tem menos de 24 GiB de VRAM e recomenda pelo menos 64 000 tokens para pesquisa na web, agentes e código. Cada aumento consome memória além do arquivo.
- Estimar a compatibilidade da minha máquina
- Fonte: tamanhos dos arquivos Qwen 3.5, biblioteca Ollama
- Fonte: contexto padrão conforme a VRAM, documentação Ollama
#O que é uma IA local?
Você sabe qual IA gratuita pode rodar no seu computador. O kit IA Local leva você até um assistente útil no dia a dia: instalação guiada em uma hora (cap. 1), o modelo certo para a configuração exata da sua máquina (cap. 3) e o que realmente funciona sem placa gráfica (cap. 12).
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Uma IA local é um modelo de linguagem (um LLM, como Qwen, Gemma ou Granite) cujos arquivos estão em seu disco e que é executado por um software instalado em sua máquina. O cálculo é feito no seu processador ou na sua placa de vídeo, não nos servidores de um fornecedor de software. O LM Studio informa isso em sua documentação: o que você digita ao conversar com um modelo não sai do dispositivo.
Os modelos em questão são chamados de modelos de pesos abertos: seus parâmetros podem ser baixados. Isso não é sinônimo de open source, que depende da licença. O Google reforça isso para Gemma: Gemma 4, lançado em 2 de abril de 2026, é o primeiro da família sob licença Apache 2.0, aprovada pela OSI; as gerações anteriores não estavam sob essa licença. Antes de reutilizar um modelo em um produto, leia sua licença.
O contrário é um serviço online como ChatGPT, Gemini ou Claude: suas mensagens são enviadas aos servidores do fornecedor. Entre os dois existem casos híbridos, detalhados abaixo.
#Por que migrar para a IA local?
- Privacidade
- Seus documentos e prompts permanecem na máquina enquanto você não ativar um modelo hospedado nem a pesquisa na web. Isso é útil para trabalhos sensíveis, para a área jurídica ou médica.
- Offline
- O modelo baixado responde sem conexão, em um trem ou em uma rede isolada.
- Sem cota de mensagens
- Nenhum plano limita suas conversas. A única restrição é a velocidade do seu hardware.
- Controle
- Você escolhe o modelo, sua quantização e o contexto, e o substitui quando um modelo melhor é lançado.
Há uma contrapartida real: um modelo local precisa caber na sua memória, então é menor que os modelos dos serviços online.
#IA local gratuita: realmente sem pagar?
Sim, para os softwares e modelos citados aqui: nenhuma assinatura é necessária para conversar com um modelo instalado na sua máquina. Três ressalvas evitam surpresas desagradáveis: as licenças dos softwares diferem (o LM Studio é gratuito, mas não é de código aberto), o custo passa a ser o armazenamento em disco e o hardware, e alguns fornecedores também vendem serviços online.
- O disco
- No Windows, o Ollama exige pelo menos 4 GB para a instalação, além de espaço para os modelos, que, segundo sua documentação, podem ocupar de várias dezenas a várias centenas de GB.
- O hardware
- Um arquivo de 14 GB não faz sentido com 8 GB de memória: comece com um teste pequeno antes de comprar.
- As ofertas hospedadas
- O plano gratuito do Ollama inclui a execução local, mas também modelos hospedados cobrados conforme o consumo, além de planos pagos de nível superior. Isso não é IA local.
#Melhores ferramentas gratuitas
| Ferramenta | Licença | Interface | Sistemas compatíveis |
|---|---|---|---|
| Ollama | MIT | Terminal, API local e aplicativo de desktop | Windows 10 22H2 ou mais recente; macOS 14 ou mais recente (Apple Silicon, ou Intel usando apenas a CPU); Linux |
| LM Studio | Proprietário, gratuito | Interface gráfica completa | macOS 14+ apenas em Apple Silicon; Windows x64 e ARM; Linux |
| Jan | Apache 2.0 | Aplicativo de desktop | Windows, macOS, Linux |
| GPT4All | MIT | Aplicativo de desktop | Windows, macOS 12.6+, Linux x86-64 |
- Ollama
- A escolha dos desenvolvedores: um modelo é iniciado com um único comando, com uma API local na porta 11434.
- LM Studio
- Catálogo de modelos, download com um clique e janela de conversa: a opção mais simples para começar. Gratuito em casa e no trabalho desde 8 de julho de 2025, mas proprietário: seus termos concedem uma licença de uso, não código aberto.
- Jan
- Baixa modelos do Hugging Face e inicia um servidor local. Seu repositório especifica que o aplicativo também pode se conectar à OpenAI, à Anthropic ou a outros provedores: cabe a você manter o uso local.
- GPT4All
- Seu repositório anuncia “no API calls or GPUs required”. Sua documentação contempla modelos de 3 a 13 bilhões de parâmetros e indica 8 GB de RAM para o Llama 3 8B. Nenhuma versão foi lançada desde a 3.10.0 de fevereiro de 2025: verifique se ele suporta o modelo desejado.
- Começar a usar LM Studio, passo a passo
- Instalar Ollama no Windows, macOS ou Linux
- Fonte: pré-requisitos oficiais de LM Studio
#Sem placa de vídeo: o que o processador oferece
Sim, um modelo pode rodar apenas no processador e na memória RAM. O Ollama confirma isso na sua FAQ: a coluna Processor de ollama ps exibe «100% CPU» quando o modelo é carregado totalmente na memória do sistema. A verdadeira questão, portanto, é a velocidade, não a viabilidade.
#Por que o processador é lento: um cálculo
Cada token gerado obriga a máquina a reler a maior parte do modelo a partir da memória: a velocidade é limitada pela rapidez de acesso aos dados, mais do que pela potência de cálculo. Um limite teórico é obtido dividindo a largura de banda da memória (GB/s) pelo tamanho do arquivo (GB). A tabela assume um valor de exemplo de 50 GB/s: é um cálculo ilustrativo, não uma medição.
| Modelo | Tamanho do arquivo | Limite teórica |
|---|---|---|
| granite4.2:3b | 2,2 GB | cerca de 23 tokens por segundo |
| granite4.2:8b | 5,3 GB | cerca de 9 tokens por segundo |
| qwen3.5:9b | 6,6 GB | aproximadamente 8 tokens por segundo |
O valor real continua abaixo. O blog TensorFoundry relata, em um Mac M2 Max com 400 GB/s, um limite calculado de aproximadamente 87 tokens por segundo para um modelo 8B em 4 bits, e 64,9 medidos, ou seja, 75%. Consequência prática: sem GPU, o tamanho do arquivo é o primeiro fator de velocidade, já que o limite depende diretamente disso. Modelos com especialistas (MoE) mudam a situação, pois ativam apenas uma parte de seus parâmetros por token: Qwen3-Coder 30B-A3B ativa 3,3 bilhões sobre 30. A ser testado, se a memória for suficiente para o arquivo inteiro.
#De acordo com o seu sistema
- Windows
- Ollama exige Windows 10 22H2 ou mais recente. LM Studio requer um processador AVX2 e recomenda 16 GB de RAM e 4 GB de VRAM.
- Mac Apple Silicon
- O processador e a GPU compartilham a memória unificada. LM Studio recomenda 16 GB ou mais; com 8 GB, recomenda modelos menores e contextos modestos.
- Mac Intel
- LM Studio não oferece suporte a ele. Ollama roda em x86, mas apenas com CPU: planeje usar modelos pequenos.
- Linux
- Ollama e LM Studio estão disponíveis; este último é distribuído como AppImage e requer Ubuntu 20.04 ou mais recente.
#Os melhores modelos gratuitos de 2026
Esta seleção parte do que Ollama publica e do que os editores documentam, não de um teste próprio.
- Qwen 3.5 (Alibaba)
- Família multimodal (texto e imagem) de 0,8 a 122 bilhões de parâmetros, contexto de 256 k tokens, licença Apache 2.0. A Alibaba anuncia 201 idiomas e dialetos. As versões 4B (3,4 GB) e 9B (6,6 GB) visam máquinas pequenas.
- Qwen 3.6 e 3.8 (Alibaba)
- Qwen 3.6 existe em 27B (18 GB) e 35B (23 GB), Qwen 3.8 em 27B (18 GB): duas famílias voltadas para código e agentes. O modo de reflexão do Qwen3.8 vem ativado por padrão e pode ser desativado por solicitação: ele adiciona tokens antes da resposta.
- Granite 4.2 (IBM)
- Versões 3B (2,2 GB), 8B (5,3 GB) e 30B, contexto de 128 mil tokens, licença Apache 2.0. O francês está entre os doze idiomas compatíveis: isso é um sinal, não uma medida de qualidade. Um modo de reflexão integrado pode ser desativado com o comando /set nothink em Ollama.
- Gemma 4 (Google)
- Tamanhos E2B, E4B, 12B, 26B (com especialistas, 3,8 bilhões de parâmetros ativos) e 31B, sob Apache 2.0 desde abril de 2026. O « E » significa « effective »: gemma4:e2b tem 2,3 bilhões de parâmetros efetivos, mas 5,1 com os embeddings, e seu arquivo pesa 7,2 GB no Ollama. Um nome com 2B não garante um arquivo pequeno.
- gpt-oss 20B (OpenAI)
- Modelo com pesos abertos sob licença Apache 2.0, quantizado em MXFP4 pela OpenAI: o Ollama indica que ele roda com 16 GB de memória (arquivo de 14 GB). Contexto de 128 k tokens.
- Qwen3-Coder 30B-A3B (Alibaba)
- Especialista em código: 30 bilhões de parâmetros no total, 3,3 ativados, contexto de 256 k tokens, arquivo de 19 GB.
#Ler um benchmark sem se enganar
As fichas dos modelos divulgam pontuações, mas são as de quem publica o modelo, obtidas com seu próprio protocolo. A ficha do Gemma 4 apresenta 69,4% no MMLU Pro para a versão E4B contra 85,2% para a 31B: o tamanho importa, e uma pontuação não diz nada sobre a sua tarefa. Outra armadilha de vocabulário: “LLM gratuito” também se refere a ofertas online com cota de uso, nas quais seus dados são enviados ao fornecedor.
#Escolher conforme o uso: chat, código, agentes
- Conversar, resumir, redigir em francês
- Granite 4.2 8B, Qwen 3.5 9B ou Gemma 4 12B em 16 GB. Compare-os usando três dos seus textos: nenhuma ficha substitui esse teste.
- Coder
- Qwen3-Coder 30B-A3B é apresentado pela Alibaba como seu modelo de código mais voltado para agentes. A limitação é a memória: as ferramentas de código exigem um contexto longo, que se soma ao arquivo de 19 GB e deixa pouca margem em 24 GB.
- Agentes e ferramentas
- Ollama pode iniciar agentes com um modelo local, por exemplo, Claude Code com um modelo Qwen. Isso executa a ferramenta Claude Code, não um modelo Claude: o modelo que responde continua sendo aquele que você baixou.
- Sem restrição
- Os modelos originais são treinados para recusar certas solicitações. Variantes comunitárias chamadas abliterated removem essa capacidade: uma publicação no Hugging Face explica que a recusa é representada por uma direção específica nas ativações, que pode ser neutralizada. A qualidade varia conforme a variante, e a lei se aplica aos seus usos.
#Instalar uma IA gratuita passo a passo
- 01Verificar a memória livreFeche o navegador e os aplicativos pesados: a memória disponível, e não a capacidade total, determina qual modelo usar.
- 02Instalar o softwareOllama se você se sente à vontade com um comando, LM Studio para uma interface gráfica. Escolha a versão do seu sistema: Windows, macOS ou Linux.
- 03Baixar um modelo do tamanho corretoConsulte a tabela da primeira seção: 8 GB de memória, um arquivo de 2 a 4 GB; 16 GB, um arquivo de 5 a 8 GB. Com 8 GB, um arquivo de 6,6 GB não deixa margem.
- 04Executar e depois verificarConverse, depois execute ollama ps em um segundo terminal para ver se o modelo está rodando na GPU, na CPU ou nas duas.
#O que pode sair da máquina apesar da palavra «local»
« Local » descreve onde o modelo é executado, não o que o restante do software faz. Quatro situações fazem os dados saírem ou serem expostos.
- Os modelos hospedados pela Ollama
- O aplicativo permite usar modelos executados na nuvem de Ollama, que então processa seus prompts e respostas; Ollama não vê nada do que você executa localmente. Para proibir isso: variável OLLAMA_NO_CLOUD=1 ou opção disable_ollama_cloud.
- Os conectores do Jan
- Jan pode se conectar à OpenAI, à Anthropic, à Mistral ou à Groq. Com um modelo baixado, a execução permanece local; com um conector, a conversa é enviada ao fornecedor escolhido.
- O download dos modelos
- LM Studio faz requisições de rede para procurar modelos, baixá-los e verificar atualizações. A conversa, seus documentos e o servidor local permanecem no dispositivo.
- A exposição na rede
- O Ollama escuta em 127.0.0.1 por padrão: somente o seu computador tem acesso a ele. A variável OLLAMA_HOST altera o endereço; abra o acesso somente se souber quem pode se conectar.
Qual é a melhor IA local gratuita para começar?+
É possível ter uma IA local gratuita sem GPU?+
LM Studio e Ollama são realmente gratuitos?+
Minha IA local envia dados para a Internet?+
É possível executar Claude ou ChatGPT localmente?+
Existe uma IA local sem restrições?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.