Iniciante 14 minGrátis

Melhor IA local gratuita: top de 2026, mesmo sem GPU

Resposta direta

Sim: Ollama, LM Studio, Jan e GPT4All podem ser baixados gratuitamente, e Qwen 3.5, Gemma 4, Granite 4.2 ou gpt-oss são publicados sob a licença Apache 2.0. A escolha certa depende da memória: um arquivo de 2 a 4 GB é adequado para uma máquina de 8 GB, arquivos de 6 a 8 GB exigem 16 GB, e acima de 14 GB são necessários 24 GB de VRAM ou 32 GB de memória.

Uma IA local gratuita se resume a dois downloads: um software (Ollama, LM Studio, Jan) e um modelo de linguagem com pesos abertos. O verdadeiro critério de escolha não é o nome do modelo, mas o tamanho do arquivo em comparação com sua memória. Esta página apresenta os tamanhos reais publicados pelo Ollama, um cálculo de velocidade para máquinas sem placa de vídeo e os casos em que uma IA dita “local” ainda assim envia seus dados para outros lugares.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-29·Testado no Windows, macOS e Linux

#Começar gratuitamente de acordo com sua máquina

Não existe uma única melhor IA local gratuita: a escolha certa é o maior modelo cujo arquivo cabe na sua memória com margem, executado pelo Ollama ou pelo LM Studio. Em uma máquina de 8 GB sem placa de vídeo, busque um arquivo de 2 a 4 GB, como Granite 4.2 3B (2,2 GB) ou Qwen 3.5 4B (3,4 GB). Com 16 GB, Qwen 3.5 9B (6,6 GB), Granite 4.2 8B (5,3 GB) ou Gemma 4 12B (7,6 GB) são pontos de partida razoáveis. A partir de 24 GB de VRAM ou 32 GB de memória, gpt-oss 20B (14 GB) e os modelos de 27 bilhões de parâmetros (18 GB) tornam-se acessíveis. Esses tamanhos são os dos arquivos anunciados pelo Ollama, não os bilhões de parâmetros indicados no nome: é o arquivo, mais o contexto e a margem do sistema, que precisa caber. São sugestões iniciais, não garantias de qualidade nem de velocidade: teste o modelo nas suas próprias tarefas.

Modelos para experimentar de acordo com a memória (tamanhos de arquivo publicados por Ollama, última consulta em 29 de setembro de 2026)
Memória da máquinaModelos para experimentar (tag Ollama)Tamanho do arquivoContexto anunciado
8 GB, sem GPUgranite4.2:3b; qwen3.5:4b2,2 GB; 3,4 GB128 k; 256 k tokens
16 GBgranite4.2:8b; qwen3.5:9b; gemma4:12b5,3 GB; 6,6 GB; 7,6 GB128 k; 256 k; 256 k tokens
24 GB de VRAM ou 32 GB de memóriagpt-oss:20b; qwen3.6:27b; qwen3.8:27b; gemma4:26b14 GB; 18 GB; 18 GB; 19 GB128 k; 256 k; 256 k; 256 k tokens
32 GB ou mais, para programarqwen3-coder:30b19 GB256 k tokens

O contexto anunciado é um máximo, não o que será alocado. Ollama começa com 4 k tokens quando a placa de vídeo tem menos de 24 GiB de VRAM e recomenda pelo menos 64 000 tokens para pesquisa na web, agentes e código. Cada aumento consome memória além do arquivo.

#O que é uma IA local?

O kit IA Local

Você sabe qual IA gratuita pode rodar no seu computador. O kit IA Local leva você até um assistente útil no dia a dia: instalação guiada em uma hora (cap. 1), o modelo certo para a configuração exata da sua máquina (cap. 3) e o que realmente funciona sem placa gráfica (cap. 12).

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Uma IA local é um modelo de linguagem (um LLM, como Qwen, Gemma ou Granite) cujos arquivos estão em seu disco e que é executado por um software instalado em sua máquina. O cálculo é feito no seu processador ou na sua placa de vídeo, não nos servidores de um fornecedor de software. O LM Studio informa isso em sua documentação: o que você digita ao conversar com um modelo não sai do dispositivo.

Os modelos em questão são chamados de modelos de pesos abertos: seus parâmetros podem ser baixados. Isso não é sinônimo de open source, que depende da licença. O Google reforça isso para Gemma: Gemma 4, lançado em 2 de abril de 2026, é o primeiro da família sob licença Apache 2.0, aprovada pela OSI; as gerações anteriores não estavam sob essa licença. Antes de reutilizar um modelo em um produto, leia sua licença.

i
Em resumo
IA local = um modelo baixado no seu computador + um software que o executa. Depois que o modelo está no disco, a conversa não exige conexão.

O contrário é um serviço online como ChatGPT, Gemini ou Claude: suas mensagens são enviadas aos servidores do fornecedor. Entre os dois existem casos híbridos, detalhados abaixo.

#Por que migrar para a IA local?

Privacidade
Seus documentos e prompts permanecem na máquina enquanto você não ativar um modelo hospedado nem a pesquisa na web. Isso é útil para trabalhos sensíveis, para a área jurídica ou médica.
Offline
O modelo baixado responde sem conexão, em um trem ou em uma rede isolada.
Sem cota de mensagens
Nenhum plano limita suas conversas. A única restrição é a velocidade do seu hardware.
Controle
Você escolhe o modelo, sua quantização e o contexto, e o substitui quando um modelo melhor é lançado.

Há uma contrapartida real: um modelo local precisa caber na sua memória, então é menor que os modelos dos serviços online.

#IA local gratuita: realmente sem pagar?

Sim, para os softwares e modelos citados aqui: nenhuma assinatura é necessária para conversar com um modelo instalado na sua máquina. Três ressalvas evitam surpresas desagradáveis: as licenças dos softwares diferem (o LM Studio é gratuito, mas não é de código aberto), o custo passa a ser o armazenamento em disco e o hardware, e alguns fornecedores também vendem serviços online.

O disco
No Windows, o Ollama exige pelo menos 4 GB para a instalação, além de espaço para os modelos, que, segundo sua documentação, podem ocupar de várias dezenas a várias centenas de GB.
O hardware
Um arquivo de 14 GB não faz sentido com 8 GB de memória: comece com um teste pequeno antes de comprar.
As ofertas hospedadas
O plano gratuito do Ollama inclui a execução local, mas também modelos hospedados cobrados conforme o consumo, além de planos pagos de nível superior. Isso não é IA local.
i
O que «gratuito» significa aqui
Softwares sem assinatura, modelos sem taxas de licença, nenhuma cota de mensagens. O disco, a eletricidade e a memória ficam por sua conta.

#Melhores ferramentas gratuitas

Quatro ferramentas gratuitas comparadas (fontes: repositórios e documentações oficiais)
FerramentaLicençaInterfaceSistemas compatíveis
OllamaMITTerminal, API local e aplicativo de desktopWindows 10 22H2 ou mais recente; macOS 14 ou mais recente (Apple Silicon, ou Intel usando apenas a CPU); Linux
LM StudioProprietário, gratuitoInterface gráfica completamacOS 14+ apenas em Apple Silicon; Windows x64 e ARM; Linux
JanApache 2.0Aplicativo de desktopWindows, macOS, Linux
GPT4AllMITAplicativo de desktopWindows, macOS 12.6+, Linux x86-64
Ollama
A escolha dos desenvolvedores: um modelo é iniciado com um único comando, com uma API local na porta 11434.
LM Studio
Catálogo de modelos, download com um clique e janela de conversa: a opção mais simples para começar. Gratuito em casa e no trabalho desde 8 de julho de 2025, mas proprietário: seus termos concedem uma licença de uso, não código aberto.
Jan
Baixa modelos do Hugging Face e inicia um servidor local. Seu repositório especifica que o aplicativo também pode se conectar à OpenAI, à Anthropic ou a outros provedores: cabe a você manter o uso local.
GPT4All
Seu repositório anuncia “no API calls or GPUs required”. Sua documentação contempla modelos de 3 a 13 bilhões de parâmetros e indica 8 GB de RAM para o Llama 3 8B. Nenhuma versão foi lançada desde a 3.10.0 de fevereiro de 2025: verifique se ele suporta o modelo desejado.

#Sem placa de vídeo: o que o processador oferece

Sim, um modelo pode rodar apenas no processador e na memória RAM. O Ollama confirma isso na sua FAQ: a coluna Processor de ollama ps exibe «100% CPU» quando o modelo é carregado totalmente na memória do sistema. A verdadeira questão, portanto, é a velocidade, não a viabilidade.

#Por que o processador é lento: um cálculo

Cada token gerado obriga a máquina a reler a maior parte do modelo a partir da memória: a velocidade é limitada pela rapidez de acesso aos dados, mais do que pela potência de cálculo. Um limite teórico é obtido dividindo a largura de banda da memória (GB/s) pelo tamanho do arquivo (GB). A tabela assume um valor de exemplo de 50 GB/s: é um cálculo ilustrativo, não uma medição.

Teto teórico de geração para uma memória a 50 GB/s (exemplo de cálculo, não uma medição)
ModeloTamanho do arquivoLimite teórica
granite4.2:3b2,2 GBcerca de 23 tokens por segundo
granite4.2:8b5,3 GBcerca de 9 tokens por segundo
qwen3.5:9b6,6 GBaproximadamente 8 tokens por segundo

O valor real continua abaixo. O blog TensorFoundry relata, em um Mac M2 Max com 400 GB/s, um limite calculado de aproximadamente 87 tokens por segundo para um modelo 8B em 4 bits, e 64,9 medidos, ou seja, 75%. Consequência prática: sem GPU, o tamanho do arquivo é o primeiro fator de velocidade, já que o limite depende diretamente disso. Modelos com especialistas (MoE) mudam a situação, pois ativam apenas uma parte de seus parâmetros por token: Qwen3-Coder 30B-A3B ativa 3,3 bilhões sobre 30. A ser testado, se a memória for suficiente para o arquivo inteiro.

#De acordo com o seu sistema

Windows
Ollama exige Windows 10 22H2 ou mais recente. LM Studio requer um processador AVX2 e recomenda 16 GB de RAM e 4 GB de VRAM.
Mac Apple Silicon
O processador e a GPU compartilham a memória unificada. LM Studio recomenda 16 GB ou mais; com 8 GB, recomenda modelos menores e contextos modestos.
Mac Intel
LM Studio não oferece suporte a ele. Ollama roda em x86, mas apenas com CPU: planeje usar modelos pequenos.
Linux
Ollama e LM Studio estão disponíveis; este último é distribuído como AppImage e requer Ubuntu 20.04 ou mais recente.

#Os melhores modelos gratuitos de 2026

Esta seleção parte do que Ollama publica e do que os editores documentam, não de um teste próprio.

Qwen 3.5 (Alibaba)
Família multimodal (texto e imagem) de 0,8 a 122 bilhões de parâmetros, contexto de 256 k tokens, licença Apache 2.0. A Alibaba anuncia 201 idiomas e dialetos. As versões 4B (3,4 GB) e 9B (6,6 GB) visam máquinas pequenas.
Qwen 3.6 e 3.8 (Alibaba)
Qwen 3.6 existe em 27B (18 GB) e 35B (23 GB), Qwen 3.8 em 27B (18 GB): duas famílias voltadas para código e agentes. O modo de reflexão do Qwen3.8 vem ativado por padrão e pode ser desativado por solicitação: ele adiciona tokens antes da resposta.
Granite 4.2 (IBM)
Versões 3B (2,2 GB), 8B (5,3 GB) e 30B, contexto de 128 mil tokens, licença Apache 2.0. O francês está entre os doze idiomas compatíveis: isso é um sinal, não uma medida de qualidade. Um modo de reflexão integrado pode ser desativado com o comando /set nothink em Ollama.
Gemma 4 (Google)
Tamanhos E2B, E4B, 12B, 26B (com especialistas, 3,8 bilhões de parâmetros ativos) e 31B, sob Apache 2.0 desde abril de 2026. O « E » significa « effective »: gemma4:e2b tem 2,3 bilhões de parâmetros efetivos, mas 5,1 com os embeddings, e seu arquivo pesa 7,2 GB no Ollama. Um nome com 2B não garante um arquivo pequeno.
gpt-oss 20B (OpenAI)
Modelo com pesos abertos sob licença Apache 2.0, quantizado em MXFP4 pela OpenAI: o Ollama indica que ele roda com 16 GB de memória (arquivo de 14 GB). Contexto de 128 k tokens.
Qwen3-Coder 30B-A3B (Alibaba)
Especialista em código: 30 bilhões de parâmetros no total, 3,3 ativados, contexto de 256 k tokens, arquivo de 19 GB.

#Ler um benchmark sem se enganar

As fichas dos modelos divulgam pontuações, mas são as de quem publica o modelo, obtidas com seu próprio protocolo. A ficha do Gemma 4 apresenta 69,4% no MMLU Pro para a versão E4B contra 85,2% para a 31B: o tamanho importa, e uma pontuação não diz nada sobre a sua tarefa. Outra armadilha de vocabulário: “LLM gratuito” também se refere a ofertas online com cota de uso, nas quais seus dados são enviados ao fornecedor.

#Escolher conforme o uso: chat, código, agentes

Conversar, resumir, redigir em francês
Granite 4.2 8B, Qwen 3.5 9B ou Gemma 4 12B em 16 GB. Compare-os usando três dos seus textos: nenhuma ficha substitui esse teste.
Coder
Qwen3-Coder 30B-A3B é apresentado pela Alibaba como seu modelo de código mais voltado para agentes. A limitação é a memória: as ferramentas de código exigem um contexto longo, que se soma ao arquivo de 19 GB e deixa pouca margem em 24 GB.
Agentes e ferramentas
Ollama pode iniciar agentes com um modelo local, por exemplo, Claude Code com um modelo Qwen. Isso executa a ferramenta Claude Code, não um modelo Claude: o modelo que responde continua sendo aquele que você baixou.
Sem restrição
Os modelos originais são treinados para recusar certas solicitações. Variantes comunitárias chamadas abliterated removem essa capacidade: uma publicação no Hugging Face explica que a recusa é representada por uma direção específica nas ativações, que pode ser neutralizada. A qualidade varia conforme a variante, e a lei se aplica aos seus usos.

#Instalar uma IA gratuita passo a passo

  1. 01
    Verificar a memória livre
    Feche o navegador e os aplicativos pesados: a memória disponível, e não a capacidade total, determina qual modelo usar.
  2. 02
    Instalar o software
    Ollama se você se sente à vontade com um comando, LM Studio para uma interface gráfica. Escolha a versão do seu sistema: Windows, macOS ou Linux.
  3. 03
    Baixar um modelo do tamanho correto
    Consulte a tabela da primeira seção: 8 GB de memória, um arquivo de 2 a 4 GB; 16 GB, um arquivo de 5 a 8 GB. Com 8 GB, um arquivo de 6,6 GB não deixa margem.
  4. 04
    Executar e depois verificar
    Converse, depois execute ollama ps em um segundo terminal para ver se o modelo está rodando na GPU, na CPU ou nas duas.
Exemplos: um modelo leve e depois um modelo de 16 GB
# Machine de 8 Go
ollama run qwen3.5:4b

# Machine de 16 Go
ollama run qwen3.5:9b

# Vérifier le placement CPU ou GPU et le contexte alloué
ollama ps
Agentes e código: aumentar o contexto (consome mais memória)
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#O que pode sair da máquina apesar da palavra «local»

« Local » descreve onde o modelo é executado, não o que o restante do software faz. Quatro situações fazem os dados saírem ou serem expostos.

Os modelos hospedados pela Ollama
O aplicativo permite usar modelos executados na nuvem de Ollama, que então processa seus prompts e respostas; Ollama não vê nada do que você executa localmente. Para proibir isso: variável OLLAMA_NO_CLOUD=1 ou opção disable_ollama_cloud.
Os conectores do Jan
Jan pode se conectar à OpenAI, à Anthropic, à Mistral ou à Groq. Com um modelo baixado, a execução permanece local; com um conector, a conversa é enviada ao fornecedor escolhido.
O download dos modelos
LM Studio faz requisições de rede para procurar modelos, baixá-los e verificar atualizações. A conversa, seus documentos e o servidor local permanecem no dispositivo.
A exposição na rede
O Ollama escuta em 127.0.0.1 por padrão: somente o seu computador tem acesso a ele. A variável OLLAMA_HOST altera o endereço; abra o acesso somente se souber quem pode se conectar.
!
Identificar um modelo hospedado
No Ollama, uma tag que termina com cloud, como gemma4:31b-cloud, não é executada localmente. Se a confidencialidade é o seu motivo para usar IA localmente, desative essas funcionalidades na configuração.
Perguntas frequentes
Qual é a melhor IA local gratuita para começar?+
Ollama ou LM Studio com um modelo cujo arquivo caiba com folga na sua memória: Qwen 3.5 4B (3,4 GB) em 8 GB, Qwen 3.5 9B (6,6 GB) ou Granite 4.2 8B (5,3 GB) em 16 GB. Compare dois modelos nos seus próprios textos.
É possível ter uma IA local gratuita sem GPU?+
Sim. Um modelo roda no processador e na RAM, e Ollama exibe então 100 % de uso da CPU. O limite é a velocidade, que depende da largura de banda da memória dividida pelo tamanho do arquivo. Escolha um modelo de 2 a 4 GB e mantenha um contexto curto.
LM Studio e Ollama são realmente gratuitos?+
Para uso local, sim. O LM Studio é gratuito em casa e no trabalho desde 8 de julho de 2025, mas não é open source. O Ollama está sob licença MIT; seus modelos hospedados são cobrados conforme o consumo, com planos pagos, e ficam fora do escopo do uso local gratuito.
Minha IA local envia dados para a Internet?+
Não quando a conversa é feita com um modelo carregado em sua máquina: o LM Studio indica que o que você digita não sai do aparelho. No entanto, dados são enviados para fora com um modelo hospedado, um conector online ou uma tag cloud. Desative essas opções se quiser um uso estritamente local.
É possível executar Claude ou ChatGPT localmente?+
A ferramenta Claude Code pode ser iniciada com um modelo local, por exemplo Qwen, via Ollama, mas o modelo que responde é então aquele que você baixou. A OpenAI publica o gpt-oss, com pesos abertos sob a licença Apache 2.0: é o caminho mais próximo de ChatGPT localmente.
Existe uma IA local sem restrições?+
Variantes comunitárias chamadas abliterated removem a capacidade de recusa de um modelo e estão disponíveis no Hugging Face. A qualidade delas varia de uma variante para outra, e o que você faz com elas continua sujeito à lei. O guia dedicado detalha o que elas mudam e as precauções a tomar.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.