Instalar um LLM localmente: guia passo a passo (2026)
Instalar um LLM localmente exige três coisas: uma máquina com RAM ou VRAM suficiente para o tamanho do modelo desejado, uma ferramenta para executá-lo — LM Studio sem terminal, Ollama pela linha de comando ou llama.cpp para especialistas — e um primeiro modelo quantizado adequado a esse hardware. Reserve de 10 a 15 minutos para ter um primeiro chat local funcional em uma máquina recente; depois de baixar o modelo, não será mais necessária uma conexão com a internet.
Você quer rodar uma IA diretamente no seu PC ou no seu Mac, mas todos os nomes de ferramentas e modelos se parecem e você não sabe por onde começar? Este guia é a visão geral que falta antes de escolher: verificar se sua máquina dá conta, comparar as três formas de instalação, identificar seu primeiro modelo e evitar erros que prejudiquem a primeira tentativa. Cada etapa aponta para um guia específico mais detalhado, se você quiser se aprofundar em um ponto específico.
#Verificar sua máquina: RAM, VRAM e tamanho do modelo
Antes de escolher uma ferramenta, a pergunta realmente importante é: quanta memória sua máquina pode dedicar a um modelo? Um modelo «7B» ou «32B» indica o número de parâmetros, mas é sua versão quantizada — comprimida para caber na memória, com uma pequena perda de precisão — que determina o espaço realmente necessário. A quantização Q4 (frequentemente indicada como Q4_K_M) é o meio-termo padrão para começar: reduz bastante a memória necessária em comparação com os pesos nativos do modelo, com uma perda de qualidade geralmente pouco perceptível no uso.
- 8 GB de RAM, sem GPU dedicada
- modelos leves em torno de 3-4B em Q4: uso básico, respostas mais lentas mas funcionais.
- 16 GB de RAM (CPU) ou 8 GB de VRAM (GPU)
- O ponto de entrada mais confortável, com modelos de 7 a 8B em Q4 — o formato mais comum para um primeiro uso real.
- 12 GB de VRAM
- margem para chegar a um modelo de 14B sem problemas específicos.
- 24 GB de VRAM (ou 32-48 GB de memória unificada no Mac)
- um modelo 32B com quantização Q4 roda confortavelmente.
- 64 GB ou mais de RAM ou de memória unificada
- os modelos em torno de 70B tornam-se viáveis, com offload parcial entre CPU e GPU e uma taxa de geração consideravelmente mais baixa.
#Escolher o método: LM Studio, Ollama ou llama.cpp
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Três grandes caminhos permitem executar um LLM localmente. Eles não se excluem, mas partem de filosofias diferentes — a escolha depende principalmente do quanto você se sente à vontade usando um terminal e do que pretende fazer com o modelo depois de instalado.
- LM Studio — sem terminal
- aplicativo de desktop com interface gráfica completa, pesquisa de modelos integrada e ajustes de GPU pela interface gráfica. A opção mais direta para o primeiro contato, disponível no Windows, macOS (Apple Silicon) e Linux.
- Ollama — terminal e API
- Instalação com um único comando, biblioteca de modelos controlada via linha de comando, servidor de API local compatível com a OpenAI ativo por padrão. A escolha natural se você pretende escrever scripts, automatizar ou conectar uma ferramenta de terceiros.
- llama.cpp — para os especialistas
- o motor de inferência que muitas outras ferramentas usam nos bastidores, incluindo o LM Studio. Compilação a partir do código-fonte, controle preciso de cada parâmetro, nenhuma interface — reservado para quem quer entender ou otimizar cada detalhe.
Resumo: você não quer abrir nenhum terminal → LM Studio. Você quer chamar seu modelo a partir de um script, automação ou aplicação → Ollama. Você quer entender ou ajustar cada parâmetro de compilação, ou rodar o modelo em um hardware inusitado → llama.cpp.
#Instalação rápida, passo a passo
A seguir, uma instalação resumida para cada um dos três caminhos. A ideia é dar uma visão geral para começar em poucos minutos; há um guia específico para cada ferramenta com todos os detalhes, incluindo capturas de tela.
Com LM Studio (sem usar o terminal):
- 011. Baixar o instaladorNo site oficial de LM Studio, baixe a versão compatível com seu sistema.
- 022. Abrir a busca de modelosNa primeira execução, abra a aba de pesquisa (atalho Ctrl/Cmd+Shift+M) para navegar pelo catálogo.
- 033. Escolher um modelo adequadoA aplicação exibe uma estimativa de compatibilidade com VRAM antes do download: prefira um modelo marcado como compatível com sua máquina.
- 044. Carregar o modelo e conversarAbra a aba Chat, carregue o modelo baixado no menu superior e faça sua primeira pergunta.
Com Ollama (terminal e API):
- 011. Instalar o OllamaScript oficial no Linux, instalador .exe ou .dmg no Windows e no macOS. O aplicativo de desktop inicia automaticamente após a instalação.
- 022. Iniciar um primeiro modeloEm um terminal, o comando ollama run suivie com o nome de um modelo o baixa e inicia um chat diretamente no terminal.
- 033. Conversar ou conectar uma ferramenta de terceirosContinue no terminal, ou aponte uma aplicação compatível com OpenAI para o servidor API local (porta 11434 por padrão).
- 044. Gerenciar seus modelos instaladosListe, altere ou remova seus modelos a qualquer momento com os comandos de gerenciamento dedicados.
Com llama.cpp (especialistas):
- 011. Compilar o binárioClone o repositório e compile para o seu hardware (CPU, CUDA, Metal ou ROCm, conforme sua configuração).
- 022. Baixar um modelo GGUFBaixe um arquivo no formato GGUF do Hugging Face, escolhendo a quantização adequada à memória disponível.
- 033. Executar o binário do chatAponte para o arquivo GGUF baixado, com os parâmetros de contexto e de offload para a GPU de sua escolha.
- 044. Ajustar o offload GPU/CPUAjuste camada por camada a distribuição entre GPU e CPU para encontrar o melhor equilíbrio entre velocidade e memória na sua configuração.
#Baixar seu primeiro modelo
Um bom primeiro modelo depende principalmente do que sua máquina consegue manter confortavelmente na memória, e não da reputação do modelo. Veja aqui algumas referências confiáveis de acordo com sua configuração.
- Máquina modesta (8-16 GB de RAM, sem GPU dedicada)
- um pequeno modelo generalista, com cerca de 3 a 4B de parâmetros em Q4: rápido mesmo usando apenas a CPU, mais do que suficiente para conversar, resumir ou traduzir um texto curto.
- 8 a 12 GB de VRAM
- um modelo de 7 a 8 bilhões em Q4_K_M, como o Qwen3 8B ou Mistral: o equilíbrio entre qualidade e velocidade mais comum para uso diário.
- 16-24 GB de VRAM
- um modelo de 14B, ou um de 32B em Q4 se você estiver no limite superior dessa faixa, como o Gemma em sua maior versão: mais margem para raciocínio ou código.
- Você ainda não sabe o que quer fazer com ele
- comece pequeno. Verificar se um modelo leve responde corretamente leva alguns minutos; você passará para modelos maiores depois que o primeiro teste tiver sido bem-sucedido.
#Erros comuns a evitar
A maioria das primeiras impressões negativas sobre IA local vem de um mau ajuste, e não de um problema real com a ferramenta ou o modelo. Aqui estão as armadilhas mais comuns para quem instala seu primeiro LLM localmente e como identificá-las rapidamente.
- Modelo grande demais para a VRAM
- o modelo passa a usar a RAM do sistema, podendo até travar ao carregar. As respostas ficam muito lentas ou aparece um erro de memória. Escolha um modelo de tamanho imediatamente menor ou reduza a quantização em um nível.
- Quantização escolhida ao acaso
- A versão mais pesada disponível, baixada “para ter o melhor”, muitas vezes acaba não cabendo na memória. Comece com Q4_K_M e só passe para uma versão mais pesada se a margem de memória realmente permitir.
- Ventoinha que dispara e resposta que demora
- normal ao usar um primeiro modelo grande: a inferência exige muito da GPU ou da CPU. Se estiver lento demais para você, isso indica que o modelo é grande demais para sua máquina, não um bug a corrigir.
- Baixar tudo antes de testar
- Melhor validar se um pequeno modelo funciona e responde corretamente antes de iniciar o download de um modelo de dezenas de GB.
#E depois? RAG, copiloto de código, API
Depois que um primeiro modelo estiver instalado e funcionando, há vários próximos passos naturais, dependendo do seu uso: conversar com seus próprios documentos, conectar um copiloto de código ao seu editor ou disponibilizar o servidor de API local para seus próprios scripts e aplicativos.
- Conversar com seus documentos (RAG)
- LM Studio oferece um RAG integrado pronto para uso. Com o Ollama, é necessário combinar uma ferramenta de terceiros, como Open WebUI, ou um pipeline dedicado para obter um resultado equivalente.
- Usar um copiloto no seu editor de código
- O servidor API compatível com OpenAI de Ollama ou LM Studio pode ser conectado a extensões como Cline para codificar com assistência 100% local.
- Automatizar via API
- as duas ferramentas expõem um servidor local compatível com a API da OpenAI, reutilizável em qualquer script ou aplicativo já projetado para essa API, sem precisar fazer alterações no lado do cliente.
#Perguntas frequentes
Instalar um LLM localmente é legal e gratuito?+
Qual configuração mínima para começar?+
É possível instalar um LLM localmente sem placa de vídeo?+
Quanto espaço em disco é necessário reservar?+
Qual modelo escolher para começar?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.