LM Studio no Linux: Ubuntu, Debian, Arch, Fedora (2026)
LM Studio no Linux é uma AppImage de ~600 MB que reúne uma interface gráfica, um catálogo de modelos conectado ao Hugging Face, um motor de inferência llama.cpp e um servidor compatível com OpenAI. Sem instalação no sistema, sem daemon, sem repositório a adicionar — um arquivo executável, e pronto. Este guia abrange a instalação, o download de um GGUF, a inicialização do servidor local e as armadilhas específicas do Linux (permissões, FUSE, GPU).
#Por que LM Studio no Linux
No Linux, a escolha habitual para um LLM local é o Ollama: daemon systemd, interface de linha de comando bem organizada, escuta por padrão em localhost:11434. É excelente para servidores. O LM Studio aborda outro aspecto — o da estação de trabalho com interface gráfica.
- Uma interface completa sem terminal
- Chat, navegador de modelos Hugging Face, gerenciador de downloads, configurações de sampling: tudo em interface gráfica. Útil se você quiser testar rapidamente vários modelos antes de ir para produção.
- Um servidor compatível com OpenAI em um clique
- A aba Developer expõe um endpoint http://localhost:1234/v1 que utiliza o protocolo OpenAI. Qualquer SDK (openai-python, LangChain, Continue.dev) pode acessá-lo sem alterar uma linha.
- Nenhuma instalação no sistema
- O AppImage roda no espaço de usuário. Sem sudo, sem pacote para instalar, sem repositório de terceiros. Para máquinas com restrições impostas pelo departamento de TI ou distribuições atípicas, isso é muito útil.
- Formato GGUF nativo
- LM Studio lê apenas o GGUF (o formato do llama.cpp). É o mesmo formato usado internamente pelo Ollama, então 100% dos modelos populares estão disponíveis.
#Pré-requisitos
LM Studio roda no seu Linux. O kit IA Local dá continuidade: as configurações avançadas do LM Studio (cap. 5) e, quando surgir algum problema, uma árvore de diagnóstico por sintoma — lentidão, placa gráfica ignorada, modelo que esquece tudo (cap. 14).
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
- Distribuição Linux recente
- Ubuntu 22.04+, Fedora 38+, Debian 12+, Arch ou distribuições derivadas. O LM Studio é testado nas principais distribuições, mas o AppImage é portátil e também funciona em outras (openSUSE, Linux Mint, Pop!_OS).
- glibc 2.35+
- O AppImage inclui suas dependências gráficas, mas não a glibc. Se você estiver usando uma distribuição muito antiga (CentOS 7, Debian 10), ele não funcionará.
- FUSE
- Os arquivos AppImage usam FUSE para serem montados para leitura. A maioria das distribuições instala o FUSE por padrão. No Ubuntu 22.04+, você precisará especificamente do pacote libfuse2.
- No mínimo 8 GB de RAM
- Para rodar um modelo 7B em Q4. 16 GB para ter folga, 32 GB ou mais para modelos 14B ou para manter seu IDE aberto ao mesmo tempo.
- GPU (opcional, mas recomendado)
- NVIDIA com drivers recentes (CUDA 12+), AMD com ROCm 6.x, ou Intel Arc via Vulkan. Sem GPU, roda em CPU — funcional para modelos de 3B, lento para modelos de 7B.
#1. Baixar o AppImage
O site oficial detecta automaticamente seu sistema operacional e oferece a versão correta. Verifique se você está realmente baixando do lmstudio.ai — existem sites espelho duvidosos.
- 01Baixe o arquivo .AppImageO binário ocupa entre 500 e 700 MB. Ele inclui o llama.cpp, a interface Electron e todo o runtime. Coloque-o em ~/Applications/ ou ~/.local/bin/ conforme convenção — em qualquer lugar, na verdade, já que o AppImage é autocontido.
- 02Torne-o executávelCom o comando chmod +x. Sem isso, o arquivo é apenas um arquivo compactado inerte.
- 03Lancez-leDar um clique duplo no gerenciador de arquivos ou executar pela linha de comando. Na primeira execução, o LM Studio extrai seu conteúdo para ~/.cache/AppImage/ — isso é normal e só se repete a cada atualização.
#2. Primeira execução
Na primeira execução, o LM Studio pede para escolher um nível de interface: User (apenas chat), Power User (chat + configurações), Developer (tudo, incluindo o servidor). Power User é suficiente para explorar; mais tarde, você poderá mudar para Developer para usar o servidor local, em Settings → UI Mode.
A barra lateral esquerda organiza as visualizações:
- Chat
- A interface principal, tipo ChatGPT. É isso que você usará 90% do tempo.
- Discover
- Loja de modelos. Busca em tempo real no Hugging Face, com um indicador de compatibilidade com o hardware (Full GPU Offload / Partial / Likely too large) baseado na VRAM detectada.
- My Models
- Todos os seus modelos baixados, com seu tamanho e suas quantizações. Útil para organizar.
- Developer
- Servidor local compatível com OpenAI. Visível apenas no modo Power User ou Developer.
#3. Baixar um modelo GGUF
LM Studio lê apenas o formato GGUF (o formato binário do llama.cpp, sucessor do GGML). Se um modelo existir no Hugging Face mas não estiver em GGUF, você não poderá carregá-lo diretamente. A grande maioria dos modelos populares (Qwen 3.5, Gemma 4, Mistral, Granite 4.2, DeepSeek, gpt-oss) possui versões GGUF mantidas pela comunidade.
- 01Abra o Discover e procure um modeloPara um primeiro teste, digite Qwen 3.5 9B ou Granite 4.2 8B — escolhas confiáveis em 2026 para a faixa de 6 a 8 GB de VRAM. O LM Studio lista as variantes GGUF disponíveis, geralmente publicadas por bartowski, unsloth ou lmstudio-community.
- 02Leia as tags de compatibilidadeÀ direita de cada variante, há um indicador verde/laranja/vermelho: “Full GPU Offload” significa que o modelo cabe inteiro na VRAM. “Partial” = parte será carregada na RAM (mais lento). “Likely too large” = descarte essa opção.
- 03Escolha a quantizaçãoQ4_K_M é o ponto ideal para a maioria dos casos (perda baixa de qualidade, ~50 % do tamanho do FP16). Q5_K_M se você tiver 30-40 % a mais de VRAM. Q8_0 para a qualidade máxima se você tiver bastante espaço. FP16 apenas para fine-tuning ou comparação.
- 04Clique em DownloadEntre 4 e 8 GB para um 7B de acordo com a quantização. O download ocorre em segundo plano, você pode iniciar vários ao mesmo tempo.
Depois de baixar o modelo, volte para Chat, selecione-o no menu suspenso na parte superior, ajuste o controle deslizante GPU offload para o máximo disponível e clique em Load model. O carregamento leva de 5 a 30 segundos, dependendo do tamanho e da velocidade do disco.
#4. Iniciar o servidor local na porta 1234
É aí que o LM Studio vai além do simples chat gráfico. A aba Developer expõe um servidor HTTP que utiliza exatamente o mesmo protocolo da API da OpenAI. Qualquer cliente OpenAI (openai-python, LangChain, LlamaIndex, Continue.dev) pode acessá-lo sem alterações, apenas mudando a URL base.
- 01Entre no modo DeveloperSettings → UI Mode → Developer. A aba Developer (ícone de terminal) aparece na barra lateral.
- 02Escolha um modeloMenu no topo da aba Developer. O modelo já deve estar baixado. Você pode carregar vários ao mesmo tempo, desde que a VRAM permita.
- 03Ajuste o Context Length e o GPU OffloadAjuste GPU Offload para o máximo que a VRAM permitir. O valor padrão de 4096 em Context Length é suficiente para a maioria dos usos; aumente para 8192 ou 16384 para RAG ou documentos longos.
- 04Clique em Start ServerO servidor escuta por padrão em 127.0.0.1:1234. A porta é configurável logo ao lado, caso 1234 já esteja em uso.
Em Python, basta um cliente oficial openai. A chave de API pode ser qualquer string — o LM Studio não a verifica.
Para expor o servidor na rede local (outros computadores da equipe), altere o Host de 127.0.0.1 para 0.0.0.0 nas configurações do servidor. Atenção: o LM Studio não possui nenhuma autenticação nativa. Em uma rede compartilhada, coloque Caddy ou Nginx com autenticação básica na frente do servidor, ou restrinja o acesso pelo firewall.
#5. Aceleração GPU no Linux
Esse é o ponto que mais apresenta armadilhas no LM Studio no Linux. O AppImage inclui vários backends (CPU, CUDA, ROCm, Vulkan) e escolhe um automaticamente ao iniciar — mas a detecção automática às vezes erra dependendo dos drivers instalados.
- NVIDIA (CUDA)
- Drivers proprietários 535+ instalados (nvidia-smi deve funcionar). CUDA 12.x está incluído no AppImage, não é necessário instalá-lo separadamente. Verifique em Settings → Hardware se a GPU está listada e se o backend é CUDA.
- AMD (ROCm)
- Drivers ROCm 6.x instalados no host (Radeon RX 6800 XT e modelos mais recentes oficialmente suportados, RX 6700 XT e RX 7600 frequentemente funcionais com HSA_OVERRIDE_GFX_VERSION). Seu usuário deve pertencer aos grupos render e video.
- Intel Arc / iGPU
- Backend Vulkan, desempenho razoável nas Arc A770/A750, mas inferior ao das NVIDIA/AMD. Instale vulkan-tools para verificar com vulkaninfo se a GPU é detectada.
- Sem GPU
- Uso automático da CPU como alternativa. Para um Granite 4.2 8B Q4 em um Ryzen 7, espere entre 5 e 8 tokens por segundo. Um modelo de 3B como Qwen 3.5 2B ou Granite 4.2 3B continua muito utilizável. Acima de 14B, a paciência se torna um problema.
O controle deslizante GPU offload em Chat ou Developer define quantas camadas do modelo vão para a GPU. Coloque-o no máximo enquanto a VRAM permitir. Verifique o consumo real em um terminal:
- Valores de referência de VRAM por tamanho de modelo (Q4)
- 3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Esses valores aumentam um pouco se você aumentar o comprimento do contexto acima de 4096.
- GPUs de referência
- A RTX 3060 12GB atende confortavelmente aos modelos de 7B a 14B. RTX 4070 12GB: o mesmo, com margem. RTX 4080 16GB: 14B em Q5 e os primeiros modelos de 24B. RTX 4090 24GB: modelos de 32B em Q4 e de 70B em Q3. Mac M4 Pro com 24-48GB de memória unificada: o mesmo no Apple Silicon, mas pela versão do LM Studio para macOS.
#Armadilhas frequentes
- O AppImage não inicia
- Inicie-o a partir de um terminal para ver a mensagem de erro. O mais comum: falta de libfuse2 no Ubuntu 22.04+ (sudo apt install libfuse2 resolve o problema). Em seguida: glibc muito antiga (o LM Studio exige 2.35+, portanto não funciona no CentOS 7 nem no Debian 10).
- O GPU não está sendo usado
- Verifique nvidia-smi (ou rocm-smi). Se a GPU não estiver listada: os drivers estão ausentes ou são muito antigos. Se estiver listada, mas o LM Studio continuar usando a CPU: Settings → Hardware permite forçar o backend (CUDA/ROCm/Vulkan). No caso da AMD, o usuário deve pertencer aos grupos render e video — encerre a sessão e entre novamente após executar usermod.
- O modelo é lento apesar do GPU
- VRAM saturada e offload parcial silencioso. Reduza o comprimento do contexto, diminua o valor no controle deslizante GPU offload para medir o limite ou use uma quantização mais agressiva (Q5 → Q4 → Q3).
- Porta 1234 já ocupada
- Frequentemente ocupado por outro serviço de desenvolvimento. Mude a porta em Developer → Settings ou encerre o processo: ss -tulpn | grep 1234. Não é necessário alterar o firewall para uso em localhost.
- Atualizações automáticas que causam falhas
- LM Studio atualiza-se automaticamente por padrão. Em ambientes controlados (empresa, integração CI/CD), desative as atualizações automáticas em Settings → Updates. Anote o número da versão que funciona para poder voltar à versão anterior se necessário.
- Sem preenchimento automático na CLI
- O AppImage não oferece uma interface de linha de comando com muitos recursos. Para tarefas mais exigentes de scripting, a API HTTP do servidor (porta 1234) continua sendo a opção mais adequada. Se você precisa de uma CLI de verdade, llama.cpp ou Ollama são mais adequados.
#Para se aprofundar
Você tem o LM Studio instalado, um modelo GGUF carregado e um servidor compatível com OpenAI rodando. Os próximos passos naturais são:
- Explorar o servidor API de forma aprofundada
- O guia Transformar o LM Studio em um servidor API detalha streaming, vários modelos em paralelo, exposição segura na LAN e ajustes de desempenho.
- Comparar com Ollama no Linux
- O guia Instalar Ollama no Linux aborda a outra stack popular, mais voltada para daemon/servidor. Para muitos, a combinação Ollama (daemon) + LM Studio (interface cliente sobre ele) é a ideal.
- Escolher a quantização certa
- O guia Escolher a quantização (Q4, Q5, Q8, FP16) compara visualmente as perdas de qualidade reais e ajuda a decidir entre qualidade e VRAM, especialmente relevante quando você baixa seus próprios GGUF.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.