Iniciante 9 minInterfaces

LM Studio no Linux: Ubuntu, Debian, Arch, Fedora (2026)

LM Studio no Linux é uma AppImage de ~600 MB que reúne uma interface gráfica, um catálogo de modelos conectado ao Hugging Face, um motor de inferência llama.cpp e um servidor compatível com OpenAI. Sem instalação no sistema, sem daemon, sem repositório a adicionar — um arquivo executável, e pronto. Este guia abrange a instalação, o download de um GGUF, a inicialização do servidor local e as armadilhas específicas do Linux (permissões, FUSE, GPU).

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Ubuntu 24.04
i
Em resumo
LM Studio no Linux é uma AppImage de aproximadamente 600 MB: sem instalação no sistema, sem daemon, apenas um arquivo executável. · Três etapas são suficientes: baixar o arquivo, torná-lo executável (chmod +x) e então executá-lo. · Pré-requisitos: uma distribuição recente com glibc 2.35+ e o pacote libfuse2 em Ubuntu 22.04 e versões posteriores. · A AppImage detecta automaticamente a GPU (CUDA, ROCm ou Vulkan, conforme sua placa) para acelerar a inferência.

#Por que LM Studio no Linux

No Linux, a escolha habitual para um LLM local é o Ollama: daemon systemd, interface de linha de comando bem organizada, escuta por padrão em localhost:11434. É excelente para servidores. O LM Studio aborda outro aspecto — o da estação de trabalho com interface gráfica.

Uma interface completa sem terminal
Chat, navegador de modelos Hugging Face, gerenciador de downloads, configurações de sampling: tudo em interface gráfica. Útil se você quiser testar rapidamente vários modelos antes de ir para produção.
Um servidor compatível com OpenAI em um clique
A aba Developer expõe um endpoint http://localhost:1234/v1 que utiliza o protocolo OpenAI. Qualquer SDK (openai-python, LangChain, Continue.dev) pode acessá-lo sem alterar uma linha.
Nenhuma instalação no sistema
O AppImage roda no espaço de usuário. Sem sudo, sem pacote para instalar, sem repositório de terceiros. Para máquinas com restrições impostas pelo departamento de TI ou distribuições atípicas, isso é muito útil.
Formato GGUF nativo
LM Studio lê apenas o GGUF (o formato do llama.cpp). É o mesmo formato usado internamente pelo Ollama, então 100% dos modelos populares estão disponíveis.
i
LM Studio e Ollama coexistem muito bem
Nada impede que você tenha os dois. Ollama em modo daemon para seus scripts e integrações, LM Studio para o chat interativo e a descoberta de novos modelos. Eles usam portas diferentes (11434 vs 1234) e não interferem um no outro.

#Pré-requisitos

O kit IA Local

LM Studio roda no seu Linux. O kit IA Local dá continuidade: as configurações avançadas do LM Studio (cap. 5) e, quando surgir algum problema, uma árvore de diagnóstico por sintoma — lentidão, placa gráfica ignorada, modelo que esquece tudo (cap. 14).

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias
Distribuição Linux recente
Ubuntu 22.04+, Fedora 38+, Debian 12+, Arch ou distribuições derivadas. O LM Studio é testado nas principais distribuições, mas o AppImage é portátil e também funciona em outras (openSUSE, Linux Mint, Pop!_OS).
glibc 2.35+
O AppImage inclui suas dependências gráficas, mas não a glibc. Se você estiver usando uma distribuição muito antiga (CentOS 7, Debian 10), ele não funcionará.
FUSE
Os arquivos AppImage usam FUSE para serem montados para leitura. A maioria das distribuições instala o FUSE por padrão. No Ubuntu 22.04+, você precisará especificamente do pacote libfuse2.
No mínimo 8 GB de RAM
Para rodar um modelo 7B em Q4. 16 GB para ter folga, 32 GB ou mais para modelos 14B ou para manter seu IDE aberto ao mesmo tempo.
GPU (opcional, mas recomendado)
NVIDIA com drivers recentes (CUDA 12+), AMD com ROCm 6.x, ou Intel Arc via Vulkan. Sem GPU, roda em CPU — funcional para modelos de 3B, lento para modelos de 7B.
!
Ubuntu 22.04 e FUSE
O Ubuntu 22.04 deixou de incluir o libfuse2 por padrão, o que impede o funcionamento de muitos AppImages com uma mensagem obscura do tipo "dlopen(): error loading libfuse.so.2". Instale o pacote com sudo apt install libfuse2 antes de iniciar o LM Studio.

#1. Baixar o AppImage

O site oficial detecta automaticamente seu sistema operacional e oferece a versão correta. Verifique se você está realmente baixando do lmstudio.ai — existem sites espelho duvidosos.

Site oficial
https://lmstudio.ai
  1. 01
    Baixe o arquivo .AppImage
    O binário ocupa entre 500 e 700 MB. Ele inclui o llama.cpp, a interface Electron e todo o runtime. Coloque-o em ~/Applications/ ou ~/.local/bin/ conforme convenção — em qualquer lugar, na verdade, já que o AppImage é autocontido.
  2. 02
    Torne-o executável
    Com o comando chmod +x. Sem isso, o arquivo é apenas um arquivo compactado inerte.
  3. 03
    Lancez-le
    Dar um clique duplo no gerenciador de arquivos ou executar pela linha de comando. Na primeira execução, o LM Studio extrai seu conteúdo para ~/.cache/AppImage/ — isso é normal e só se repete a cada atualização.
Instalação rápida via CLI
mkdir -p ~/Applications
cd ~/Applications
# Remplacez le nom par celui du fichier téléchargé
chmod +x LM_Studio-*.AppImage
./LM_Studio-*.AppImage
→
Integrar LM Studio no menu de aplicações
Instale o appimaged ou o AppImageLauncher: essas ferramentas detectam automaticamente os arquivos AppImage em ~/Applications/ e criam entradas .desktop para que apareçam no seu menu, como um aplicativo nativo. O AppImageLauncher até gerencia as atualizações.

#2. Primeira execução

Na primeira execução, o LM Studio pede para escolher um nível de interface: User (apenas chat), Power User (chat + configurações), Developer (tudo, incluindo o servidor). Power User é suficiente para explorar; mais tarde, você poderá mudar para Developer para usar o servidor local, em Settings → UI Mode.

A barra lateral esquerda organiza as visualizações:

Chat
A interface principal, tipo ChatGPT. É isso que você usará 90% do tempo.
Discover
Loja de modelos. Busca em tempo real no Hugging Face, com um indicador de compatibilidade com o hardware (Full GPU Offload / Partial / Likely too large) baseado na VRAM detectada.
My Models
Todos os seus modelos baixados, com seu tamanho e suas quantizações. Útil para organizar.
Developer
Servidor local compatível com OpenAI. Visível apenas no modo Power User ou Developer.

#3. Baixar um modelo GGUF

LM Studio lê apenas o formato GGUF (o formato binário do llama.cpp, sucessor do GGML). Se um modelo existir no Hugging Face mas não estiver em GGUF, você não poderá carregá-lo diretamente. A grande maioria dos modelos populares (Qwen 3.5, Gemma 4, Mistral, Granite 4.2, DeepSeek, gpt-oss) possui versões GGUF mantidas pela comunidade.

  1. 01
    Abra o Discover e procure um modelo
    Para um primeiro teste, digite Qwen 3.5 9B ou Granite 4.2 8B — escolhas confiáveis em 2026 para a faixa de 6 a 8 GB de VRAM. O LM Studio lista as variantes GGUF disponíveis, geralmente publicadas por bartowski, unsloth ou lmstudio-community.
  2. 02
    Leia as tags de compatibilidade
    À direita de cada variante, há um indicador verde/laranja/vermelho: “Full GPU Offload” significa que o modelo cabe inteiro na VRAM. “Partial” = parte será carregada na RAM (mais lento). “Likely too large” = descarte essa opção.
  3. 03
    Escolha a quantização
    Q4_K_M é o ponto ideal para a maioria dos casos (perda baixa de qualidade, ~50 % do tamanho do FP16). Q5_K_M se você tiver 30-40 % a mais de VRAM. Q8_0 para a qualidade máxima se você tiver bastante espaço. FP16 apenas para fine-tuning ou comparação.
  4. 04
    Clique em Download
    Entre 4 e 8 GB para um 7B de acordo com a quantização. O download ocorre em segundo plano, você pode iniciar vários ao mesmo tempo.
→
Onde os modelos são armazenados
Por padrão, LM Studio coloca os modelos em ~/.cache/lm-studio/models/. No Linux, esse diretório pode crescer rapidamente (50 a 200 GB com alguns modelos). Se o seu /home estiver em um SSD pequeno, mova o diretório para um disco maior em Settings → Model Directory.

Depois de baixar o modelo, volte para Chat, selecione-o no menu suspenso na parte superior, ajuste o controle deslizante GPU offload para o máximo disponível e clique em Load model. O carregamento leva de 5 a 30 segundos, dependendo do tamanho e da velocidade do disco.

#4. Iniciar o servidor local na porta 1234

É aí que o LM Studio vai além do simples chat gráfico. A aba Developer expõe um servidor HTTP que utiliza exatamente o mesmo protocolo da API da OpenAI. Qualquer cliente OpenAI (openai-python, LangChain, LlamaIndex, Continue.dev) pode acessá-lo sem alterações, apenas mudando a URL base.

  1. 01
    Entre no modo Developer
    Settings → UI Mode → Developer. A aba Developer (ícone de terminal) aparece na barra lateral.
  2. 02
    Escolha um modelo
    Menu no topo da aba Developer. O modelo já deve estar baixado. Você pode carregar vários ao mesmo tempo, desde que a VRAM permita.
  3. 03
    Ajuste o Context Length e o GPU Offload
    Ajuste GPU Offload para o máximo que a VRAM permitir. O valor padrão de 4096 em Context Length é suficiente para a maioria dos usos; aumente para 8192 ou 16384 para RAG ou documentos longos.
  4. 04
    Clique em Start Server
    O servidor escuta por padrão em 127.0.0.1:1234. A porta é configurável logo ao lado, caso 1234 já esteja em uso.
Testar o servidor
# Liste des modèles chargés
curl http://localhost:1234/v1/models

# Une complétion chat minimale
curl http://localhost:1234/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "local-model",
    "messages": [
      {"role":"user","content":"Capitale de l'\''Italie ?"}
    ],
    "temperature": 0.2
  }'

Em Python, basta um cliente oficial openai. A chave de API pode ser qualquer string — o LM Studio não a verifica.

Cliente Python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1234/v1",
    api_key="lm-studio",  # placeholder, non vérifié
)

resp = client.chat.completions.create(
    model="local-model",
    messages=[
        {"role": "system", "content": "Tu réponds en une phrase."},
        {"role": "user",   "content": "Qu'est-ce qu'un GGUF ?"},
    ],
    stream=True,
)

for chunk in resp:
    print(chunk.choices[0].delta.content or "", end="", flush=True)
i
Logs em tempo real
A aba Developer exibe os Server Logs em tempo real: cada requisição recebida, o tempo de geração, o número de tokens. Essencial para depurar uma integração.

Para expor o servidor na rede local (outros computadores da equipe), altere o Host de 127.0.0.1 para 0.0.0.0 nas configurações do servidor. Atenção: o LM Studio não possui nenhuma autenticação nativa. Em uma rede compartilhada, coloque Caddy ou Nginx com autenticação básica na frente do servidor, ou restrinja o acesso pelo firewall.

#5. Aceleração GPU no Linux

Esse é o ponto que mais apresenta armadilhas no LM Studio no Linux. O AppImage inclui vários backends (CPU, CUDA, ROCm, Vulkan) e escolhe um automaticamente ao iniciar — mas a detecção automática às vezes erra dependendo dos drivers instalados.

NVIDIA (CUDA)
Drivers proprietários 535+ instalados (nvidia-smi deve funcionar). CUDA 12.x está incluído no AppImage, não é necessário instalá-lo separadamente. Verifique em Settings → Hardware se a GPU está listada e se o backend é CUDA.
AMD (ROCm)
Drivers ROCm 6.x instalados no host (Radeon RX 6800 XT e modelos mais recentes oficialmente suportados, RX 6700 XT e RX 7600 frequentemente funcionais com HSA_OVERRIDE_GFX_VERSION). Seu usuário deve pertencer aos grupos render e video.
Intel Arc / iGPU
Backend Vulkan, desempenho razoável nas Arc A770/A750, mas inferior ao das NVIDIA/AMD. Instale vulkan-tools para verificar com vulkaninfo se a GPU é detectada.
Sem GPU
Uso automático da CPU como alternativa. Para um Granite 4.2 8B Q4 em um Ryzen 7, espere entre 5 e 8 tokens por segundo. Um modelo de 3B como Qwen 3.5 2B ou Granite 4.2 3B continua muito utilizável. Acima de 14B, a paciência se torna um problema.

O controle deslizante GPU offload em Chat ou Developer define quantas camadas do modelo vão para a GPU. Coloque-o no máximo enquanto a VRAM permitir. Verifique o consumo real em um terminal:

Monitorar a VRAM
# NVIDIA
nvidia-smi -l 1

# AMD (radeontop ou rocm-smi)
rocm-smi --showmeminfo vram
Valores de referência de VRAM por tamanho de modelo (Q4)
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Esses valores aumentam um pouco se você aumentar o comprimento do contexto acima de 4096.
GPUs de referência
A RTX 3060 12GB atende confortavelmente aos modelos de 7B a 14B. RTX 4070 12GB: o mesmo, com margem. RTX 4080 16GB: 14B em Q5 e os primeiros modelos de 24B. RTX 4090 24GB: modelos de 32B em Q4 e de 70B em Q3. Mac M4 Pro com 24-48GB de memória unificada: o mesmo no Apple Silicon, mas pela versão do LM Studio para macOS.
!
A armadilha do fallback silencioso para a CPU
Se a VRAM for insuficiente para o modelo com o comprimento de contexto solicitado, o LM Studio transfere algumas camadas para a RAM sem sempre indicar isso claramente. Você obtém entre 2 e 5 tokens/s em vez de 40+. Verifique Settings → Hardware ou nvidia-smi durante a geração — se a VRAM não estiver saturada, significa que o modelo está rodando parcialmente na CPU.

#Armadilhas frequentes

O AppImage não inicia
Inicie-o a partir de um terminal para ver a mensagem de erro. O mais comum: falta de libfuse2 no Ubuntu 22.04+ (sudo apt install libfuse2 resolve o problema). Em seguida: glibc muito antiga (o LM Studio exige 2.35+, portanto não funciona no CentOS 7 nem no Debian 10).
O GPU não está sendo usado
Verifique nvidia-smi (ou rocm-smi). Se a GPU não estiver listada: os drivers estão ausentes ou são muito antigos. Se estiver listada, mas o LM Studio continuar usando a CPU: Settings → Hardware permite forçar o backend (CUDA/ROCm/Vulkan). No caso da AMD, o usuário deve pertencer aos grupos render e video — encerre a sessão e entre novamente após executar usermod.
O modelo é lento apesar do GPU
VRAM saturada e offload parcial silencioso. Reduza o comprimento do contexto, diminua o valor no controle deslizante GPU offload para medir o limite ou use uma quantização mais agressiva (Q5 → Q4 → Q3).
Porta 1234 já ocupada
Frequentemente ocupado por outro serviço de desenvolvimento. Mude a porta em Developer → Settings ou encerre o processo: ss -tulpn | grep 1234. Não é necessário alterar o firewall para uso em localhost.
Atualizações automáticas que causam falhas
LM Studio atualiza-se automaticamente por padrão. Em ambientes controlados (empresa, integração CI/CD), desative as atualizações automáticas em Settings → Updates. Anote o número da versão que funciona para poder voltar à versão anterior se necessário.
Sem preenchimento automático na CLI
O AppImage não oferece uma interface de linha de comando com muitos recursos. Para tarefas mais exigentes de scripting, a API HTTP do servidor (porta 1234) continua sendo a opção mais adequada. Se você precisa de uma CLI de verdade, llama.cpp ou Ollama são mais adequados.

#Para se aprofundar

Você tem o LM Studio instalado, um modelo GGUF carregado e um servidor compatível com OpenAI rodando. Os próximos passos naturais são:

Explorar o servidor API de forma aprofundada
O guia Transformar o LM Studio em um servidor API detalha streaming, vários modelos em paralelo, exposição segura na LAN e ajustes de desempenho.
Comparar com Ollama no Linux
O guia Instalar Ollama no Linux aborda a outra stack popular, mais voltada para daemon/servidor. Para muitos, a combinação Ollama (daemon) + LM Studio (interface cliente sobre ele) é a ideal.
Escolher a quantização certa
O guia Escolher a quantização (Q4, Q5, Q8, FP16) compara visualmente as perdas de qualidade reais e ajuda a decidir entre qualidade e VRAM, especialmente relevante quando você baixa seus próprios GGUF.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.