Iniciante 12 minInterfaces

LM Studio: tutorial completo de 2026 (instalação, API)

LM Studio é uma aplicação desktop que transforma sua máquina em um servidor LLM local sem precisar tocar no terminal. A versão 0.3+ adiciona suporte ao MCP, um melhor motor GGUF e uma experiência de download de modelos diretamente do Hugging Face. Aqui está um tutorial LM Studio 2026 completo: instalação nos três sistemas operacionais, primeiro modelo, servidor compatível com OpenAI na porta 1234 e comparação honesta com Ollama e Jan.

Por Mohamed Meguedmi·Atualização 2026-09-12·Testado no Windows 11

#Primeiro resultado: download, carregamento, verificação

A documentação oficial descreve o caminho Discover → download → Chat → carregamento do modelo. Escolha o arquivo para o seu motor: GGUF para llama.cpp, ou uma distribuição MLX compatível no Apple Silicon. Um modelo baixado ainda não está carregado. Comece com um contexto curto, depois faça uma pergunta simples antes de adicionar documentos ou um servidor API.

Em caso de memória insuficiente, reduza o contexto e escolha um arquivo mais pequeno; controle o offload para GPU. O modelo e o contexto compartilham o orçamento com o sistema em Apple Silicon. As instruções para Windows/macOS estão revisadas na documentação; o diretório do 12 de setembro foi executado sob Linux com Ollama, não com LM Studio.

Verificar os modelos instalados e estimar o carregamento
lms ls
# Remplacer MODEL_KEY par une clé réellement affichée :
lms load MODEL_KEY --context-length 4096 --estimate-only

#Por que LM Studio em 2026

O kit IA Local

O LM Studio está instalado e seu primeiro modelo responde. Os próximos passos estão no kit IA Local: escolher o modelo adequado para sua máquina (cap. 3), explorar mais recursos do LM Studio (cap. 5) e depois fazer com que ele leia seus próprios documentos (cap. 8).

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

O LM Studio ocupa um nicho específico: o usuário que quer um aplicativo com uma verdadeira interface gráfica, não um daemon de linha de comando. Você abre o aplicativo, procura um modelo na barra de pesquisa integrada (que aponta para o Hugging Face), clica em Download e conversa. Nenhum arquivo de configuração, nenhuma linha de comando.

Por dentro, o LM Studio inclui o llama.cpp com suporte a CUDA, Metal, Vulkan e ROCm, além de um mecanismo MLX dedicado aos Macs Apple Silicon. A versão 0.3 trouxe a tela “Power User” para exibir todos os parâmetros (tipo de cache KV, flash attention, offload para a GPU camada por camada), e a versão 0.3.x adicionou suporte nativo aos servidores MCP — você conecta seu modelo local a ferramentas como um sistema de arquivos ou um banco de dados, sem precisar programar.

i
Licença e uso comercial
O LM Studio é gratuito para uso pessoal. Para uso comercial em empresas, o formulário "LM Studio at Work" pode ser preenchido por conta própria desde a versão 0.3.5 — é gratuito, mas precisa ser preenchido. Nenhuma telemetria do modelo é enviada por padrão.

#Pré-requisitos

Windows
Windows 10/11 de 64 bits. AVX2 obrigatório (todos os processadores desde 2014). Suporte a CUDA se a GPU for NVIDIA; caso contrário, Vulkan.
macOS
macOS 13.4+ no Apple Silicon (M1/M2/M3/M4). Macs com arquitetura Intel não são mais suportados a partir da 0.3.
Linux
AppImage x86_64, glibc 2.35+ (Ubuntu 22.04, Fedora 36, Arch recente). Build ARM64 disponível para SBCs.
RAM
16 GB são o mínimo para um uso confortável; 8 GB ficam no limite. Para um modelo de 14B em Q4, reserve 12 GB livres; para um de 32B, 24 GB.
Disco
Reserve de 30 a 50 GB: um modelo 14B em Q4 pesa ~9 GB, e você baixará vários modelos.

#1. Instalação no Windows, no Mac e no Linux

Baixe o instalador correspondente ao seu sistema operacional do site oficial. Sem pacote npm, sem Homebrew — é um aplicativo de desktop clássico.

Site oficial
https://lmstudio.ai/download
  1. 01
    Windows
    Execute o LM-Studio-Setup.exe. O SmartScreen pode bloquear o binário na primeira execução — clique em « Informations complémentaires » e depois em « Exécuter quand même ». O aplicativo é instalado em %LOCALAPPDATA%\Programs\lm-studio.
  2. 02
    macOS
    Abra o .dmg, arraste LM Studio.app para /Applications. Na primeira execução, o Gatekeeper pode solicitar que você autorize o app em Configurações → Privacidade e Segurança. No Apple Silicon, o motor MLX está ativado por padrão.
  3. 03
    Linux
    Baixe o AppImage, torne-o executável com chmod +x LM_Studio-0.3.x.AppImage e depois execute-o. Para integrá-lo ao menu, use o AppImageLauncher ou crie um arquivo .desktop manualmente.
Linux — primeira execução
chmod +x LM_Studio-0.3.x.AppImage
./LM_Studio-0.3.x.AppImage
→
Onboarding 2026
Na primeira execução, LM Studio 0.3+ oferece os modos “User”, “Power User” e “Developer”. O modo Power User libera ajustes detalhados (GPU layers, KV cache, flash attention); o modo Developer adiciona a aba Local Server. Comece no modo Power User — você mudará para Developer quando a API do servidor for útil.

#2. Baixar Qwen3-Coder em GGUF

A aba Discover (lupa) é sua interface com o Hugging Face. Digite o nome de um modelo, escolha uma quantização e clique em Download. Para este tutorial, usamos o Qwen3-Coder-30B-A3B, o modelo de programação com pesos abertos que é referência para quem tem 16 GB ou mais de VRAM.

  1. 01
    Procurar o modelo
    No Discover, digite "qwen3-coder". LM Studio exibe os repositórios GGUF compatíveis (geralmente bartowski, unsloth, lmstudio-community). Prefira os repositórios lmstudio-community ou bartowski: seus GGUF são validados para a versão atual do motor.
  2. 02
    Escolher a quantização
    Com 24 GB de VRAM, Q4_K_M é o ponto ideal (qualidade ~99% do FP16, tamanho ~17 GB). Com 16 GB, desça para Q3_K_M. Com 32 GB ou Mac Studio, Q5_K_M ou Q8_0, se você quiser precisão máxima.
  3. 03
    Iniciar o download
    Clique em Download. O progresso é exibido na aba Downloads. Com uma conexão de fibra, estime cerca de 5 minutos para baixar um arquivo de 17 GB.
  4. 04
    Carregar o modelo
    Acesse a aba Chat, abra o seletor na parte superior e escolha Qwen3-Coder. Se você estiver no modo Power User, ajuste o GPU Offload (por padrão, o LM Studio usa o valor máximo seguro), o Context Length (32k é confortável para código) e ative o Flash Attention.
→
VRAM por tamanho (Q4_K_M)
Referências rápidas: 3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Se o LM Studio se recusar a carregar o modelo inteiro na GPU, ele passa a usar offload parcial para a CPU — é viável, mas 5 a 10× mais lento.

#3. Primeiro chat e verificação da GPU

Com o modelo carregado, faça uma pergunta no Chat. LM Studio exibe na parte inferior de cada resposta os tokens por segundo, o tempo até o primeiro token e o uso real de VRAM. Isso é mais esclarecedor do que rodar o nvidia-smi em paralelo.

Teste rápido
# Dans le chat LM Studio :
Écris une fonction Python qui parse un CSV streaming
sans charger tout le fichier en mémoire.

Em uma RTX 4090, o Qwen3-Coder-30B-A3B em Q4 atinge cerca de 90–120 tok/s graças à sua arquitetura MoE (3B ativos de um total de 30B). Em um M4 Pro de 48 GB, conte com 35–50 tok/s com o mecanismo MLX. Em uma RTX 3060 de 12 GB, o modelo de 30B não cabe — mude para o Qwen 3.5 9B (~6,6 GB em Q4), que cabe com folga e deixa margem para o contexto.

i
Modo "Just Show Me The Answer"
Por padrão, os modelos de raciocínio exibem sua cadeia de pensamento em uma área recolhível. Em Settings de um chat, você pode desativar a exibição do thinking para ver apenas a resposta final. Observação: Qwen 3.8 27B tende a raciocinar demais com sua configuração de raciocínio padrão — mude o nível de esforço para « low » se as respostas demorarem desnecessariamente.

#4. Servidor compatível com a OpenAI na porta 1234

É o argumento que muitos não conhecem: o LM Studio expõe um servidor HTTP compatível com a API OpenAI, por padrão em http://localhost:1234. Você pode, portanto, conectar qualquer cliente OpenAI (SDK Python, LangChain, Continue.dev, Cursor, sua aplicação própria) ao LM Studio sem alterar uma linha de lógica de negócio, apenas a URL base e a chave.

  1. 01
    Ativar Developer Mode
    No canto inferior esquerdo, altere o papel do usuário para "Developer". A aba Local Server (ícone de terminal) aparece na barra à esquerda.
  2. 02
    Iniciar o servidor
    Na aba Local Server → escolha o modelo a ser exposto no menu superior → clique em Start Server. Por padrão, o servidor escuta em localhost:1234. Marque "Serve on Local Network" se quiser expô-lo às outras máquinas da sua rede local.
  3. 03
    Verificar o endpoint
    O servidor expõe as rotas /v1/models, /v1/chat/completions, /v1/completions, /v1/embeddings (se um modelo de embeddings estiver carregado). Teste primeiro a lista de modelos.
Teste da API
curl http://localhost:1234/v1/models

curl http://localhost:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-coder-30b-a3b",
    "messages": [{"role": "user", "content": "Bonjour"}],
    "stream": false
  }'
Cliente Python oficial
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1234/v1",
    api_key="lm-studio",  # ignorée, n'importe quelle chaîne
)

resp = client.chat.completions.create(
    model="qwen3-coder-30b-a3b",
    messages=[{"role": "user", "content": "Refactore ce code en idiomatic Rust : ..."}],
)
print(resp.choices[0].message.content)
→
Carregamento de modelo JIT
Ative « Just-in-Time Model Loading » nas configurações do servidor. O LM Studio carrega então automaticamente o modelo solicitado pela requisição à API — útil se você alternar entre vários modelos a partir de diferentes clientes.

#5. Suporte nativo ao MCP

Desde a 0.3.17, LM Studio suporta o Protocolo de Contexto de Modelo (MCP) — o padrão introduzido pela Anthropic em 2024 para conectar ferramentas externas a um LLM. Concretamente: seu modelo local pode acessar seu sistema de arquivos, executar SQL, chamar uma API, desde que um servidor MCP esteja configurado.

A configuração é feita no arquivo mcp.json, acessível pelo menu Program → Edit mcp.json. Veja um exemplo que adiciona o servidor filesystem oficial da Anthropic e um servidor SQLite.

mcp.json
{
  "mcpServers": {
    "filesystem": {
      "command": "npx",
      "args": [
        "-y",
        "@modelcontextprotocol/server-filesystem",
        "/home/user/Documents"
      ]
    },
    "sqlite": {
      "command": "uvx",
      "args": ["mcp-server-sqlite", "--db-path", "/home/user/data.db"]
    }
  }
}

Após o registro, as ferramentas MCP aparecem no ícone de plugue (plug) do chat. Você pode ativá-las conforme a necessidade. O modelo decide então quando chamá-las: útil para criar um pequeno agente local sem programar, do tipo “resuma todos os PDFs da pasta Pesquisa” ou “quantas linhas há na tabela users”.

!
Qual modelo para uso de ferramentas
Nem todos os modelos são bons em chamadas de ferramentas. Qwen3-Coder 30B-A3B, GLM 4.7 Flash (excelente em agentes), Devstral 24B e Mistral Small 24B funcionam bem, assim como qualquer modelo treinado explicitamente para chamadas de funções. Modelos pequenos (< 7B) costumam inventar nomes de ferramentas — teste antes de implantar.

#LM Studio vs Ollama vs Jan

As três ferramentas visam o mesmo objetivo (LLM local sem nuvem) com filosofias diferentes.

LM Studio
Aplicativo desktop completo, pesquisa HF integrada, servidor de API na porta :1234, suporte a MCP, MLX no Mac. Código fechado, mas gratuito. Ideal se você quer tudo em um com uma interface gráfica séria.
Ollama
Daemon leve + CLI, escuta em :11434, enorme biblioteca de modelos pré-configurados (ollama run qwen3.5:9b), API estável, integrações por toda parte (Cline, Open WebUI, n8n). Código aberto. Ideal se você se sente à vontade no terminal e quer operar sem interface gráfica (headless).
Jan
Aplicativo desktop de código aberto (AGPL), com uma filosofia radical de prioridade ao uso offline, mais novo e com menos funcionalidades que o LM Studio. Legal se o código aberto é importante para você e você quer um aplicativo desktop.
→
Combo vencedor
Muitos usuários avançados rodam o Ollama como daemon de servidor (24/7, sem interface gráfica) e usam o LM Studio como cliente/explorador para testar novos modelos antes de colocá-los no Ollama. Os dois podem coexistir — eles não escutam na mesma porta.

#Solução de problemas

O modelo não carrega (OOM)
Reduza o GPU Offload manualmente nas Settings do chat. Se você carregar 100% do modelo na GPU e ocorrer uma falha, reduza para 80% — algumas camadas passam para a RAM; fica mais lento, mas funciona.
Taxa de tokens por segundo muito baixa
Verifique se o Flash Attention está ativado e se KV cache type está definido como Q8_0 (não FP16). No modo Power User, essas configurações ficam na barra lateral direita do chat.
O servidor API não responde
Confirme que você está no Developer Mode e que o botão Start Server está verde. No Windows, o firewall pode bloquear a porta 1234 — autorize o LM Studio no Firewall do Windows Defender.
Modelo não encontrado na pesquisa
O LM Studio lista apenas os repositórios GGUF compatíveis com sua versão do llama.cpp. Para modelos muito recentes, atualize o LM Studio (Help → Check for Updates) ou baixe o GGUF manualmente e coloque-o na pasta models.
Linux: o AppImage não consegue iniciar
Instale o libfuse2 (sudo apt install libfuse2 no Ubuntu 22.04+). No Wayland, exporte QT_QPA_PLATFORM=xcb se a aplicação não for exibida corretamente.

#Para se aprofundar

Três caminhos naturais, dependendo do que você quer fazer a seguir:

Comparar com mais detalhes
O guia “LM Studio vs Ollama: qual escolher em 2026” compara os dois recurso por recurso, com uma matriz de decisão de acordo com seu perfil.
Conectar LM Studio aos seus PDFs
« RAG local com LM Studio : conversar com seus documentos » explica a função Chat with Documents, suas limitações e quando passar para AnythingLLM.
Acelerar ainda mais a inferência
« LM Studio e o MTP (Multi-Token Prediction) » detalha como ativar o MTP nos modelos compatíveis para aumentar a taxa de geração em 30 a 80%.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.