LM Studio: tutorial completo de 2026 (instalação, API)
LM Studio é uma aplicação desktop que transforma sua máquina em um servidor LLM local sem precisar tocar no terminal. A versão 0.3+ adiciona suporte ao MCP, um melhor motor GGUF e uma experiência de download de modelos diretamente do Hugging Face. Aqui está um tutorial LM Studio 2026 completo: instalação nos três sistemas operacionais, primeiro modelo, servidor compatível com OpenAI na porta 1234 e comparação honesta com Ollama e Jan.
#Primeiro resultado: download, carregamento, verificação
A documentação oficial descreve o caminho Discover → download → Chat → carregamento do modelo. Escolha o arquivo para o seu motor: GGUF para llama.cpp, ou uma distribuição MLX compatível no Apple Silicon. Um modelo baixado ainda não está carregado. Comece com um contexto curto, depois faça uma pergunta simples antes de adicionar documentos ou um servidor API.
Em caso de memória insuficiente, reduza o contexto e escolha um arquivo mais pequeno; controle o offload para GPU. O modelo e o contexto compartilham o orçamento com o sistema em Apple Silicon. As instruções para Windows/macOS estão revisadas na documentação; o diretório do 12 de setembro foi executado sob Linux com Ollama, não com LM Studio.
- Percurso oficial de primeiros passos
- Parâmetros oficiais de carregamento
- Verificar o orçamento de memória
- Ficha do Qwen3 8B
- Escolher um primeiro caminho gratuito
#Por que LM Studio em 2026
O LM Studio está instalado e seu primeiro modelo responde. Os próximos passos estão no kit IA Local: escolher o modelo adequado para sua máquina (cap. 3), explorar mais recursos do LM Studio (cap. 5) e depois fazer com que ele leia seus próprios documentos (cap. 8).
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
O LM Studio ocupa um nicho específico: o usuário que quer um aplicativo com uma verdadeira interface gráfica, não um daemon de linha de comando. Você abre o aplicativo, procura um modelo na barra de pesquisa integrada (que aponta para o Hugging Face), clica em Download e conversa. Nenhum arquivo de configuração, nenhuma linha de comando.
Por dentro, o LM Studio inclui o llama.cpp com suporte a CUDA, Metal, Vulkan e ROCm, além de um mecanismo MLX dedicado aos Macs Apple Silicon. A versão 0.3 trouxe a tela “Power User” para exibir todos os parâmetros (tipo de cache KV, flash attention, offload para a GPU camada por camada), e a versão 0.3.x adicionou suporte nativo aos servidores MCP — você conecta seu modelo local a ferramentas como um sistema de arquivos ou um banco de dados, sem precisar programar.
#Pré-requisitos
- Windows
- Windows 10/11 de 64 bits. AVX2 obrigatório (todos os processadores desde 2014). Suporte a CUDA se a GPU for NVIDIA; caso contrário, Vulkan.
- macOS
- macOS 13.4+ no Apple Silicon (M1/M2/M3/M4). Macs com arquitetura Intel não são mais suportados a partir da 0.3.
- Linux
- AppImage x86_64, glibc 2.35+ (Ubuntu 22.04, Fedora 36, Arch recente). Build ARM64 disponível para SBCs.
- RAM
- 16 GB são o mínimo para um uso confortável; 8 GB ficam no limite. Para um modelo de 14B em Q4, reserve 12 GB livres; para um de 32B, 24 GB.
- Disco
- Reserve de 30 a 50 GB: um modelo 14B em Q4 pesa ~9 GB, e você baixará vários modelos.
#1. Instalação no Windows, no Mac e no Linux
Baixe o instalador correspondente ao seu sistema operacional do site oficial. Sem pacote npm, sem Homebrew — é um aplicativo de desktop clássico.
- 01WindowsExecute o LM-Studio-Setup.exe. O SmartScreen pode bloquear o binário na primeira execução — clique em « Informations complémentaires » e depois em « Exécuter quand même ». O aplicativo é instalado em %LOCALAPPDATA%\Programs\lm-studio.
- 02macOSAbra o .dmg, arraste LM Studio.app para /Applications. Na primeira execução, o Gatekeeper pode solicitar que você autorize o app em Configurações → Privacidade e Segurança. No Apple Silicon, o motor MLX está ativado por padrão.
- 03LinuxBaixe o AppImage, torne-o executável com chmod +x LM_Studio-0.3.x.AppImage e depois execute-o. Para integrá-lo ao menu, use o AppImageLauncher ou crie um arquivo .desktop manualmente.
#2. Baixar Qwen3-Coder em GGUF
A aba Discover (lupa) é sua interface com o Hugging Face. Digite o nome de um modelo, escolha uma quantização e clique em Download. Para este tutorial, usamos o Qwen3-Coder-30B-A3B, o modelo de programação com pesos abertos que é referência para quem tem 16 GB ou mais de VRAM.
- 01Procurar o modeloNo Discover, digite "qwen3-coder". LM Studio exibe os repositórios GGUF compatíveis (geralmente bartowski, unsloth, lmstudio-community). Prefira os repositórios lmstudio-community ou bartowski: seus GGUF são validados para a versão atual do motor.
- 02Escolher a quantizaçãoCom 24 GB de VRAM, Q4_K_M é o ponto ideal (qualidade ~99% do FP16, tamanho ~17 GB). Com 16 GB, desça para Q3_K_M. Com 32 GB ou Mac Studio, Q5_K_M ou Q8_0, se você quiser precisão máxima.
- 03Iniciar o downloadClique em Download. O progresso é exibido na aba Downloads. Com uma conexão de fibra, estime cerca de 5 minutos para baixar um arquivo de 17 GB.
- 04Carregar o modeloAcesse a aba Chat, abra o seletor na parte superior e escolha Qwen3-Coder. Se você estiver no modo Power User, ajuste o GPU Offload (por padrão, o LM Studio usa o valor máximo seguro), o Context Length (32k é confortável para código) e ative o Flash Attention.
#3. Primeiro chat e verificação da GPU
Com o modelo carregado, faça uma pergunta no Chat. LM Studio exibe na parte inferior de cada resposta os tokens por segundo, o tempo até o primeiro token e o uso real de VRAM. Isso é mais esclarecedor do que rodar o nvidia-smi em paralelo.
Em uma RTX 4090, o Qwen3-Coder-30B-A3B em Q4 atinge cerca de 90–120 tok/s graças à sua arquitetura MoE (3B ativos de um total de 30B). Em um M4 Pro de 48 GB, conte com 35–50 tok/s com o mecanismo MLX. Em uma RTX 3060 de 12 GB, o modelo de 30B não cabe — mude para o Qwen 3.5 9B (~6,6 GB em Q4), que cabe com folga e deixa margem para o contexto.
#4. Servidor compatível com a OpenAI na porta 1234
É o argumento que muitos não conhecem: o LM Studio expõe um servidor HTTP compatível com a API OpenAI, por padrão em http://localhost:1234. Você pode, portanto, conectar qualquer cliente OpenAI (SDK Python, LangChain, Continue.dev, Cursor, sua aplicação própria) ao LM Studio sem alterar uma linha de lógica de negócio, apenas a URL base e a chave.
- 01Ativar Developer ModeNo canto inferior esquerdo, altere o papel do usuário para "Developer". A aba Local Server (ícone de terminal) aparece na barra à esquerda.
- 02Iniciar o servidorNa aba Local Server → escolha o modelo a ser exposto no menu superior → clique em Start Server. Por padrão, o servidor escuta em localhost:1234. Marque "Serve on Local Network" se quiser expô-lo às outras máquinas da sua rede local.
- 03Verificar o endpointO servidor expõe as rotas /v1/models, /v1/chat/completions, /v1/completions, /v1/embeddings (se um modelo de embeddings estiver carregado). Teste primeiro a lista de modelos.
#5. Suporte nativo ao MCP
Desde a 0.3.17, LM Studio suporta o Protocolo de Contexto de Modelo (MCP) — o padrão introduzido pela Anthropic em 2024 para conectar ferramentas externas a um LLM. Concretamente: seu modelo local pode acessar seu sistema de arquivos, executar SQL, chamar uma API, desde que um servidor MCP esteja configurado.
A configuração é feita no arquivo mcp.json, acessível pelo menu Program → Edit mcp.json. Veja um exemplo que adiciona o servidor filesystem oficial da Anthropic e um servidor SQLite.
Após o registro, as ferramentas MCP aparecem no ícone de plugue (plug) do chat. Você pode ativá-las conforme a necessidade. O modelo decide então quando chamá-las: útil para criar um pequeno agente local sem programar, do tipo “resuma todos os PDFs da pasta Pesquisa” ou “quantas linhas há na tabela users”.
#LM Studio vs Ollama vs Jan
As três ferramentas visam o mesmo objetivo (LLM local sem nuvem) com filosofias diferentes.
- LM Studio
- Aplicativo desktop completo, pesquisa HF integrada, servidor de API na porta :1234, suporte a MCP, MLX no Mac. Código fechado, mas gratuito. Ideal se você quer tudo em um com uma interface gráfica séria.
- Ollama
- Daemon leve + CLI, escuta em :11434, enorme biblioteca de modelos pré-configurados (ollama run qwen3.5:9b), API estável, integrações por toda parte (Cline, Open WebUI, n8n). Código aberto. Ideal se você se sente à vontade no terminal e quer operar sem interface gráfica (headless).
- Jan
- Aplicativo desktop de código aberto (AGPL), com uma filosofia radical de prioridade ao uso offline, mais novo e com menos funcionalidades que o LM Studio. Legal se o código aberto é importante para você e você quer um aplicativo desktop.
#Solução de problemas
- O modelo não carrega (OOM)
- Reduza o GPU Offload manualmente nas Settings do chat. Se você carregar 100% do modelo na GPU e ocorrer uma falha, reduza para 80% — algumas camadas passam para a RAM; fica mais lento, mas funciona.
- Taxa de tokens por segundo muito baixa
- Verifique se o Flash Attention está ativado e se KV cache type está definido como Q8_0 (não FP16). No modo Power User, essas configurações ficam na barra lateral direita do chat.
- O servidor API não responde
- Confirme que você está no Developer Mode e que o botão Start Server está verde. No Windows, o firewall pode bloquear a porta 1234 — autorize o LM Studio no Firewall do Windows Defender.
- Modelo não encontrado na pesquisa
- O LM Studio lista apenas os repositórios GGUF compatíveis com sua versão do llama.cpp. Para modelos muito recentes, atualize o LM Studio (Help → Check for Updates) ou baixe o GGUF manualmente e coloque-o na pasta models.
- Linux: o AppImage não consegue iniciar
- Instale o libfuse2 (sudo apt install libfuse2 no Ubuntu 22.04+). No Wayland, exporte QT_QPA_PLATFORM=xcb se a aplicação não for exibida corretamente.
#Para se aprofundar
Três caminhos naturais, dependendo do que você quer fazer a seguir:
- Comparar com mais detalhes
- O guia “LM Studio vs Ollama: qual escolher em 2026” compara os dois recurso por recurso, com uma matriz de decisão de acordo com seu perfil.
- Conectar LM Studio aos seus PDFs
- « RAG local com LM Studio : conversar com seus documentos » explica a função Chat with Documents, suas limitações e quando passar para AnythingLLM.
- Acelerar ainda mais a inferência
- « LM Studio e o MTP (Multi-Token Prediction) » detalha como ativar o MTP nos modelos compatíveis para aumentar a taxa de geração em 30 a 80%.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.