Msty: a interface elegante para LLMs locais (Mac, Windows, Linux)
Msty é um aplicativo de desktop que aposta tudo na experiência do usuário para executar LLMs localmente. Enquanto o Open WebUI exige Docker e o LM Studio se concentra no motor, o Msty oferece, por meio de um único instalador: modelo local e modelos na nuvem (OpenAI, Claude, Gemini) lado a lado, RAG nativo via Knowledge Stacks, workspaces e split chat para comparar dois modelos. Este guia mostra como instalar e usar o Msty no Mac, no Windows e no Linux para um uso sério de LLMs locais.
#Por que Msty
Msty (msty.app) visa um perfil específico: a pessoa que quer um aplicativo com uma interface gráfica bem cuidada, sem Docker, sem CLI, mas com funcionalidades de verdade além de um simples chat. Três diferenciais resumem a ferramenta.
- Tudo em uma única aplicação
- Motor de inferência integrado (baseado em llama.cpp), cliente para o Ollama se você já o instalou e conectores de nuvem — sem necessidade de montar uma stack.
- Knowledge Stacks
- O RAG é nativo e sem código. Basta arrastar e soltar PDFs, Markdown, pastas inteiras ou até URLs, o Msty se encarrega do chunking, dos embeddings e do retrieval.
- Workspaces e Split Chat
- Vários espaços de trabalho isolados (pessoal, trabalho, P&D) e a possibilidade de fazer a mesma pergunta a 2 a 4 modelos em paralelo na mesma visualização.
#Pré-requisitos
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
- OS
- macOS 11+ (Apple Silicon ou Intel), Windows 10/11 (x64), Linux x64 (AppImage e pacotes .deb/.rpm).
- RAM mínima
- 8 GB para um modelo 3B Q4_K_M, 16 GB para um 7B, 32 GB para rodar um 14B com folga, 64 GB para tentar rodar um 32B.
- GPU
- Opcional, mas recomendado. NVIDIA com CUDA, AMD com ROCm/Vulkan, Apple Silicon com Metal — Msty detecta e utiliza automaticamente.
- Armazenamento
- Prever de 10 a 50 GB conforme o número de modelos. Os arquivos GGUF Q4 variam de 2 GB (3B) a 40 GB (70B).
#1. Instalação
Msty é baixado apenas do site oficial. Por enquanto, não há instalação via gerenciadores de pacotes (nem Homebrew, nem winget), o que simplifica a verificação da origem.
- 01Baixar o instaladorAcesse msty.app e escolha seu sistema operacional. São oferecidas três opções: Online (reduzida, apenas para uso na nuvem), Local (recomendada, inclui o motor de inferência) e Local + GPU (com drivers CUDA incluídos para Windows).
- 02Instalar (Mac)Abra o .dmg, arraste Msty para Applications e, na primeira execução, clique com o botão direito → Abrir (Gatekeeper). O macOS pede confirmação porque o app não foi notarizado pela App Store.
- 03Instalar (Windows)Execute o .exe. Escolha a versão GPU se tiver uma NVIDIA recente — ela inclui os runtimes CUDA e evita a configuração manual dos drivers. Caso contrário, a versão Local CPU/Vulkan é suficiente.
- 04Instalar (Linux)AppImage: chmod +x Msty-*.AppImage e, em seguida, ./Msty-*.AppImage. .deb: sudo dpkg -i msty_*.deb. .rpm: sudo rpm -i msty-*.rpm. Para AppImage, libfuse2 pode ser necessário conforme a distribuição.
- 05Primeira execuçãoMsty cria sua pasta de dados (~/Library/Application Support/Msty no Mac, %APPDATA%\Msty no Windows, ~/.config/Msty no Linux). Modelos, conversas e Knowledge Stacks ficam nessa pasta.
#2. Primeiro modelo local
O Msty oferece uma configuração inicial que baixa um pequeno modelo para começar com um clique. Você também pode escolher diretamente no catálogo dele. Três opções sólidas em francês para começar de acordo com seu equipamento:
- Configuração modesta (8 GB de RAM, sem GPU)
- Qwen 3.5 2B Q4_K_M (≈1,9 GB) ou Granite 4.2 3B (≈2,2 GB). Viável apenas com CPU, ideal para conversar, fazer brainstorming e resumir um texto curto.
- Configuração padrão (16 GB RAM, GPU de 6 a 8 GB)
- Qwen 3.5 9B Q4_K_M (≈6,6 GB), com 256k de contexto e visão. A opção mais equilibrada e versátil em FR/EN para o dia a dia.
- Configuração confortável (32 GB de RAM, GPU de 12 a 24 GB)
- Mistral Small 24B (≈14 GB) ou Qwen 3.8 27B em Q4_K_M (≈18 GB). Raciocínio significativamente superior, estamos mais próximos da experiência de nuvem.
Para baixar: abra a aba Local AI Models na barra lateral esquerda e depois clique em Browse and Download Online Model. O Msty direciona você ao Hugging Face com um filtro para as versões GGUF compatíveis. O progresso é exibido, e o modelo pode ser selecionado assim que o download termina.
#3. Nuvem + local lado a lado
Esse é um dos pontos fortes do Msty: adicionar suas chaves de API de serviços na nuvem (OpenAI, Anthropic, Google, OpenRouter, Groq, Mistral cloud, etc.) e usar esses modelos na mesma interface que seus modelos locais. Para selecionar o modelo de uma nova conversa, basta usar um menu suspenso que reúne os dois mundos.
- 01Adicionar um provedor de nuvemSettings → Remote Model Providers → Add. Cole sua chave de API. O Msty armazena a chave localmente (criptografada pelo chaveiro do sistema operacional, quando disponível).
- 02Escolher o modelo para a conversaNa barra de chat, o seletor exibe todos os seus modelos: Local (com ícone de casa), Cloud (com ícone do provedor). Você pode alternar entre modelos durante uma conversa, o Msty mantém o contexto.
- 03Definir regrasSettings → Default Model permite definir o modelo padrão. Dica: definir um modelo local como padrão obriga você a escolher explicitamente quando quiser enviar para a nuvem — útil para a privacidade.
#4. Espaços de trabalho personalizados
Um workspace no Msty é um espaço isolado com suas próprias conversas, seus próprios Knowledge Stacks, seu próprio modelo padrão e seus próprios provedores ativados. Concretamente, cria-se um workspace por contexto de uso.
- Perso
- Modelo local 7B, sem nuvem, Knowledge Stacks sobre suas anotações pessoais em Markdown, prompts em tom informal.
- Trabalho
- Modelo local 14B + Claude na nuvem para tarefas pesadas, Knowledge Stack na documentação interna (procedimentos, runbooks).
- Pesquisa e desenvolvimento / sandbox
- Vários modelos ativados para experimentar, uso frequente de chat dividido, sem Knowledge Stack.
- Confidencial
- Nenhum provedor de nuvem, apenas modelo local, Knowledge Stack criptografado no nível do sistema operacional, para tratar dados de clientes ou de RH.
Criação: barra lateral esquerda → ícone Workspaces → New Workspace. Cada workspace tem seu próprio ícone e sua própria cor, o que ajuda a evitar confusões de contexto (e, portanto, de modelo/destino).
#5. Knowledge Stacks (RAG nativo)
Os Knowledge Stacks são a funcionalidade principal do Msty. É um RAG completo sem nenhuma configuração: o Msty faz o chunking, gera embeddings com um modelo local (mxbai-embed-large por padrão), armazena em uma base vetorial embarcada e injeta automaticamente os trechos relevantes no contexto do LLM quando uma pergunta é feita.
- 01Criar um Knowledge StackSidebar → Knowledge Stacks → New Stack. Dê um nome (ex.: « Documentos jurídicos »).
- 02Adicionar fontesArraste e solte arquivos (PDF, DOCX, MD, TXT, CSV, JSON) ou pastas inteiras. Você também pode adicionar URLs (o Msty rastreia a página), transcrições do YouTube ou até um repositório GitHub via URL.
- 03Aguardar a indexaçãoMsty exibe o progresso: extração de texto, chunking (aproximadamente 500 tokens por chunk por padrão), geração de embeddings. Para 100 PDFs, estime entre 5 e 15 minutos conforme a GPU.
- 04Ativar em uma conversaNo chat, ícone Knowledge Stack na parte inferior → marque o stack a ser usado. Você pode ativar vários ao mesmo tempo. O Msty exibe as fontes utilizadas abaixo de cada resposta, com um link direto para o trecho original.
#6. Split Chat e comparações
O Split Chat permite fazer uma pergunta a 2 modelos (gratuito) ou até 4 modelos (Aurum) na mesma janela, que são exibidos em colunas lado a lado. Ideal para calibrar um novo modelo ou decidir entre dois candidatos sem reescrever o prompt.
- 01Ativar Split ChatEm uma conversa, clique no botão Split (ícone de colunas) na barra superior. Uma segunda coluna aparece com seu próprio seletor de modelo.
- 02Configurar cada colunaCada coluna tem seu modelo, sua temperatura e seu system prompt. Você pode comparar um Qwen 3.5 9B local com o Claude Haiku na nuvem usando as mesmas perguntas.
- 03Conversação sincronizada ou independentePor padrão, cada mensagem que você digita é enviada para as duas colunas. Você pode desmarcar Sync para fazer as conversas divergirem (por exemplo, se uma resposta retomar uma ideia que você quer aprofundar em uma única ramificação).
#Msty vs Open WebUI vs LM Studio
Os três são interfaces gráficas para LLM, mas cada um tem um foco diferente.
- Msty
- Aplicativo desktop completo, de código fechado, com modelo freemium. Instalação em 1 clique. Melhor para: RAG sem código (Knowledge Stacks), uso combinado de nuvem e modelos locais, workspaces, conversas divididas. Menos flexível para múltiplos usuários ou implantação em servidor.
- Open WebUI
- Aplicativo web auto-hospedado, open source (BSD), com Docker recomendado. Suporte nativo a múltiplos usuários (autenticação, funções), RAG configurável, acessível de qualquer navegador da rede. Melhor para: implantação para uma equipe ou família, controle total, hospedagem em servidor.
- LM Studio
- Aplicativo desktop de código fechado, mas gratuito. Catálogo mais rico do Hugging Face, suporte nativo ao MLX no Mac, compatibilidade com MCP, previsão de múltiplos tokens. Melhor para: testar muitos modelos, desempenho puro, configurações avançadas. RAG simples (Chat with Documents), mas menos integrado que as Knowledge Stacks.
#Solução de problemas
- O modelo não carrega (OOM)
- VRAM/RAM insuficiente. Settings → Local AI → [modelo] → Advanced: reduza n_gpu_layers (transfira menos camadas para a GPU) ou n_ctx (janela de contexto). Caso contrário, use uma quantização menor (Q4_K_S, IQ3_M).
- Baixa taxa de tokens por segundo
- Verifique o uso da GPU: nvidia-smi (NVIDIA), rocm-smi (AMD) ou Activity Monitor GPU (Mac). Se o uso da GPU estiver em 0%, o Msty está rodando na CPU — verifique os drivers e se você está usando a variante Local + GPU no Windows.
- Knowledge Stack continua em 0%
- A indexação exige que o modelo de embeddings esteja baixado. Settings → Knowledge Stacks → Embedding Model: verifique se mxbai-embed-large (ou o modelo escolhido) está com o status Downloaded; caso contrário, clique em Download.
- Provedor de nuvem retorna erro 401
- Chave API inválida ou expirada. Verifique no painel do fornecedor. Para OpenAI, certifique-se de ter créditos ativos (chaves sem créditos retornam 401 ou 429).
- Linux: AppImage não inicia
- Instale libfuse2 (sudo apt install libfuse2 no Ubuntu 22.04+). Execute o AppImage a partir de um terminal para ver o erro específico.
- Conversas perdidas após atualização
- Os dados estão na pasta Msty (Application Support no Mac, AppData no Windows, .config no Linux). Verifique se nenhum limpador de sistema esvaziou essa pasta. Fazer backup dessa pasta regularmente é uma boa prática.
#Para se aprofundar
De acordo com a direção que você quer seguir:
- Comparar Msty com suas alternativas
- « Ollama vs LM Studio vs Jan vs GPT4All » e « LM Studio vs Ollama : qual escolher em 2026 » dão o panorama completo das interfaces locais.
- Levar o RAG além dos Knowledge Stacks
- « RAG local com Ollama sem codificar (Open WebUI, AnythingLLM) » abrange as alternativas quando se ultrapassam as capacidades do RAG integrado do Msty.
- Escolher o modelo certo para Msty
- “Escolher a quantização (Q4, Q5, Q8, FP16)” ajuda a avaliar o compromisso entre qualidade e uso de VRAM no catálogo do Msty.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.