Iniciante 11 minInterfaces

Msty: a interface elegante para LLMs locais (Mac, Windows, Linux)

Msty é um aplicativo de desktop que aposta tudo na experiência do usuário para executar LLMs localmente. Enquanto o Open WebUI exige Docker e o LM Studio se concentra no motor, o Msty oferece, por meio de um único instalador: modelo local e modelos na nuvem (OpenAI, Claude, Gemini) lado a lado, RAG nativo via Knowledge Stacks, workspaces e split chat para comparar dois modelos. Este guia mostra como instalar e usar o Msty no Mac, no Windows e no Linux para um uso sério de LLMs locais.

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux

#Por que Msty

Msty (msty.app) visa um perfil específico: a pessoa que quer um aplicativo com uma interface gráfica bem cuidada, sem Docker, sem CLI, mas com funcionalidades de verdade além de um simples chat. Três diferenciais resumem a ferramenta.

Tudo em uma única aplicação
Motor de inferência integrado (baseado em llama.cpp), cliente para o Ollama se você já o instalou e conectores de nuvem — sem necessidade de montar uma stack.
Knowledge Stacks
O RAG é nativo e sem código. Basta arrastar e soltar PDFs, Markdown, pastas inteiras ou até URLs, o Msty se encarrega do chunking, dos embeddings e do retrieval.
Workspaces e Split Chat
Vários espaços de trabalho isolados (pessoal, trabalho, P&D) e a possibilidade de fazer a mesma pergunta a 2 a 4 modelos em paralelo na mesma visualização.
i
Modelo econômico
Msty é freemium. A versão gratuita cobre a grande maioria dos usos (chat local, nuvem, Knowledge Stacks básicos, chat dividido com 2 modelos). A versão Aurum (paga) libera chat dividido ilimitado, biblioteca avançada de prompts e algumas opções profissionais. Não há telemetria das suas conversas em nenhuma das duas versões, segundo a política do desenvolvedor.

#Pré-requisitos

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias
OS
macOS 11+ (Apple Silicon ou Intel), Windows 10/11 (x64), Linux x64 (AppImage e pacotes .deb/.rpm).
RAM mínima
8 GB para um modelo 3B Q4_K_M, 16 GB para um 7B, 32 GB para rodar um 14B com folga, 64 GB para tentar rodar um 32B.
GPU
Opcional, mas recomendado. NVIDIA com CUDA, AMD com ROCm/Vulkan, Apple Silicon com Metal — Msty detecta e utiliza automaticamente.
Armazenamento
Prever de 10 a 50 GB conforme o número de modelos. Os arquivos GGUF Q4 variam de 2 GB (3B) a 40 GB (70B).
→
VRAM Q4 por tamanho do modelo
Com quantização Q4_K_M (o padrão do Msty): 3B≈2 GB · 7B≈5 GB · 14B≈9 GB · 32B≈19 GB · 70B≈40 GB. Quando o modelo excede a capacidade da sua VRAM, o Msty transfere parte dele para a RAM do sistema — continua utilizável, mas fica lento (queda de 50 para 5 tokens/s).

#1. Instalação

Msty é baixado apenas do site oficial. Por enquanto, não há instalação via gerenciadores de pacotes (nem Homebrew, nem winget), o que simplifica a verificação da origem.

Site oficial
https://msty.app
!
Baixe apenas do msty.app
A desenvolvedora (Sapling Inc.) não assina por meio das lojas oficiais. Verifique bem a URL — sites de terceiros às vezes redistribuem versões modificadas. O site oficial é msty.app, não msty.io ou outras variantes.
  1. 01
    Baixar o instalador
    Acesse msty.app e escolha seu sistema operacional. São oferecidas três opções: Online (reduzida, apenas para uso na nuvem), Local (recomendada, inclui o motor de inferência) e Local + GPU (com drivers CUDA incluídos para Windows).
  2. 02
    Instalar (Mac)
    Abra o .dmg, arraste Msty para Applications e, na primeira execução, clique com o botão direito → Abrir (Gatekeeper). O macOS pede confirmação porque o app não foi notarizado pela App Store.
  3. 03
    Instalar (Windows)
    Execute o .exe. Escolha a versão GPU se tiver uma NVIDIA recente — ela inclui os runtimes CUDA e evita a configuração manual dos drivers. Caso contrário, a versão Local CPU/Vulkan é suficiente.
  4. 04
    Instalar (Linux)
    AppImage: chmod +x Msty-*.AppImage e, em seguida, ./Msty-*.AppImage. .deb: sudo dpkg -i msty_*.deb. .rpm: sudo rpm -i msty-*.rpm. Para AppImage, libfuse2 pode ser necessário conforme a distribuição.
  5. 05
    Primeira execução
    Msty cria sua pasta de dados (~/Library/Application Support/Msty no Mac, %APPDATA%\Msty no Windows, ~/.config/Msty no Linux). Modelos, conversas e Knowledge Stacks ficam nessa pasta.

#2. Primeiro modelo local

O Msty oferece uma configuração inicial que baixa um pequeno modelo para começar com um clique. Você também pode escolher diretamente no catálogo dele. Três opções sólidas em francês para começar de acordo com seu equipamento:

Configuração modesta (8 GB de RAM, sem GPU)
Qwen 3.5 2B Q4_K_M (≈1,9 GB) ou Granite 4.2 3B (≈2,2 GB). Viável apenas com CPU, ideal para conversar, fazer brainstorming e resumir um texto curto.
Configuração padrão (16 GB RAM, GPU de 6 a 8 GB)
Qwen 3.5 9B Q4_K_M (≈6,6 GB), com 256k de contexto e visão. A opção mais equilibrada e versátil em FR/EN para o dia a dia.
Configuração confortável (32 GB de RAM, GPU de 12 a 24 GB)
Mistral Small 24B (≈14 GB) ou Qwen 3.8 27B em Q4_K_M (≈18 GB). Raciocínio significativamente superior, estamos mais próximos da experiência de nuvem.

Para baixar: abra a aba Local AI Models na barra lateral esquerda e depois clique em Browse and Download Online Model. O Msty direciona você ao Hugging Face com um filtro para as versões GGUF compatíveis. O progresso é exibido, e o modelo pode ser selecionado assim que o download termina.

→
Reutilizar seus modelos Ollama
Se você já tem Ollama instalado na máquina, Msty detecta automaticamente os modelos presentes e permite usá-los pela sua interface — sem duplicar os arquivos. É uma porta de entrada discreta para uma transição tranquila da CLI do Ollama para uma verdadeira GUI.

#3. Nuvem + local lado a lado

Esse é um dos pontos fortes do Msty: adicionar suas chaves de API de serviços na nuvem (OpenAI, Anthropic, Google, OpenRouter, Groq, Mistral cloud, etc.) e usar esses modelos na mesma interface que seus modelos locais. Para selecionar o modelo de uma nova conversa, basta usar um menu suspenso que reúne os dois mundos.

  1. 01
    Adicionar um provedor de nuvem
    Settings → Remote Model Providers → Add. Cole sua chave de API. O Msty armazena a chave localmente (criptografada pelo chaveiro do sistema operacional, quando disponível).
  2. 02
    Escolher o modelo para a conversa
    Na barra de chat, o seletor exibe todos os seus modelos: Local (com ícone de casa), Cloud (com ícone do provedor). Você pode alternar entre modelos durante uma conversa, o Msty mantém o contexto.
  3. 03
    Definir regras
    Settings → Default Model permite definir o modelo padrão. Dica: definir um modelo local como padrão obriga você a escolher explicitamente quando quiser enviar para a nuvem — útil para a privacidade.
!
Privacidade: cuidado com o hábito de recorrer à nuvem
A praticidade do seletor unificado tem um lado negativo: é fácil enviar, por engano, um prompt sensível para a OpenAI ou a Anthropic. Se você trabalha com dados confidenciais, crie um workspace dedicado sem nenhum provedor de nuvem configurado (ver seção seguinte) ou remova as chaves de API para esse contexto.

#4. Espaços de trabalho personalizados

Um workspace no Msty é um espaço isolado com suas próprias conversas, seus próprios Knowledge Stacks, seu próprio modelo padrão e seus próprios provedores ativados. Concretamente, cria-se um workspace por contexto de uso.

Perso
Modelo local 7B, sem nuvem, Knowledge Stacks sobre suas anotações pessoais em Markdown, prompts em tom informal.
Trabalho
Modelo local 14B + Claude na nuvem para tarefas pesadas, Knowledge Stack na documentação interna (procedimentos, runbooks).
Pesquisa e desenvolvimento / sandbox
Vários modelos ativados para experimentar, uso frequente de chat dividido, sem Knowledge Stack.
Confidencial
Nenhum provedor de nuvem, apenas modelo local, Knowledge Stack criptografado no nível do sistema operacional, para tratar dados de clientes ou de RH.

Criação: barra lateral esquerda → ícone Workspaces → New Workspace. Cada workspace tem seu próprio ícone e sua própria cor, o que ajuda a evitar confusões de contexto (e, portanto, de modelo/destino).

#5. Knowledge Stacks (RAG nativo)

Os Knowledge Stacks são a funcionalidade principal do Msty. É um RAG completo sem nenhuma configuração: o Msty faz o chunking, gera embeddings com um modelo local (mxbai-embed-large por padrão), armazena em uma base vetorial embarcada e injeta automaticamente os trechos relevantes no contexto do LLM quando uma pergunta é feita.

  1. 01
    Criar um Knowledge Stack
    Sidebar → Knowledge Stacks → New Stack. Dê um nome (ex.: « Documentos jurídicos »).
  2. 02
    Adicionar fontes
    Arraste e solte arquivos (PDF, DOCX, MD, TXT, CSV, JSON) ou pastas inteiras. Você também pode adicionar URLs (o Msty rastreia a página), transcrições do YouTube ou até um repositório GitHub via URL.
  3. 03
    Aguardar a indexação
    Msty exibe o progresso: extração de texto, chunking (aproximadamente 500 tokens por chunk por padrão), geração de embeddings. Para 100 PDFs, estime entre 5 e 15 minutos conforme a GPU.
  4. 04
    Ativar em uma conversa
    No chat, ícone Knowledge Stack na parte inferior → marque o stack a ser usado. Você pode ativar vários ao mesmo tempo. O Msty exibe as fontes utilizadas abaixo de cada resposta, com um link direto para o trecho original.
→
Modelo de embeddings e qualidade FR
Por padrão, o Msty utiliza mxbai-embed-large, que funciona bem em francês. Para conteúdo exclusivamente em francês, você ganha em qualidade passando para um modelo francês, como Solon-embeddings, ou para o bge-m3 multilíngue. Configuração: Settings → Knowledge Stacks → Embedding Model. Tudo permanece local.
i
Limitações que você deve conhecer
O RAG do Msty é muito bom para 10 a 500 documentos. Acima disso (10 mil documentos ou mais, pesquisa híbrida BM25, reranking personalizado), uma stack dedicada (Qdrant + LlamaIndex, ou AnythingLLM) continua sendo mais flexível. O Msty otimiza a experiência, não a cardinalidade.

#6. Split Chat e comparações

O Split Chat permite fazer uma pergunta a 2 modelos (gratuito) ou até 4 modelos (Aurum) na mesma janela, que são exibidos em colunas lado a lado. Ideal para calibrar um novo modelo ou decidir entre dois candidatos sem reescrever o prompt.

  1. 01
    Ativar Split Chat
    Em uma conversa, clique no botão Split (ícone de colunas) na barra superior. Uma segunda coluna aparece com seu próprio seletor de modelo.
  2. 02
    Configurar cada coluna
    Cada coluna tem seu modelo, sua temperatura e seu system prompt. Você pode comparar um Qwen 3.5 9B local com o Claude Haiku na nuvem usando as mesmas perguntas.
  3. 03
    Conversação sincronizada ou independente
    Por padrão, cada mensagem que você digita é enviada para as duas colunas. Você pode desmarcar Sync para fazer as conversas divergirem (por exemplo, se uma resposta retomar uma ideia que você quer aprofundar em uma única ramificação).
Exemplo de comparação útil
Prompt :
"Rédige un email professionnel poli pour refuser une réunion non urgente."

Colonne 1 : Qwen 3.5 9B local, température 0.7
Colonne 2 : Mistral Small 24B local, température 0.7

→ Comparaison directe du niveau de français, du ton, de la longueur,
de la pertinence des formules. Décide quel modèle
devient le défaut pour l'usage "rédaction".

#Msty vs Open WebUI vs LM Studio

Os três são interfaces gráficas para LLM, mas cada um tem um foco diferente.

Msty
Aplicativo desktop completo, de código fechado, com modelo freemium. Instalação em 1 clique. Melhor para: RAG sem código (Knowledge Stacks), uso combinado de nuvem e modelos locais, workspaces, conversas divididas. Menos flexível para múltiplos usuários ou implantação em servidor.
Open WebUI
Aplicativo web auto-hospedado, open source (BSD), com Docker recomendado. Suporte nativo a múltiplos usuários (autenticação, funções), RAG configurável, acessível de qualquer navegador da rede. Melhor para: implantação para uma equipe ou família, controle total, hospedagem em servidor.
LM Studio
Aplicativo desktop de código fechado, mas gratuito. Catálogo mais rico do Hugging Face, suporte nativo ao MLX no Mac, compatibilidade com MCP, previsão de múltiplos tokens. Melhor para: testar muitos modelos, desempenho puro, configurações avançadas. RAG simples (Chat with Documents), mas menos integrado que as Knowledge Stacks.
→
Como escolher entre os três
Você quer chat + RAG local sem programar e uma experiência de usuário refinada: Msty. Você quer implantar para vários usuários na rede: Open WebUI. Você quer explorar modelos e aproveitar ao máximo o motor de inferência: LM Studio. Nada impede de combiná-los — o Msty pode usar uma instância do Ollama disponibilizada pelo Open WebUI em outra máquina.

#Solução de problemas

O modelo não carrega (OOM)
VRAM/RAM insuficiente. Settings → Local AI → [modelo] → Advanced: reduza n_gpu_layers (transfira menos camadas para a GPU) ou n_ctx (janela de contexto). Caso contrário, use uma quantização menor (Q4_K_S, IQ3_M).
Baixa taxa de tokens por segundo
Verifique o uso da GPU: nvidia-smi (NVIDIA), rocm-smi (AMD) ou Activity Monitor GPU (Mac). Se o uso da GPU estiver em 0%, o Msty está rodando na CPU — verifique os drivers e se você está usando a variante Local + GPU no Windows.
Knowledge Stack continua em 0%
A indexação exige que o modelo de embeddings esteja baixado. Settings → Knowledge Stacks → Embedding Model: verifique se mxbai-embed-large (ou o modelo escolhido) está com o status Downloaded; caso contrário, clique em Download.
Provedor de nuvem retorna erro 401
Chave API inválida ou expirada. Verifique no painel do fornecedor. Para OpenAI, certifique-se de ter créditos ativos (chaves sem créditos retornam 401 ou 429).
Linux: AppImage não inicia
Instale libfuse2 (sudo apt install libfuse2 no Ubuntu 22.04+). Execute o AppImage a partir de um terminal para ver o erro específico.
Conversas perdidas após atualização
Os dados estão na pasta Msty (Application Support no Mac, AppData no Windows, .config no Linux). Verifique se nenhum limpador de sistema esvaziou essa pasta. Fazer backup dessa pasta regularmente é uma boa prática.

#Para se aprofundar

De acordo com a direção que você quer seguir:

Comparar Msty com suas alternativas
« Ollama vs LM Studio vs Jan vs GPT4All » e « LM Studio vs Ollama : qual escolher em 2026 » dão o panorama completo das interfaces locais.
Levar o RAG além dos Knowledge Stacks
« RAG local com Ollama sem codificar (Open WebUI, AnythingLLM) » abrange as alternativas quando se ultrapassam as capacidades do RAG integrado do Msty.
Escolher o modelo certo para Msty
“Escolher a quantização (Q4, Q5, Q8, FP16)” ajuda a avaliar o compromisso entre qualidade e uso de VRAM no catálogo do Msty.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.