Obsidian + LLM local: Copilot e Smart Connections com Ollama
O Obsidian armazena suas anotações em Markdown, em texto simples, no seu disco. É o ambiente ideal para um assistente de IA — desde que ele não envie todo o seu vault para a nuvem. Este guia conecta um LLM local usando a combinação obsidian + ollama: configuração do plugin Copilot, conversa com todas as suas anotações, busca semântica com Smart Connections e tudo isso com embeddings que permanecem na sua máquina.
#Por que conectar um LLM local ao Obsidian
Um vault Obsidian geralmente contém o que é mais pessoal: diário, anotações de reuniões, pesquisas, rascunhos. Enviar esse corpus para um serviço na nuvem para 'falar com suas anotações' equivale a confiar inteiramente sua segunda memória a um terceiro. Um LLM local resolve o problema na raiz: o modelo, os embeddings e o índice permanecem no seu disco.
Na prática, obsidian + ollama permite três usos: gerar e reformular texto diretamente no editor (autocompletar, resumir, traduzir), consultar todo o vault em linguagem natural (« o que anotei sobre o projeto X? ») e apresentar automaticamente as notas semanticamente próximas daquela que você está escrevendo. Dois plugins atendem a essas necessidades: Copilot para o chat e a geração, Smart Connections para a busca por similaridade.
- Privacidade
- Nenhuma nota, nenhum embedding sai da máquina. Ideal para um diário ou dados de clientes.
- Offline
- Funciona no trem ou no avião, depois que os modelos forem baixados.
- Custo nulo
- Sem assinatura nem cobrança por requisição, independentemente do volume de notas.
- Controle do modelo
- Você escolhe o tamanho, a quantização e o contexto de acordo com seu hardware.
#Pré-requisitos
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
A configuração se baseia em três componentes: Obsidian, Ollama como daemon local e um plugin comunitário. Nada mais é necessário — nem chave de API, nem conta.
- Obsidian 1.5+
- Versão desktop (Windows, macOS ou Linux). Os plugins comunitários não funcionam da mesma forma no mobile; este guia visa o desktop.
- Ollama instalado
- O daemon escuta por padrão em http://localhost:11434. Se o Ollama ainda não estiver instalado, consultar o guia de instalação do Ollama mencionado no final do artigo.
- Um modelo de chat
- Por exemplo, qwen3.5:9b com quantização Q4_K_M (≈6,6 GB de VRAM), a escolha de referência para 8 GB em 2026 (256k de contexto, visão).
- Um modelo de embeddings
- nomic-embed-text ou mxbai-embed-large, indispensáveis para conversar sobre o conteúdo do vault e para o Smart Connections.
- RAM/VRAM
- 8 GB de VRAM são suficientes para um modelo 9B moderno (Qwen 3.5 9B, ≈6,6 GB). Usando apenas a CPU, prefira um modelo de 2 a 3B (Qwen 3.5 2B ou Granite 4.2 3B) e tenha um pouco de paciência.
#Preparar Ollama para Obsidian
Antes de mexer no Obsidian, baixe os modelos e verifique se o daemon responde. O Ollama expõe uma API compatível com a API da OpenAI na porta 11434, que os plugins conseguem utilizar.
Um ponto específico sobre o Obsidian: os plugins rodam em um contexto de tipo navegador (Electron), e as requisições para Ollama podem ser bloqueadas pela política CORS. É necessário, portanto, autorizar o Obsidian para chamar a API. Defina a variável de ambiente OLLAMA_ORIGINS antes de iniciar o daemon.
#Configurar o plugin Copilot com o Ollama
Copilot (por logancyang) é o plugin de chat e geração mais completo para conectar um modelo local. Ele oferece tanto reformulação no editor quanto chat conversacional e o modo « Vault QA ». Veja o passo a passo da instalação.
- 01Instalar o pluginConfigurações → Módulos complementares de terceiros → Procurar, buscar «Copilot» (logancyang), instalar e ativar. Aceite primeiro o uso de plugins da comunidade, se o Obsidian solicitar.
- 02Abrir as configurações do CopilotEm Configurações → Copilot, na seção « Model ». O Copilot oferece provedores predefinidos; selecione Ollama como provedor para o chat.
- 03Informar a URL e o modeloBase URL: http://localhost:11434 . Nome do modelo de chat: qwen3.5:9b (exatamente a tag exibida pelo comando ollama list). Deixe a chave de API vazia, ela é desnecessária localmente.
- 04Configurar os embeddingsNa seção « Embedding Model », escolha novamente o Ollama como provedor e digite nomic-embed-text. Isso permitirá conversar por chat sobre todo o vault.
- 05TestarAbra o painel Copilot (ícone na barra lateral ou comando «Copilot: Open Chat») e faça uma pergunta simples. Uma resposta local confirma que a conexão está funcionando.
O Copilot também adiciona comandos contextuais: selecione um trecho, abra a paleta (Ctrl/Cmd+P) e execute “Copilot: Summarize”, “Simplify” ou “Translate”. O texto selecionado é enviado ao modelo local e a resposta é inserida ou exibida conforme o comando.
#Conversar com todo o seu vault localmente
O modo mais poderoso do Copilot é o « Vault QA » (também chamado de modo QA): em vez de conversar apenas com o modelo, você faz perguntas sobre suas anotações. Nos bastidores, o Copilot constrói um índice vetorial do seu vault com o modelo de embeddings, depois localiza os trechos relevantes e os inclui no prompt. É o RAG aplicado às suas anotações pessoais.
- 01Ativar o modo Vault QANo painel de chat Copilot, altere o seletor de modo de "Chat" para "Vault QA" (ou "QA")
- 02Construir o índiceExecute o comando « Copilot: Index (refresh) vault for QA ». O plugin percorre suas anotações e calcula os embeddings via Ollama. O tempo depende do tamanho do vault e do modelo.
- 03Fazer perguntas que cruzam informações de diferentes notasExemplos: "Resuma tudo que anotei sobre a arquitetura hexagonal" ou "Quais reuniões falaram sobre o orçamento do Q3?". As respostas citam as notas usadas como fontes.
- 04Reindexar após grandes mudançasO índice não é mágico: após adicionar muitas anotações, reinicie a indexação para que elas sejam consideradas.
#Smart Connections para encontrar suas notas relacionadas
Smart Connections (por Brian Petro) atende a uma necessidade diferente: em vez de fazer perguntas, exibe continuamente as notas semanticamente próximas daquela que você está editando. É um painel lateral dinâmico que revela conexões que você nunca teria feito manualmente — o equivalente a um recurso automático de « related notes », calculado por similaridade vetorial.
- 01Instalar Smart ConnectionsConfigurações → Módulos complementares de terceiros → Procurar, buscar «Smart Connections», instalar e ativar.
- 02Apontar os embeddings para OllamaNas configurações do plugin, na seção embeddings, escolha Ollama como adaptador, a URL http://localhost:11434 e o modelo nomic-embed-text (ou mxbai-embed-large para maior precisão).
- 03Deixar a indexação acontecerNa primeira execução, o Smart Connections calcula os embeddings de todas as suas anotações. O painel “Smart Connections” vai sendo preenchido à medida que você navega.
- 04Opcional: o chat SmartSmart Connections também inclui um modo de chat (Smart Chat) que se baseia nesses mesmos embeddings e pode usar seu modelo de chat Ollama para responder com base nas notas semelhantes.
A vantagem do Smart Connections em relação ao Copilot Vault QA: ele é passivo e contínuo. Você não precisa pedir nada; ao escrever uma nota sobre um assunto, as notas antigas relacionadas aparecem automaticamente, o que favorece descobertas inesperadas em um grande vault. Os dois plugins são complementares e podem compartilhar o mesmo modelo de embeddings Ollama.
#Modelos recomendados de acordo com o tamanho do vault
O modelo adequado depende primeiro do seu hardware, depois do volume de notas. Para geração de texto, um modelo moderno de 8 a 9 bilhões de parâmetros em Q4_K_M (Qwen 3.5 9B) oferece o melhor equilíbrio entre qualidade e VRAM para a maioria das configurações. Para embeddings, nomic-embed-text é leve e suficiente; mxbai-embed-large ganha em precisão em grandes vaults, mas com um índice mais pesado.
- Pequeno vault (< 500 notas)
- Chat: qwen3.5:9b (Q4, ≈6,6 GB VRAM). Embeddings: nomic-embed-text. Roda em uma RTX 3060 12GB.
- Vault médio (500–3000 notas)
- Chat: qwen3.5:9b. Embeddings: mxbai-embed-large para maior relevância dos links. RTX 4070/4080 confortáveis.
- Vault grande (> 3000 notas)
- Chat: Qwen 3.8 27B (qwen3.8:27b, ≈18 GB, 262k de contexto) para sínteses mais refinadas. Embeddings: mxbai-embed-large. RTX 4090 24GB ou Mac M4 Pro com memória unificada.
- Sem GPU (apenas CPU)
- Chat: um modelo de 2 a 3 bilhões (qwen3.5:2b, ≈1,9 GB, ou granite4.2:3b muito leve). Embeddings: nomic-embed-text, que continua rápido no CPU. Respostas mais lentas, mas utilizáveis.
- Mac Apple Silicon
- A memória unificada é um diferencial: um M4 Pro de 24 a 48 GB pode rodar um Qwen 3.8 27B e a indexação de embeddings sem problemas.
#Solução de problemas
A maioria dos problemas está ligada a três causas: CORS, nome de modelo incorreto ou o daemon Ollama parado. Veja como fazer uma triagem rápida.
- “Falha na conexão” / erro de rede
- OLLAMA_ORIGINS não inclui Obsidian. Adicione app://obsidian.md* e reinicie o daemon (não apenas Obsidian).
- « model not found »
- A tag inserida no plugin não corresponde. Verifique com o comando ollama list e copie o nome exato, incluindo a tag (qwen3.5:9b, não qwen3.5).
- Respostas vazias ou truncadas
- Contexto muito curto. Aumente num_ctx através de um Modelfile ou reduza o tamanho das notas enviadas.
- Indexação muito lenta
- O modelo de embeddings roda na CPU ou o vault é enorme. Verifique ollama ps; considere o nomic-embed-text, que é mais leve.
- Smart Connections vazio
- A construção do índice ainda não terminou, ou o adaptador aponta para um modelo de chat em vez de um modelo de embeddings.
#Para se aprofundar
Depois de conectar o Obsidian ao seu modelo local, estes guias do site ajudam a aperfeiçoar a stack e a entender seus componentes internos:
- Instalar o Ollama: Windows, macOS e Linux
- A base de toda a configuração: instalação limpa do daemon e gerenciamento dos modelos.
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Para equilibrar a qualidade da geração e a quantidade de VRAM disponível na sua placa.
- AnythingLLM: RAG local pronto para produção
- Se você quiser expandir o RAG além do Obsidian, com workspaces e API.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.