Intermediário 11 minObsidian

Obsidian + LLM local: Copilot e Smart Connections com Ollama

O Obsidian armazena suas anotações em Markdown, em texto simples, no seu disco. É o ambiente ideal para um assistente de IA — desde que ele não envie todo o seu vault para a nuvem. Este guia conecta um LLM local usando a combinação obsidian + ollama: configuração do plugin Copilot, conversa com todas as suas anotações, busca semântica com Smart Connections e tudo isso com embeddings que permanecem na sua máquina.

Por Léa B.·Atualização 2026-08-27·Testado no Windows, macOS e Linux

#Por que conectar um LLM local ao Obsidian

Um vault Obsidian geralmente contém o que é mais pessoal: diário, anotações de reuniões, pesquisas, rascunhos. Enviar esse corpus para um serviço na nuvem para 'falar com suas anotações' equivale a confiar inteiramente sua segunda memória a um terceiro. Um LLM local resolve o problema na raiz: o modelo, os embeddings e o índice permanecem no seu disco.

Na prática, obsidian + ollama permite três usos: gerar e reformular texto diretamente no editor (autocompletar, resumir, traduzir), consultar todo o vault em linguagem natural (« o que anotei sobre o projeto X? ») e apresentar automaticamente as notas semanticamente próximas daquela que você está escrevendo. Dois plugins atendem a essas necessidades: Copilot para o chat e a geração, Smart Connections para a busca por similaridade.

Privacidade
Nenhuma nota, nenhum embedding sai da máquina. Ideal para um diário ou dados de clientes.
Offline
Funciona no trem ou no avião, depois que os modelos forem baixados.
Custo nulo
Sem assinatura nem cobrança por requisição, independentemente do volume de notas.
Controle do modelo
Você escolhe o tamanho, a quantização e o contexto de acordo com seu hardware.

#Pré-requisitos

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

A configuração se baseia em três componentes: Obsidian, Ollama como daemon local e um plugin comunitário. Nada mais é necessário — nem chave de API, nem conta.

Obsidian 1.5+
Versão desktop (Windows, macOS ou Linux). Os plugins comunitários não funcionam da mesma forma no mobile; este guia visa o desktop.
Ollama instalado
O daemon escuta por padrão em http://localhost:11434. Se o Ollama ainda não estiver instalado, consultar o guia de instalação do Ollama mencionado no final do artigo.
Um modelo de chat
Por exemplo, qwen3.5:9b com quantização Q4_K_M (≈6,6 GB de VRAM), a escolha de referência para 8 GB em 2026 (256k de contexto, visão).
Um modelo de embeddings
nomic-embed-text ou mxbai-embed-large, indispensáveis para conversar sobre o conteúdo do vault e para o Smart Connections.
RAM/VRAM
8 GB de VRAM são suficientes para um modelo 9B moderno (Qwen 3.5 9B, ≈6,6 GB). Usando apenas a CPU, prefira um modelo de 2 a 3B (Qwen 3.5 2B ou Granite 4.2 3B) e tenha um pouco de paciência.
i
Chat ≠ embeddings
Dois modelos distintos entram em jogo. O modelo de chat gera as respostas; o modelo de embeddings transforma suas anotações em vetores para a pesquisa. Não configure um modelo de chat onde um modelo de embeddings é esperado, e vice-versa — é o erro mais comum.

#Preparar Ollama para Obsidian

Antes de mexer no Obsidian, baixe os modelos e verifique se o daemon responde. O Ollama expõe uma API compatível com a API da OpenAI na porta 11434, que os plugins conseguem utilizar.

Terminal
# Modèle de chat (généraliste, ~6,6 Go en Q4)
ollama pull qwen3.5:9b

# Modèle d'embeddings (obligatoire pour le RAG)
ollama pull nomic-embed-text

# Vérifier que le daemon tourne
ollama ps

Um ponto específico sobre o Obsidian: os plugins rodam em um contexto de tipo navegador (Electron), e as requisições para Ollama podem ser bloqueadas pela política CORS. É necessário, portanto, autorizar o Obsidian para chamar a API. Defina a variável de ambiente OLLAMA_ORIGINS antes de iniciar o daemon.

Linux / macOS
# Autoriser les origines Obsidian (app://) et relancer Ollama
export OLLAMA_ORIGINS="app://obsidian.md*"
ollama serve
Windows (PowerShell)
# Définir la variable puis relancer Ollama
setx OLLAMA_ORIGINS "app://obsidian.md*"
# Quitter Ollama depuis la barre système, puis le relancer
!
CORS: a causa número 1 dos 'conexões falhadas'
Se Copilot ou Smart Connections exibir um erro de rede enquanto ollama ps funciona, quase sempre falta OLLAMA_ORIGINS. No macOS com o aplicativo Ollama, use launchctl setenv OLLAMA_ORIGINS "app://obsidian.md*" e depois reinicie o aplicativo.

#Configurar o plugin Copilot com o Ollama

Copilot (por logancyang) é o plugin de chat e geração mais completo para conectar um modelo local. Ele oferece tanto reformulação no editor quanto chat conversacional e o modo « Vault QA ». Veja o passo a passo da instalação.

  1. 01
    Instalar o plugin
    Configurações → Módulos complementares de terceiros → Procurar, buscar «Copilot» (logancyang), instalar e ativar. Aceite primeiro o uso de plugins da comunidade, se o Obsidian solicitar.
  2. 02
    Abrir as configurações do Copilot
    Em Configurações → Copilot, na seção « Model ». O Copilot oferece provedores predefinidos; selecione Ollama como provedor para o chat.
  3. 03
    Informar a URL e o modelo
    Base URL: http://localhost:11434 . Nome do modelo de chat: qwen3.5:9b (exatamente a tag exibida pelo comando ollama list). Deixe a chave de API vazia, ela é desnecessária localmente.
  4. 04
    Configurar os embeddings
    Na seção « Embedding Model », escolha novamente o Ollama como provedor e digite nomic-embed-text. Isso permitirá conversar por chat sobre todo o vault.
  5. 05
    Testar
    Abra o painel Copilot (ícone na barra lateral ou comando «Copilot: Open Chat») e faça uma pergunta simples. Uma resposta local confirma que a conexão está funcionando.

O Copilot também adiciona comandos contextuais: selecione um trecho, abra a paleta (Ctrl/Cmd+P) e execute “Copilot: Summarize”, “Simplify” ou “Translate”. O texto selecionado é enviado ao modelo local e a resposta é inserida ou exibida conforme o comando.

→
Janela de contexto
Para resumir notas longas, aumente o contexto do modelo. Crie um Modelfile com PARAMETER num_ctx 8192 (ou mais) e recrie o modelo via ollama create. Um contexto muito curto trunca silenciosamente suas notas antes mesmo de o modelo lê-las.

#Conversar com todo o seu vault localmente

O modo mais poderoso do Copilot é o « Vault QA » (também chamado de modo QA): em vez de conversar apenas com o modelo, você faz perguntas sobre suas anotações. Nos bastidores, o Copilot constrói um índice vetorial do seu vault com o modelo de embeddings, depois localiza os trechos relevantes e os inclui no prompt. É o RAG aplicado às suas anotações pessoais.

  1. 01
    Ativar o modo Vault QA
    No painel de chat Copilot, altere o seletor de modo de "Chat" para "Vault QA" (ou "QA")
  2. 02
    Construir o índice
    Execute o comando « Copilot: Index (refresh) vault for QA ». O plugin percorre suas anotações e calcula os embeddings via Ollama. O tempo depende do tamanho do vault e do modelo.
  3. 03
    Fazer perguntas que cruzam informações de diferentes notas
    Exemplos: "Resuma tudo que anotei sobre a arquitetura hexagonal" ou "Quais reuniões falaram sobre o orçamento do Q3?". As respostas citam as notas usadas como fontes.
  4. 04
    Reindexar após grandes mudanças
    O índice não é mágico: após adicionar muitas anotações, reinicie a indexação para que elas sejam consideradas.
i
O índice permanece local
O índice vetorial é armazenado no diretório de configuração do plugin, dentro do seu vault. Nada é enviado para fora: os embeddings são calculados por Ollama na sua máquina e gravados em seu disco.

#Smart Connections para encontrar suas notas relacionadas

Smart Connections (por Brian Petro) atende a uma necessidade diferente: em vez de fazer perguntas, exibe continuamente as notas semanticamente próximas daquela que você está editando. É um painel lateral dinâmico que revela conexões que você nunca teria feito manualmente — o equivalente a um recurso automático de « related notes », calculado por similaridade vetorial.

  1. 01
    Instalar Smart Connections
    Configurações → Módulos complementares de terceiros → Procurar, buscar «Smart Connections», instalar e ativar.
  2. 02
    Apontar os embeddings para Ollama
    Nas configurações do plugin, na seção embeddings, escolha Ollama como adaptador, a URL http://localhost:11434 e o modelo nomic-embed-text (ou mxbai-embed-large para maior precisão).
  3. 03
    Deixar a indexação acontecer
    Na primeira execução, o Smart Connections calcula os embeddings de todas as suas anotações. O painel “Smart Connections” vai sendo preenchido à medida que você navega.
  4. 04
    Opcional: o chat Smart
    Smart Connections também inclui um modo de chat (Smart Chat) que se baseia nesses mesmos embeddings e pode usar seu modelo de chat Ollama para responder com base nas notas semelhantes.

A vantagem do Smart Connections em relação ao Copilot Vault QA: ele é passivo e contínuo. Você não precisa pedir nada; ao escrever uma nota sobre um assunto, as notas antigas relacionadas aparecem automaticamente, o que favorece descobertas inesperadas em um grande vault. Os dois plugins são complementares e podem compartilhar o mesmo modelo de embeddings Ollama.


#Modelos recomendados de acordo com o tamanho do vault

O modelo adequado depende primeiro do seu hardware, depois do volume de notas. Para geração de texto, um modelo moderno de 8 a 9 bilhões de parâmetros em Q4_K_M (Qwen 3.5 9B) oferece o melhor equilíbrio entre qualidade e VRAM para a maioria das configurações. Para embeddings, nomic-embed-text é leve e suficiente; mxbai-embed-large ganha em precisão em grandes vaults, mas com um índice mais pesado.

Pequeno vault (< 500 notas)
Chat: qwen3.5:9b (Q4, ≈6,6 GB VRAM). Embeddings: nomic-embed-text. Roda em uma RTX 3060 12GB.
Vault médio (500–3000 notas)
Chat: qwen3.5:9b. Embeddings: mxbai-embed-large para maior relevância dos links. RTX 4070/4080 confortáveis.
Vault grande (> 3000 notas)
Chat: Qwen 3.8 27B (qwen3.8:27b, ≈18 GB, 262k de contexto) para sínteses mais refinadas. Embeddings: mxbai-embed-large. RTX 4090 24GB ou Mac M4 Pro com memória unificada.
Sem GPU (apenas CPU)
Chat: um modelo de 2 a 3 bilhões (qwen3.5:2b, ≈1,9 GB, ou granite4.2:3b muito leve). Embeddings: nomic-embed-text, que continua rápido no CPU. Respostas mais lentas, mas utilizáveis.
Mac Apple Silicon
A memória unificada é um diferencial: um M4 Pro de 24 a 48 GB pode rodar um Qwen 3.8 27B e a indexação de embeddings sem problemas.
→
Coerência dos embeddings
Não troque de modelo de embeddings sem avaliar as consequências: os vetores de um modelo não são comparáveis aos de outro. Se você passar de nomic-embed-text para mxbai-embed-large, será necessário reindexar todo o vault; caso contrário, as similaridades se tornarão incoerentes.

#Solução de problemas

A maioria dos problemas está ligada a três causas: CORS, nome de modelo incorreto ou o daemon Ollama parado. Veja como fazer uma triagem rápida.

“Falha na conexão” / erro de rede
OLLAMA_ORIGINS não inclui Obsidian. Adicione app://obsidian.md* e reinicie o daemon (não apenas Obsidian).
« model not found »
A tag inserida no plugin não corresponde. Verifique com o comando ollama list e copie o nome exato, incluindo a tag (qwen3.5:9b, não qwen3.5).
Respostas vazias ou truncadas
Contexto muito curto. Aumente num_ctx através de um Modelfile ou reduza o tamanho das notas enviadas.
Indexação muito lenta
O modelo de embeddings roda na CPU ou o vault é enorme. Verifique ollama ps; considere o nomic-embed-text, que é mais leve.
Smart Connections vazio
A construção do índice ainda não terminou, ou o adaptador aponta para um modelo de chat em vez de um modelo de embeddings.
Terminal
# Vérifier les modèles disponibles et leurs tags exacts
ollama list

# Confirmer que le daemon répond et voir ce qui est chargé en mémoire
ollama ps

# Test brut de l'API embeddings (doit renvoyer un vecteur)
curl http://localhost:11434/api/embeddings -d '{
  "model": "nomic-embed-text",
  "prompt": "note de test"
}'

#Para se aprofundar

Depois de conectar o Obsidian ao seu modelo local, estes guias do site ajudam a aperfeiçoar a stack e a entender seus componentes internos:

Instalar o Ollama: Windows, macOS e Linux
A base de toda a configuração: instalação limpa do daemon e gerenciamento dos modelos.
Escolher sua quantização (Q4, Q5, Q8, FP16)
Para equilibrar a qualidade da geração e a quantidade de VRAM disponível na sua placa.
AnythingLLM: RAG local pronto para produção
Se você quiser expandir o RAG além do Obsidian, com workspaces e API.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.