Zotero + LLM local: resumir e consultar sua bibliographie
O Zotero centraliza suas referências e seus PDFs; um LLM local sabe lê-los e sintetizá-los. Ao conectar um ao outro, você obtém um assistente de pesquisa capaz de resumir um artigo, comparar vários artigos e preparar um estado da arte — sem nunca enviar seus trabalhos não publicados para a nuvem. Este guia mostra como montar essa cadeia Zotero + IA de ponta a ponta, com Ollama e um componente RAG.
#Por que conectar uma IA local ao Zotero
Um pesquisador acumula rapidamente centenas de artigos no Zotero, a maioria ainda não publicada, sob embargo ou protegida por uma cláusula de confidencialidade. Colar o PDF de um manuscrito em avaliação em um chatbot na nuvem é entregar seu conteúdo a um terceiro — às vezes para o treinamento dos modelos desse terceiro. Executar um LLM localmente resolve esse problema pela raiz: os arquivos permanecem no seu disco, a inferência ocorre na sua máquina, nada sai.
O interesse em usar o Zotero como IA de pesquisa não se limita à privacidade. Sua biblioteca já está estruturada: coleções por projeto, tags, metadados bem organizados, PDFs anotados. É uma base documental pronta para uso com um LLM. Em vez de baixar novamente e reorganizar artigos, conectamos o modelo diretamente ao que o Zotero já organizou.
- Resumir
- Obter em trinta segundos o objetivo, o método e os resultados de um artigo de vinte páginas, no seu idioma.
- Consultar
- Fazer uma pergunta e deixar o modelo buscar a resposta em toda uma coleção, não em um único PDF.
- Comparar
- Comparar os métodos ou os resultados de vários artigos para esboçar um panorama do estado da arte.
- Privacidade
- Processar manuscritos sob embargo ou dados de colaboradores sem cláusula de vazamento.
#Como o Zotero e o LLM se comunicam
Seus documentos, sua IA: um RAG local confiável para seus PDFs, notas e e-mails — sem enviar nada para a nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
O Zotero não “fala” nativamente com um modelo de linguagem. A ponte é feita por meio dos arquivos: o Zotero armazena cada PDF no seu disco, e é esse PDF que se fornece ao LLM para leitura. Duas grandes abordagens coexistem e são frequentemente combinadas.
- Resumo sob demanda
- Extraímos o texto de um PDF específico e o enviamos ao Ollama com uma instrução de síntese. Simples, rápido, ideal para um artigo por vez.
- RAG na biblioteca
- Indexamos uma pasta inteira de PDFs em uma base vetorial e depois fazemos consultas em linguagem natural. O modelo lê apenas os trechos relevantes, o que permite abranger dezenas de artigos.
Nos dois casos, o elemento central continua sendo a pasta de armazenamento do Zotero, onde estão todos os PDFs. O Zotero 7 também oferece uma API local (na porta 23119) que permite listar seus itens programaticamente, mas, para começar, apontar diretamente para os arquivos é a opção mais robusta e transparente.
#Pré-requisitos
- Zotero 7
- Com seus PDFs anexados às referências (não apenas os metadados). O leitor de PDF integrado não é obrigatório, mas os arquivos devem ser armazenados localmente.
- Ollama
- O daemon que serve os modelos, em http://localhost:11434 por padrão. Consultar o guia de instalação caso a instalação ainda não tenha sido feita.
- Um modelo de síntese
- Qwen 3.5 9B (≈6,6 GB de VRAM em Q4_K_M, contexto de 256k e visão) ou Mistral Small 24B para um francês excelente; um Qwen 3.5 4B (3,4 GB) é suficiente em uma configuração modesta.
- Um modelo de embeddings
- Para o RAG: nomic-embed-text ou mxbai-embed-large, que podem ser baixados via ollama pull. Leves, eles funcionam mesmo sem GPU.
- Um componente RAG (opcional)
- AnythingLLM ou Open WebUI se você quiser consultar toda a bibliografia sem programar.
#Etapa 1: encontrar seus PDFs no Zotero
O Zotero organiza cada anexo em uma subpasta do diretório storage, nomeada por uma chave de oito caracteres. Você não precisa entender essa estrutura em detalhes: basta saber onde ela está para apontar o LLM para ela.
- Windows
- C:\Users\<usuario>\Zotero\storage
- macOS
- ~/Zotero/storage
- Linux
- ~/Zotero/storage
Em caso de dúvida, o caminho exato é exibido no Zotero na opção Edição ▸ Configurações ▸ Avançado ▸ Arquivos e pastas ▸ "Diretório de dados". A pasta storage fica diretamente dentro desse diretório.
Para trabalhar de forma organizada em um projeto específico, o melhor é exportar uma coleção em vez de vasculhar todo o diretório storage. Clique com o botão direito em uma coleção ▸ « Exportar coleção »: o Zotero pode copiar os PDFs e uma bibliografia (BibTeX, CSV, JSON) para uma pasta dedicada, que você depois fornecerá ao LLM.
#Etapa 2: resumir um artigo científico
O caso mais comum: você abre um artigo no Zotero e quer um resumo antes de decidir se ele merece uma leitura completa. O texto do PDF é extraído e depois enviado ao Ollama. A biblioteca pymupdf (fitz) faz a extração de forma limpa e rápida.
Chamamos a API REST do Ollama na porta 11434: ela separa a mensagem de sistema (o papel) do conteúdo (o artigo). Dois ajustes são importantes aqui — uma temperatura baixa (0,2) para limitar as invenções e um num_ctx grande o suficiente para processar um artigo inteiro sem truncá-lo.
#Um prompt de resumo confiável
A qualidade do resumo depende mais do prompt do que do modelo. Um prompt vago gera um parágrafo genérico; um prompt estruturado produz um fichamento reutilizável. O segredo: impor um formato em seções baseado na estrutura de um artigo científico e proibir o modelo de ir além do texto.
- O formato imposto
- Os títulos das seções obrigam o modelo a organizar as informações em vez de se alongar desnecessariamente. Você obtém a mesma estrutura de um artigo para outro, o que permite compará-los de relance.
- A regra contra alucinações
- « Use apenas o que está escrito » e « não especificado » reduzem o risco de o LLM inventar um resultado ou uma referência — o principal perigo em contexto científico.
- A seção de estado da arte
- Ao solicitar explicitamente o posicionamento, você transforma o resumo em matéria-prima diretamente reutilizável em uma revisão de literatura.
#Etapa 3: consultar toda a sua bibliografia com RAG
Resumir um PDF é útil; consultar cinquenta artigos de uma só vez é o que transforma a preparação de uma revisão do estado da arte. Aí, passamos para o RAG (Retrieval-Augmented Generation): dividimos os PDFs em trechos, convertemos esses trechos em vetores com o modelo de embeddings e o LLM lê apenas os trechos relevantes para cada pergunta.
O mais simples, sem escrever código, é apontar AnythingLLM ou Open WebUI para o diretório exportado do Zotero (ou diretamente para storage). Essas ferramentas gerenciam a indexação e a base vetorial para você; basta escolher Ollama como fornecedor e nomic-embed-text como modelo de embeddings.
- 01Exportar a coleçãoNo Zotero, exporte a coleção em questão com seus PDFs para uma pasta dedicada, por exemplo ~/recherche/etat-de-l-art.
- 02Criar um espaço de trabalhoNo AnythingLLM, crie um workspace e configure o provedor de LLM como Ollama (http://localhost:11434) e o modelo de embeddings como nomic-embed-text.
- 03Importar os documentosArraste a pasta de PDFs para o workspace. A ferramenta extrai o texto, divide-o em trechos e o indexa automaticamente.
- 04Consultar em linguagem naturalFaça perguntas que cruzem as fontes: « Quais métodos de avaliação aparecem com mais frequência? », « Quais artigos contradizem a hipótese X? ».
A grande vantagem do RAG em relação ao resumo simples: o modelo cita os trechos que usou. Você pode voltar ao PDF original para verificar, o que é essencial em pesquisas. Peça sempre ao modelo que indique de qual documento provém cada afirmação.
#Limitações em artigos muito técnicos
É nesse ponto que é preciso ser honesto: em um artigo de matemática, física teórica ou ML muito formal, um LLM local mostra rapidamente suas limitações. Entender esses pontos cegos evita confiar nele nas situações erradas.
- Os planos
- A extração de texto achata as equações: subscritos, expoentes e símbolos gregos se misturam ou desaparecem. O modelo então raciocina sobre fórmulas corrompidas e pode tirar conclusões falsas.
- As tabelas
- Uma tabela vira uma sopa de números quando é extraída como texto puro. As correspondências entre linhas e colunas se perdem, portanto os números citados a partir de uma tabela são pouco confiáveis.
- As figuras
- Um modelo de texto não vê os gráficos. Qualquer resultado que exista apenas em uma figura passa completamente despercebido pelo modelo — ele não o mencionará ou o inventará a partir da legenda.
- O raciocínio matemático
- Seguir uma demonstração ou verificar uma derivação ultrapassa o que um modelo local de 14B consegue fazer de forma confiável. Ele parafraseia a prova sem validá-la.
Na prática: use o LLM para a camada "narrativa" de um artigo — questão de pesquisa, motivação, contribuições anunciadas, limitações, posicionamento. Mantenha a revisão humana de tudo o que envolve fórmulas, tabelas numéricas e figuras. Para artigos ricos em equações, um modelo multimodal capaz de ler as páginas como imagens (em vez do texto extraído) dá melhores resultados, mas continua sendo um complemento, não um substituto para sua leitura.
#Solução de problemas
- O PDF aparece vazio
- Trata-se de um documento digitalizado sem camada de texto. Processe-o com OCR (ocrmypdf entree.pdf sortie.pdf) antes da extração.
- O resumo ignora o final do artigo
- num_ctx é pequeno demais: o texto foi truncado. Aumente esse valor se a VRAM permitir; caso contrário, faça um resumo por seção e depois uma síntese dos resumos.
- O RAG dá respostas que não correspondem à pergunta
- Os trechos errados foram recuperados. Reformule a pergunta com os termos exatos do domínio ou reduza o tamanho dos chunks durante a indexação.
- Respostas lentas
- Um modelo 9B fica lento na CPU. Verifique se o Ollama está realmente usando a GPU, ou mude para um Qwen 3.5 4B (3,4 GB) para tarefas rotineiras de resumo.
- Números que não correspondem ao PDF
- Sintoma típico de uma tabela mal extraída ou de uma alucinação. Reduza a temperatura e, principalmente, confira os dados na fonte original.
#Para se aprofundar
Este guia se baseia em componentes já detalhados no site. Para se aprofundar especificamente na instalação ou no RAG:
- Instalar o Ollama: Windows, macOS e Linux
- O ponto de partida para servir seus modelos localmente na porta 11434, caso isso ainda não esteja configurado.
- RAG local com Ollama sem codar (Open WebUI, AnythingLLM)
- Guia de referência para montar o componente RAG que consulta toda a sua bibliografia, sem escrever uma linha de código.
- RAG local com LM Studio: conversar com seus documentos
- Uma alternativa completa se você preferir LM Studio à combinação de Ollama + interface separada.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.