Intermediário 11 minPesquisa

Zotero + LLM local: resumir e consultar sua bibliographie

O Zotero centraliza suas referências e seus PDFs; um LLM local sabe lê-los e sintetizá-los. Ao conectar um ao outro, você obtém um assistente de pesquisa capaz de resumir um artigo, comparar vários artigos e preparar um estado da arte — sem nunca enviar seus trabalhos não publicados para a nuvem. Este guia mostra como montar essa cadeia Zotero + IA de ponta a ponta, com Ollama e um componente RAG.

Por Clara M.·Atualização 2026-08-27·Testado no Windows, macOS e Linux

#Por que conectar uma IA local ao Zotero

Um pesquisador acumula rapidamente centenas de artigos no Zotero, a maioria ainda não publicada, sob embargo ou protegida por uma cláusula de confidencialidade. Colar o PDF de um manuscrito em avaliação em um chatbot na nuvem é entregar seu conteúdo a um terceiro — às vezes para o treinamento dos modelos desse terceiro. Executar um LLM localmente resolve esse problema pela raiz: os arquivos permanecem no seu disco, a inferência ocorre na sua máquina, nada sai.

O interesse em usar o Zotero como IA de pesquisa não se limita à privacidade. Sua biblioteca já está estruturada: coleções por projeto, tags, metadados bem organizados, PDFs anotados. É uma base documental pronta para uso com um LLM. Em vez de baixar novamente e reorganizar artigos, conectamos o modelo diretamente ao que o Zotero já organizou.

Resumir
Obter em trinta segundos o objetivo, o método e os resultados de um artigo de vinte páginas, no seu idioma.
Consultar
Fazer uma pergunta e deixar o modelo buscar a resposta em toda uma coleção, não em um único PDF.
Comparar
Comparar os métodos ou os resultados de vários artigos para esboçar um panorama do estado da arte.
Privacidade
Processar manuscritos sob embargo ou dados de colaboradores sem cláusula de vazamento.
i
O que a IA local não substitui
Um LLM local faz você ganhar tempo de leitura, mas não dispensa o rigor. Ele produz rascunhos de síntese para serem relidos, não verdades para serem citadas tal como estão. A seção sobre limites explica em que ele ainda se engana.

#Como o Zotero e o LLM se comunicam

O kit RAG Local

Seus documentos, sua IA: um RAG local confiável para seus PDFs, notas e e-mails — sem enviar nada para a nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

O Zotero não “fala” nativamente com um modelo de linguagem. A ponte é feita por meio dos arquivos: o Zotero armazena cada PDF no seu disco, e é esse PDF que se fornece ao LLM para leitura. Duas grandes abordagens coexistem e são frequentemente combinadas.

Resumo sob demanda
Extraímos o texto de um PDF específico e o enviamos ao Ollama com uma instrução de síntese. Simples, rápido, ideal para um artigo por vez.
RAG na biblioteca
Indexamos uma pasta inteira de PDFs em uma base vetorial e depois fazemos consultas em linguagem natural. O modelo lê apenas os trechos relevantes, o que permite abranger dezenas de artigos.

Nos dois casos, o elemento central continua sendo a pasta de armazenamento do Zotero, onde estão todos os PDFs. O Zotero 7 também oferece uma API local (na porta 23119) que permite listar seus itens programaticamente, mas, para começar, apontar diretamente para os arquivos é a opção mais robusta e transparente.

#Pré-requisitos

Zotero 7
Com seus PDFs anexados às referências (não apenas os metadados). O leitor de PDF integrado não é obrigatório, mas os arquivos devem ser armazenados localmente.
Ollama
O daemon que serve os modelos, em http://localhost:11434 por padrão. Consultar o guia de instalação caso a instalação ainda não tenha sido feita.
Um modelo de síntese
Qwen 3.5 9B (≈6,6 GB de VRAM em Q4_K_M, contexto de 256k e visão) ou Mistral Small 24B para um francês excelente; um Qwen 3.5 4B (3,4 GB) é suficiente em uma configuração modesta.
Um modelo de embeddings
Para o RAG: nomic-embed-text ou mxbai-embed-large, que podem ser baixados via ollama pull. Leves, eles funcionam mesmo sem GPU.
Um componente RAG (opcional)
AnythingLLM ou Open WebUI se você quiser consultar toda a bibliografia sem programar.
Recuperar os modelos
# Modèle de synthèse (adaptez à votre VRAM)
ollama pull qwen3.5:9b

# Modèle d'embeddings pour le RAG
ollama pull nomic-embed-text
→
Escolher o tamanho de acordo com a GPU
Em Q4_K_M, considere cerca de 5 GB de VRAM para um 7B, 9 GB para um 14B e 19 GB para um 32B. Uma RTX 3060 de 12 GB executa um 14B confortavelmente; em um Mac com memória unificada, um 32B continua sendo viável.

#Etapa 1: encontrar seus PDFs no Zotero

O Zotero organiza cada anexo em uma subpasta do diretório storage, nomeada por uma chave de oito caracteres. Você não precisa entender essa estrutura em detalhes: basta saber onde ela está para apontar o LLM para ela.

Windows
C:\Users\<usuario>\Zotero\storage
macOS
~/Zotero/storage
Linux
~/Zotero/storage

Em caso de dúvida, o caminho exato é exibido no Zotero na opção Edição ▸ Configurações ▸ Avançado ▸ Arquivos e pastas ▸ "Diretório de dados". A pasta storage fica diretamente dentro desse diretório.

Para trabalhar de forma organizada em um projeto específico, o melhor é exportar uma coleção em vez de vasculhar todo o diretório storage. Clique com o botão direito em uma coleção ▸ « Exportar coleção »: o Zotero pode copiar os PDFs e uma bibliografia (BibTeX, CSV, JSON) para uma pasta dedicada, que você depois fornecerá ao LLM.

i
Extrair o texto, não a imagem
O LLM lê texto, não pixels. Um PDF “escaneado” sem camada de texto deverá passar primeiro por OCR (por exemplo, com o ocrmypdf). Os PDFs de editoras modernas já contêm uma camada de texto que pode ser utilizada diretamente.

#Etapa 2: resumir um artigo científico

O caso mais comum: você abre um artigo no Zotero e quer um resumo antes de decidir se ele merece uma leitura completa. O texto do PDF é extraído e depois enviado ao Ollama. A biblioteca pymupdf (fitz) faz a extração de forma limpa e rápida.

Dependências
pip install pymupdf requests
resumer_article.py
import sys, fitz, requests

def extraire_texte(pdf_path):
    doc = fitz.open(pdf_path)
    return "\n".join(page.get_text() for page in doc)

SYSTEM = (
    "Tu es un assistant de recherche. Tu résumes des articles "
    "scientifiques en français, avec rigueur, sans rien inventer. "
    "Tu t'appuies uniquement sur le texte fourni."
)

texte = extraire_texte(sys.argv[1])

resp = requests.post("http://localhost:11434/api/chat", json={
    "model": "qwen3.5:9b",
    "stream": False,
    "options": {"num_ctx": 16384, "temperature": 0.2},
    "messages": [
        {"role": "system", "content": SYSTEM},
        {"role": "user", "content": PROMPT + "\n\n---\n" + texte},
    ],
})

print(resp.json()["message"]["content"])

Chamamos a API REST do Ollama na porta 11434: ela separa a mensagem de sistema (o papel) do conteúdo (o artigo). Dois ajustes são importantes aqui — uma temperatura baixa (0,2) para limitar as invenções e um num_ctx grande o suficiente para processar um artigo inteiro sem truncá-lo.

!
A janela de contexto é seu limite intransponível
Um artigo de vinte páginas geralmente tem de 12 000 a 18 000 palavras. Se num_ctx for pequeno demais, o modelo verá apenas o início do PDF e resumirá cegamente o final. Verifique o contexto do modelo e aumente num_ctx se a VRAM comportar; caso contrário, divida o documento por seções.

#Um prompt de resumo confiável

A qualidade do resumo depende mais do prompt do que do modelo. Um prompt vago gera um parágrafo genérico; um prompt estruturado produz um fichamento reutilizável. O segredo: impor um formato em seções baseado na estrutura de um artigo científico e proibir o modelo de ir além do texto.

Prompt de fichamento
Rédige une fiche de lecture en français de l'article ci-dessous, en respectant EXACTEMENT ce format :

## Question de recherche
Ce que l'article cherche à établir, en une à deux phrases.

## Méthode
Données, protocole, modèles ou outils utilisés.

## Résultats principaux
- Une puce par résultat marquant, chiffré si l'article donne des chiffres.

## Limites annoncées
- Les limites que les auteurs reconnaissent eux-mêmes.

## À retenir pour mon état de l'art
Deux à trois phrases sur l'apport et le positionnement de l'article.

Règles :
- Ne reprends que ce qui est réellement écrit dans l'article.
- Si une section n'est pas renseignée dans le texte, écris « non précisé ».
- N'invente aucun chiffre, aucune référence, aucun nom d'auteur.
O formato imposto
Os títulos das seções obrigam o modelo a organizar as informações em vez de se alongar desnecessariamente. Você obtém a mesma estrutura de um artigo para outro, o que permite compará-los de relance.
A regra contra alucinações
« Use apenas o que está escrito » e « não especificado » reduzem o risco de o LLM inventar um resultado ou uma referência — o principal perigo em contexto científico.
A seção de estado da arte
Ao solicitar explicitamente o posicionamento, você transforma o resumo em matéria-prima diretamente reutilizável em uma revisão de literatura.
→
Sempre verifique os números na fonte
Mesmo com uma temperatura baixa e uma instrução rigorosa, um LLM pode transferir um número de uma linha para outra. Trate qualquer número do resumo como uma pista a ser confirmada no PDF antes de citá-lo.

#Etapa 3: consultar toda a sua bibliografia com RAG

Resumir um PDF é útil; consultar cinquenta artigos de uma só vez é o que transforma a preparação de uma revisão do estado da arte. Aí, passamos para o RAG (Retrieval-Augmented Generation): dividimos os PDFs em trechos, convertemos esses trechos em vetores com o modelo de embeddings e o LLM lê apenas os trechos relevantes para cada pergunta.

O mais simples, sem escrever código, é apontar AnythingLLM ou Open WebUI para o diretório exportado do Zotero (ou diretamente para storage). Essas ferramentas gerenciam a indexação e a base vetorial para você; basta escolher Ollama como fornecedor e nomic-embed-text como modelo de embeddings.

  1. 01
    Exportar a coleção
    No Zotero, exporte a coleção em questão com seus PDFs para uma pasta dedicada, por exemplo ~/recherche/etat-de-l-art.
  2. 02
    Criar um espaço de trabalho
    No AnythingLLM, crie um workspace e configure o provedor de LLM como Ollama (http://localhost:11434) e o modelo de embeddings como nomic-embed-text.
  3. 03
    Importar os documentos
    Arraste a pasta de PDFs para o workspace. A ferramenta extrai o texto, divide-o em trechos e o indexa automaticamente.
  4. 04
    Consultar em linguagem natural
    Faça perguntas que cruzem as fontes: « Quais métodos de avaliação aparecem com mais frequência? », « Quais artigos contradizem a hipótese X? ».

A grande vantagem do RAG em relação ao resumo simples: o modelo cita os trechos que usou. Você pode voltar ao PDF original para verificar, o que é essencial em pesquisas. Peça sempre ao modelo que indique de qual documento provém cada afirmação.

i
O RAG não lê « tudo »
Ao contrário de uma intuição comum, o RAG não faz o modelo ler os artigos na íntegra: ele recupera apenas os poucos trechos mais próximos da pergunta. Uma pergunta mal formulada recupera os trechos inadequados. Reformule se a resposta parecer não corresponder à pergunta.

#Limitações em artigos muito técnicos

É nesse ponto que é preciso ser honesto: em um artigo de matemática, física teórica ou ML muito formal, um LLM local mostra rapidamente suas limitações. Entender esses pontos cegos evita confiar nele nas situações erradas.

Os planos
A extração de texto achata as equações: subscritos, expoentes e símbolos gregos se misturam ou desaparecem. O modelo então raciocina sobre fórmulas corrompidas e pode tirar conclusões falsas.
As tabelas
Uma tabela vira uma sopa de números quando é extraída como texto puro. As correspondências entre linhas e colunas se perdem, portanto os números citados a partir de uma tabela são pouco confiáveis.
As figuras
Um modelo de texto não vê os gráficos. Qualquer resultado que exista apenas em uma figura passa completamente despercebido pelo modelo — ele não o mencionará ou o inventará a partir da legenda.
O raciocínio matemático
Seguir uma demonstração ou verificar uma derivação ultrapassa o que um modelo local de 14B consegue fazer de forma confiável. Ele parafraseia a prova sem validá-la.

Na prática: use o LLM para a camada "narrativa" de um artigo — questão de pesquisa, motivação, contribuições anunciadas, limitações, posicionamento. Mantenha a revisão humana de tudo o que envolve fórmulas, tabelas numéricas e figuras. Para artigos ricos em equações, um modelo multimodal capaz de ler as páginas como imagens (em vez do texto extraído) dá melhores resultados, mas continua sendo um complemento, não um substituto para sua leitura.

!
Nunca citar às cegas
Nunca copie um número, uma fórmula ou uma afirmação gerada pelo modelo sem localizar essa informação no PDF. O papel do LLM é orientar você e fazer uma análise preliminar, não substituir a verificação científica.

#Solução de problemas

O PDF aparece vazio
Trata-se de um documento digitalizado sem camada de texto. Processe-o com OCR (ocrmypdf entree.pdf sortie.pdf) antes da extração.
O resumo ignora o final do artigo
num_ctx é pequeno demais: o texto foi truncado. Aumente esse valor se a VRAM permitir; caso contrário, faça um resumo por seção e depois uma síntese dos resumos.
O RAG dá respostas que não correspondem à pergunta
Os trechos errados foram recuperados. Reformule a pergunta com os termos exatos do domínio ou reduza o tamanho dos chunks durante a indexação.
Respostas lentas
Um modelo 9B fica lento na CPU. Verifique se o Ollama está realmente usando a GPU, ou mude para um Qwen 3.5 4B (3,4 GB) para tarefas rotineiras de resumo.
Números que não correspondem ao PDF
Sintoma típico de uma tabela mal extraída ou de uma alucinação. Reduza a temperatura e, principalmente, confira os dados na fonte original.

#Para se aprofundar

Este guia se baseia em componentes já detalhados no site. Para se aprofundar especificamente na instalação ou no RAG:

Instalar o Ollama: Windows, macOS e Linux
O ponto de partida para servir seus modelos localmente na porta 11434, caso isso ainda não esteja configurado.
RAG local com Ollama sem codar (Open WebUI, AnythingLLM)
Guia de referência para montar o componente RAG que consulta toda a sua bibliografia, sem escrever uma linha de código.
RAG local com LM Studio: conversar com seus documentos
Uma alternativa completa se você preferir LM Studio à combinação de Ollama + interface separada.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.