Intermediário 15 minEdge

LLM no Raspberry Pi 5: IA local embarcada

Rodar um LLM em um Raspberry Pi parecia uma piada há dois anos. Com o Pi 5 de 8 GB, seu SoC BCM2712 com quatro núcleos Cortex-A76 a 2,4 GHz e a onda de pequenos modelos de 2–4B lançados em 2026, isso se tornou uma aplicação real. Este guia mostra como instalar o Ollama no Raspberry Pi, mede a taxa de tokens por segundo no Qwen 3.5 2B, no Granite 4.2 3B e no Qwen 3.5 4B e mostra os casos em que um LLM embarcado faz sentido.

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux

#Por que usar um LLM no Raspberry Pi?

Um Raspberry Pi 5 não vai substituir sua RTX 4090. O objetivo não é a velocidade bruta, mas o uso em sistemas embarcados: uma placa de 80 € que consome 5-12 W, cabe em um gabinete do tamanho de um cartão de crédito e funciona 24 horas por dia sem barulho. Para casos de uso de computação de borda — assistente de voz local, estação meteorológica inteligente, quiosque offline, robô móvel — isso é suficiente e incomparavelmente mais barato que um mini-PC.

Outro ponto forte: a privacidade absoluta. Nenhum dado sai da rede local. Você pode montar um assistente familiar no quarto de uma criança sem nuvem, sem telemetria, sem assinatura.

i
Em resumo
Pi 5 + Ollama + um modelo de 2 a 4 bilhões de parâmetros quantizado em Q4 = um assistente local que responde a uma velocidade de 2 a 4 tokens por segundo. Lento, mas autônomo, silencioso e com um custo de hardware marginal.

#Pré-requisitos de hardware

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias
Raspberry Pi 5 (8 GB obrigatórios)
A versão de 4 GB consegue rodar Qwen 3.5 2B, mas não dá conta de modelos maiores. A de 8 GB é o mínimo confortável. A de 16 GB (lançada no fim de 2024) permite rodar Qwen 3.5 4B sem swap.
Cartão microSD A2 ou SSD NVMe
Uma SD A1 atrasa muito o carregamento inicial do modelo. Idealmente, SSD NVMe via o HAT M.2 oficial — banda passante de 500+ MB/s, carregamento Qwen 3.5 4B em 4 segundos contra 30 segundos em SD.
Fonte de alimentação oficial de 27 W
A Pi 5 durante a inferência consome 9-12 W. A fonte de alimentação oficial USB-C de 5 V/5 A é obrigatória para evitar o throttling. Uma fonte genérica de 15 W fornece tensão insuficiente à placa.
Resfriamento ativo
Indispensável. O SoC reduz o desempenho por limitação térmica a partir de 80 °C. O ventilador oficial (5 €) ou um gabinete Argon ONE V3 é suficiente. Sem dissipador, você perde 30-40% da taxa de geração após 2 minutos de inferência.
Pi OS 64-bit (Bookworm)
Raspberry Pi OS de 64 bits baseado no Debian 12. Ollama não oferece suporte a 32 bits. Verifique com uname -m → deve retornar aarch64.
!
Sem GPU utilizável
O VideoCore VII da Pi 5 não possui suporte oficial para inferência LLM (sem backend Vulkan estável, sem drivers ML maduros). Tudo roda nos 4 núcleos CPU ARM. Essa é a principal limitação.

#1. Instalar Ollama no Pi 5

Ollama suporta oficialmente Linux/arm64 desde 2024. O script de instalação universal funciona diretamente no Pi OS, sem necessidade de compilação manual.

Instalação Ollama (1 linha)
curl -fsSL https://ollama.com/install.sh | sh

O script baixa o binário ARM64 (~150 MB), instala um serviço systemd e inicia o daemon na porta 11434. Preveja de 1 a 2 minutos.

Verificar se o serviço está rodando
systemctl status ollama
ollama --version
→
Acesso via rede local
Por padrão Ollama escuta em 127.0.0.1:11434. Para usá-lo a partir de outro dispositivo da rede local (telefone, laptop), edite /etc/systemd/system/ollama.service e adicione Environment="OLLAMA_HOST=0.0.0.0:11434". Em seguida, execute sudo systemctl daemon-reload && sudo systemctl restart ollama.

#2. Modelos recomendados para Raspberry Pi

No Pi 5 com 8 GB, você tem aproximadamente 6,5 GB de RAM realmente utilizável (o sistema e seu cache ocupam o restante). Todo LLM que ultrapasse 4 a 5 GB em quantização Q4 é inutilizável — ele vai usar swap na microSD e cair para 0,1 tok/s.

Três modelos apresentam os melhores resultados no Pi 5 em agosto de 2026:

Qwen 3.5 2B (Alibaba, Apache 2.0)
O melhor no equilíbrio entre desempenho e RAM. 1,9 GB em Q4_K_M, multimodal, 256k de contexto, excelente em conversas curtas e em francês. Ideal para assistente simples ou comando vocal.
Granite 4.2 3B (IBM, Apache 2.0)
Consome muito poucos recursos e usa os tokens com eficiência. 2,2 GB em Q4_K_M. Um nível acima em qualidade de raciocínio, feito para rodar 24 horas por dia sem saturar a RAM. Sólido em múltiplos idiomas.
Qwen 3.5 4B (Alibaba, Apache 2.0)
O novo 'modelo pequeno padrão' e o mais capaz dos três. 3,4 GB em Q4_K_M. Cabe na RAM do Pi 5 com 8 GB, mas sobra pouca margem — evite executar interfaces gráficas pesadas em paralelo.
Baixar os três modelos
ollama pull qwen3.5:2b
ollama pull granite4.2:3b
ollama pull qwen3.5:4b
i
Por que não gpt-oss 20B ou Mistral Small 24B?
Esses modelos ocupam ~14 GB em Q4 e não cabem nos 6,5 GB realmente utilizáveis de um Pi 5 com 8 GB. Mesmo um Pi com 16 GB precisaria recorrer ao swap, ficando em 0,3-0,5 tok/s — inviável para uso. Fique abaixo de 4B no Pi; esses modelos precisam de um Mac ou de uma GPU.

#3. Benchmarks tokens/sec (ordens de grandeza)

Ordens de grandeza observadas em Raspberry Pi 5 8 GB, cooler ativo oficial, SSD NVMe via HAT M.2, Pi OS Bookworm de 64 bits, Ollama recente, quantização Q4_K_M, prompt de geração de 200 tokens. Os valores variam conforme a versão do Ollama e as condições térmicas — considere-os como ordens de grandeza, não como valores absolutos.

Qwen 3.5 2B Q4_K_M
≈ 4,4 tokens/s de geração · 6,6 tok/s de avaliação de prompt · 1,9 GB de RAM · 9,6 W
Granite 4.2 3B Q4_K_M
≈ 3,4 tokens/s de geração · 5,1 tok/s de avaliação de prompt · 2,2 GB de RAM · 10,2 W
Qwen 3.5 4B Q4_K_M
≈ 2,3 tokens/s de geração · 3,6 tok/s de avaliação de prompt · 3,4 GB de RAM · 11,2 W
Gemma 4 E2B (referência multimodal)
≈ 3,9 tokens/seg · 4,3 GB de RAM · 10,4 W. MoE rápido, mas com maior consumo de RAM.
Granite 4.2 3B Q3_K_S (versão econômica)
≈ 3,6 tokens/s · 1,7 GB de RAM · 9,9 W. O mais leve do grupo, ideal se a RAM for limitada (Pi de 4 GB).
→
Interpretar esses números
A uma taxa de 5 tok/s, uma resposta de 80 palavras leva entre 20 e 25 segundos. Isso é mais lento que um assistente de nuvem, mas amplamente suficiente para casos não interativos (notificações, resumos em lote, controle vocal assíncrono).
Reproduzir esses benchmarks em casa
ollama run qwen3.5:2b --verbose "Explique en 100 mots ce qu'est un Raspberry Pi."

A opção --verbose exibe ao final da geração: eval rate (tok/s), prompt eval rate, total duration. É a medida oficial para comparar.

#4. Casos de uso offline relevantes

A 2-5 tok/s, a inferência no Pi não é voltada para chat em tempo real. Os casos em que ela se destaca são aqueles em que a latência não é crítica ou em que a confidencialidade e a autonomia são mais importantes que a velocidade.

Assistente de voz local
Pi 5 + microfone USB + Whisper.cpp tiny + Qwen 3.5 2B + Piper TTS. Pergunta → transcrição → resposta → voz sintetizada, tudo em 8 a 12 segundos sem nuvem. Domótica offline, quiosque infantil, robô educativo.
Resumo de e-mails ou notícias em lote
Tarefa cron que, a cada hora, busca os feeds RSS, resume com Qwen 3.5 4B e envia para Telegram/Matrix. A latência de inferência passa despercebida quando a execução é assíncrona.
Classificação de logs ou tickets
Pi na borda da rede que classifica os logs recebidos ('erro crítico', 'spam', 'normal') antes de enviá-los a um servidor central. Economiza largura de banda WAN.
Demonstração embarcada/portátil
Apresentação para cliente, oficina escolar, conferência: Pi 5 no bolso, bateria USB-C, demonstração de IA local 100% autônoma.
Mecanismo de proteção para outros LLMs
Modelo local pequeno que filtra ou reformula um prompt antes de enviá-lo para um LLM na nuvem. Útil para anonimizar dados sensíveis no edge.
!
Casos em que a Pi não é suficiente
RAG em mais de 50 documentos, geração de código longo, agentes com chamadas complexas de ferramentas, raciocínio passo a passo (modelos de cadeia de pensamento como Qwen 3.8 27B) — nesses casos, prefira um Mac mini M4 ou um mini-PC GMKtec/Beelink. A relação desempenho/euro é muito melhor nesses equipamentos.

#5. Otimizações específicas para o Pi

#Reduzir a janela de contexto

Por padrão, o Ollama usa num_ctx=2048. No Pi, isso já é bastante — cada token de contexto consome RAM e torna a pré-avaliação mais lenta. Para um assistente de chat com conversas curtas, reduza para 1024.

No tempo de execução, na sessão
/set parameter num_ctx 1024

#Limitar os threads

O Ollama utiliza todos os núcleos por padrão. No Pi 5 (4 núcleos), isso é ideal em termos de velocidade, mas satura o SoC, o que aciona o throttling térmico após 1 a 2 minutos. Em uso prolongado, limitar a 3 núcleos mantém uma taxa de geração estável por mais tempo.

Limitar os threads via env
OLLAMA_NUM_PARALLEL=1 OLLAMA_NUM_THREAD=3 ollama serve

#Preferir NVMe à microSD

O carregamento inicial de um modelo a partir do SD lê sequencialmente vários GB. SD A1 → 30-40 segundos para Phi-3.5 Mini. NVMe → 3-5 segundos. Uma vez em RAM, a inferência é idêntica.

#Reduzir um nível caso a RAM fique insuficiente

No Pi 5 com 8 GB e interface gráfica ativa, o Qwen 3.5 4B em Q4_K_M pode começar a usar swap. Duas opções: passar para o Granite 4.2 3B (2,2 GB) ou o Qwen 3.5 2B (1,9 GB), que liberam 1 a 1,5 GB de RAM sem uma queda drástica na qualidade.

Modelo mais leve
ollama pull granite4.2:3b
→
Modo headless recomendado
Se você montar a Pi como servidor dedicado de inferência, desative o desktop LXDE: sudo raspi-config → Boot Options → Console. Você ganha 300-500 MB de RAM, o que dá espaço para passar do modelo 2B para o 4B com conforto.

#Solução de problemas

ollama: command not found após a instalação
O script systemd falhou (muitas vezes: Pi OS muito antigo). Verifique sudo systemctl status ollama. Caso apareça erro 'exec format error', você está em 32-bit — reinstale o Pi OS 64-bit.
O modelo carrega, mas com apenas 0,3 tok/s
Você está usando swap. Verifique free -h: se a coluna 'available' estiver abaixo de 500 MB durante a inferência, seu modelo é grande demais. Passe para Granite 4.2 3B ou Qwen 3.5 2B, ou mude para Q3.
Throttling térmico após 1 minuto
O SoC ultrapassou 80 °C. Verifique vcgencmd measure_temp durante a inferência. Solução: ventoinha oficial ou Argon ONE V3. Sem dissipação ativa, a Pi 5 não pode ser usada continuamente para inferência.
Memória insuficiente no meio da geração
O OOM killer do Linux encerrou o Ollama. Reduza num_ctx para 1024, feche o navegador ou passe para um modelo menor. No Pi com 4 GB, mantenha o Qwen 3.5 2B, o mais leve do catálogo de 2026.
Serviço Ollama não inicia no boot
sudo systemctl enable ollama para ativar a inicialização automática. Em seguida, verifique com systemctl is-enabled ollama.

#Para se aprofundar

Depois que Ollama estiver rodando no seu Pi 5, três caminhos naturais para se aprofundar:

Entender a quantização para ir além
O guia « Escolher a quantização » compara Q3, Q4, Q5 e Q8 em detalhes. Isso é crucial no Pi, onde cada 100 MB de RAM conta.
Integrar em um app Python
O guia de como integrar Ollama no Python via API REST mostra como controlar seu Pi 5 a partir de um script Flask/FastAPI — base de qualquer assistente edge.
Automatizar workflows offline
O guia para automatizar com n8n e Ollama pode ser aplicado sem alterações no Pi (n8n roda nativamente em ARM64). Ideal para um hub autônomo de automação residencial com IA.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.