llama.cpp com Vulkan (GPU universel)
Vulkan é uma API gráfica compatível com vários fabricantes: funciona em GPUs NVIDIA, AMD, Intel Arc e até em GPUs integradas. Compilar llama.cpp com o backend Vulkan permite evitar completamente as dificuldades com CUDA/ROCm e ter uma solução que funciona em qualquer lugar. Em troca, o desempenho é de 10 a 20% menor que o de um backend nativo — muitas vezes uma boa escolha para configurações heterogêneas.
#Por que Vulkan
- Vendor-agnostic
- O mesmo binário roda em GeForce, Radeon, Arc, Iris. Útil para distribuir uma ferramenta ou testar um modelo antes de comprar uma placa.
- Instalação simples
- Os drivers Vulkan estão incluídos nos drivers gráficos padrão. Não há Toolkit de vários gigabytes para instalar.
- Placas antigas
- Uma GTX 1060 de 6 GB ou uma RX 580 funciona via Vulkan, nos casos em que o suporte via CUDA foi abandonado e o ROCm não oferece suporte.
- Intel Arc
- As placas Arc A580/A750/A770 têm suporte adequado via Vulkan, enquanto o suporte via oneAPI é mais instável.
#GPU compatíveis
- NVIDIA
- Todas as placas Maxwell+ (GTX 900 e mais recentes). O Vulkan é suportado em todos os drivers NVIDIA recentes.
- AMD
- Polaris (RX 400/500), Vega, Navi (RX 5000/6000/7000/9000). Mesa no Linux, drivers oficiais no Windows.
- Intel Arc
- Alchemist (A380-A770) e Battlemage. Excelente relação entre desempenho e preço para a IA local.
- iGPU Intel
- Xe (Tiger Lake+), Xe2 (Lunar Lake, Arrow Lake). Útil para pequenos modelos em laptops sem GPU dedicada.
#Pré-requisitos
#1. Build
Os shaders Vulkan são compilados durante o build. Conte com 3 a 8 minutos, dependendo da CPU.
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
#2. Testar
Na inicialização, o llama.cpp exibe a GPU detectada via Vulkan: ggml_vulkan: Found 1 Vulkan devices: ... Intel(R) Arc(TM) A770. Se você tiver várias GPUs, use -mg N (índice da GPU principal) para escolher.
#3. Desempenho vs CUDA / ROCm
Tokens por segundo com Qwen 3.5 9B Q4_K_M, Flash Attention ativado (ordens de grandeza):
- RTX 4070 — CUDA nativo
- ~82 tok/s (referência)
- RTX 4070 — Vulkan
- ~70 tok/s (-15 %).
- RX 7800 XT — ROCm
- ~56 tok/s.
- RX 7800 XT — Vulkan
- ~48 tok/s (-15 %). Às vezes o mais rápido quando o ROCm fica bloqueado.
- Arc A770 16 GB — Vulkan
- ~43 tok/s. Melhor relação qualidade/preço.
- iGPU Intel Xe (Lunar Lake)
- ~8-13 tok/s. Dá para usar com um modelo de 2-3B, mas tem dificuldade com um de 9B.
#Quando escolher Vulkan
- Você tem uma placa Intel Arc
- Vulkan > oneAPI em 2026. Desempenho estável, sem instalações fora do padrão.
- O ROCm se recusa a cooperar
- Placa AMD sem suporte oficial, override que trava: Vulkan é o plano B que funciona.
- Configuração com vários fabricantes
- Uma máquina com GeForce + Intel Arc, um laptop com Thunderbolt + eGPU variável. Vulkan suporta tudo.
- Distribuição de uma ferramenta
- Você escreve um app que precisa rodar em máquinas desconhecidas: o binário Vulkan é o mais compatível.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.