Avançado 12 minllama.cpp

llama.cpp com Vulkan (GPU universel)

Vulkan é uma API gráfica compatível com vários fabricantes: funciona em GPUs NVIDIA, AMD, Intel Arc e até em GPUs integradas. Compilar llama.cpp com o backend Vulkan permite evitar completamente as dificuldades com CUDA/ROCm e ter uma solução que funciona em qualquer lugar. Em troca, o desempenho é de 10 a 20% menor que o de um backend nativo — muitas vezes uma boa escolha para configurações heterogêneas.

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux

#Por que Vulkan

Vendor-agnostic
O mesmo binário roda em GeForce, Radeon, Arc, Iris. Útil para distribuir uma ferramenta ou testar um modelo antes de comprar uma placa.
Instalação simples
Os drivers Vulkan estão incluídos nos drivers gráficos padrão. Não há Toolkit de vários gigabytes para instalar.
Placas antigas
Uma GTX 1060 de 6 GB ou uma RX 580 funciona via Vulkan, nos casos em que o suporte via CUDA foi abandonado e o ROCm não oferece suporte.
Intel Arc
As placas Arc A580/A750/A770 têm suporte adequado via Vulkan, enquanto o suporte via oneAPI é mais instável.

#GPU compatíveis

NVIDIA
Todas as placas Maxwell+ (GTX 900 e mais recentes). O Vulkan é suportado em todos os drivers NVIDIA recentes.
AMD
Polaris (RX 400/500), Vega, Navi (RX 5000/6000/7000/9000). Mesa no Linux, drivers oficiais no Windows.
Intel Arc
Alchemist (A380-A770) e Battlemage. Excelente relação entre desempenho e preço para a IA local.
iGPU Intel
Xe (Tiger Lake+), Xe2 (Lunar Lake, Arrow Lake). Útil para pequenos modelos em laptops sem GPU dedicada.

#Pré-requisitos

Ubuntu / Debian
sudo apt update
sudo apt install libvulkan-dev vulkan-tools glslang-tools \
  cmake build-essential git
Fedora
sudo dnf install vulkan-headers vulkan-tools \
  glslang-devel cmake gcc-c++ git
Windows
# Installer le SDK Vulkan LunarG (fournit les headers et shaderc)
winget install KhronosGroup.VulkanSDK
Verificar se o Vulkan detecta a GPU
vulkaninfo | grep -i "deviceName"
# Doit afficher votre GPU

#1. Build

Terminal
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp

cmake -B build -DGGML_VULKAN=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j

Os shaders Vulkan são compilados durante o build. Conte com 3 a 8 minutos, dependendo da CPU.

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

#2. Testar

Iniciar
./build/bin/llama-cli \
  -m ./models/qwen3.5-9b-q4_k_m.gguf \
  -p "Bonjour" -n 128 -ngl 99

Na inicialização, o llama.cpp exibe a GPU detectada via Vulkan: ggml_vulkan: Found 1 Vulkan devices: ... Intel(R) Arc(TM) A770. Se você tiver várias GPUs, use -mg N (índice da GPU principal) para escolher.

#3. Desempenho vs CUDA / ROCm

Tokens por segundo com Qwen 3.5 9B Q4_K_M, Flash Attention ativado (ordens de grandeza):

RTX 4070 — CUDA nativo
~82 tok/s (referência)
RTX 4070 — Vulkan
~70 tok/s (-15 %).
RX 7800 XT — ROCm
~56 tok/s.
RX 7800 XT — Vulkan
~48 tok/s (-15 %). Às vezes o mais rápido quando o ROCm fica bloqueado.
Arc A770 16 GB — Vulkan
~43 tok/s. Melhor relação qualidade/preço.
iGPU Intel Xe (Lunar Lake)
~8-13 tok/s. Dá para usar com um modelo de 2-3B, mas tem dificuldade com um de 9B.

#Quando escolher Vulkan

Você tem uma placa Intel Arc
Vulkan > oneAPI em 2026. Desempenho estável, sem instalações fora do padrão.
O ROCm se recusa a cooperar
Placa AMD sem suporte oficial, override que trava: Vulkan é o plano B que funciona.
Configuração com vários fabricantes
Uma máquina com GeForce + Intel Arc, um laptop com Thunderbolt + eGPU variável. Vulkan suporta tudo.
Distribuição de uma ferramenta
Você escreve um app que precisa rodar em máquinas desconhecidas: o binário Vulkan é o mais compatível.
i
Não é para Mac
No macOS, Vulkan passa por MoltenVK (camada de tradução para Metal). Use o backend Metal nativo do llama.cpp em vez disso — é mais rápido.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.