Intermediário 12 minGPU

LLM local em GPU Intel Arc (B580, A770) com Ollama e IPEX-LLM

Executar um LLM localmente em um GPU Intel Arc não é algo simples: o ecossistema foi projetado para CUDA. Mas com o IPEX-LLM e seu backend SYCL, a combinação intel arc + ollama torna-se realmente utilizável, e a relação VRAM/euro de uma A770 16 GB ou de uma B580 12 GB é difícil de superar. Este guia mostra como instalar a stack, o que se obtém concretamente em tokens por segundo, e onde estão as verdadeiras limitações.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Thomas P.·Atualização 2026-08-27·Testado no Windows, macOS e Linux
Hardware recomendado

Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.

Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#Por que Intel Arc para IA local?

Em 2026, o item de despesa que determina o que você pode rodar é a VRAM. E é justamente nesse ponto que a Intel Arc compete agressivamente: a Arc A770 vem com 16 GB de GDDR6 e costuma ser encontrada usada por menos de 300 €, enquanto a nova Arc B580 (arquitetura Battlemage) oferece 12 GB por um preço de lançamento em torno de 250 €. A esse preço, nenhuma placa NVIDIA nova oferece tanta memória.

O interesse é, portanto, simples: a VRAM determina o tamanho do modelo que você carrega sem transferir parte da execução para a CPU. Com 16 GB, um Qwen 3.5 9B ou um Granite 4.2 8B em Q4_K_M cabem com folga na memória, e um Gemma 4 12B em Q4 continua sendo perfeitamente viável. A contrapartida está no software: a Intel não tem CUDA, e é necessário usar sua própria pilha oneAPI/SYCL e a biblioteca IPEX-LLM.

i
VRAM e tamanho do modelo
Referência rápida em Q4_K_M: um modelo 7B ocupa ≈5 GB, um 14B ≈9 GB, um 32B ≈19 GB. Os 16 GB da A770 acomodam confortavelmente modelos de até 14B; os 12 GB da B580 acomodam modelos 7B-8B com folga e permitem rodar um 14B, mas com pouca margem.

#B580 vs A770: qual escolher

As duas placas não desempenham exatamente o mesmo papel. A B580 é mais recente, mais eficiente energeticamente e tem melhor suporte nos drivers atuais, mas é limitada a 12 GB. A A770 é mais antiga (Alchemist, 2022) e consome mais energia, mas seus 16 GB abrem espaço para modelos maiores ou para um contexto mais longo.

Arc B580 (Battlemage)
12 GB GDDR6, ~250 € para uma placa nova. Melhor eficiência e drivers mais maduros. Uma boa escolha se você busca principalmente modelos 7B-8B rápidos.
Arc A770 (Alchemist)
16 GB GDDR6, muitas vezes por menos de 300 € de segunda mão. Mais VRAM para modelos de 14B e contexto mais amplo, à custa de um consumo maior.
Arc A750 / B570
8 GB / 10 GB: pode servir como solução de emergência para um modelo 7B em Q4, com pouca folga, mas o limite de VRAM é atingido rapidamente. Reservar para orçamentos pequenos.
→
O critério decisivo
Se você estiver em dúvida, decida com base na VRAM, não no nome: 16 GB (A770) darão mais margem para avançar para modelos de 14B e RAG do que os 12 GB de uma B580, mesmo que esta última seja mais moderna.

#Requisitos de hardware e drivers

Antes de instalar qualquer coisa, certifique-se de ter uma base bem configurada. O ponto mais importante é o Resizable BAR (ReBAR): nas GPUs Arc, ele não é opcional. Sem ele, o desempenho despenca e alguns carregamentos falham.

  1. 01
    Ativar o Resizable BAR
    No BIOS/UEFI da placa-mãe, ative « Resizable BAR » (e « Above 4G Decoding »). Isso é essencial para que o Arc funcione corretamente.
  2. 02
    Atualizar os drivers da GPU
    No Windows, instale os últimos drivers Intel Arc (Intel Arc Control). No Linux, use um kernel recente (6.2+) com o driver i915/xe e o runtime de computação Intel (intel-opencl-icd, level-zero).
  3. 03
    Verificar a detecção
    No Linux, o comando clinfo ou sycl-ls deve listar sua GPU Arc como um dispositivo Level Zero. Isso comprova que a camada oneAPI detecta a placa.
Terminal — verificar a placa (Linux)
# Lister les périphériques SYCL visibles par oneAPI
sycl-ls

# Sortie attendue : une ligne [level_zero:gpu] ... Intel(R) Arc(TM) ...
# Si le GPU n'apparaît pas, le compute runtime n'est pas installé.
!
Resizable BAR é obrigatório
Essa é a causa número 1 do baixo desempenho nas placas Arc. Se sua taxa de tokens/segundo é ridiculamente baixa ou se o modelo se recusa a carregar na GPU, verifique o ReBAR no BIOS antes de qualquer outra coisa.

#Instalar IPEX-LLM e o backend SYCL

IPEX-LLM é a biblioteca da Intel que otimiza a inferência de LLMs nas GPUs da Intel. Ela se baseia em oneAPI e no backend SYCL do llama.cpp e fornece uma versão pré-compilada do Ollama para Arc. É essa versão “IPEX-LLM” do Ollama que deve ser usada, não o binário padrão do Ollama, que, por sua vez, só conhece CUDA/ROCm/Metal.

O caminho mais simples é usar o pacote Python ipex-llm[cpp], que instala o comando init-ollama para gerar os binários do Ollama vinculados ao backend Intel. Crie um ambiente dedicado para não comprometer o que já funciona.

Terminal — instalar IPEX-LLM (conda/Linux)
# Environnement isolé
conda create -n ipex-llm python=3.11 -y
conda activate ipex-llm

# Installer IPEX-LLM avec le backend llama.cpp/Ollama
pip install --pre --upgrade ipex-llm[cpp]

# Générer les binaires Ollama optimisés Intel dans le dossier courant
mkdir ollama-arc && cd ollama-arc
init-ollama

No Windows, a Intel também distribui um arquivo compactado « Ollama portable » pronto para uso: descompacte-o e execute diretamente start-ollama.bat, sem instalar Python. É a opção mais rápida para testar.

i
oneAPI já incluído
Os pacotes recentes de ipex-llm[cpp] incluem as dependências oneAPI necessárias. Em geral, você não precisa mais instalar separadamente o oneAPI Base Toolkit nem executar setvars.sh com o comando source para um uso básico do Ollama.

#Iniciar o Ollama no Arc

Depois de gerar os binários, o daemon do Ollama é iniciado como de costume — ele escuta em http://localhost:11434 —, mas com algumas variáveis de ambiente definidas para indicar ao SYCL que use a GPU e transfira toda a carga de execução para ela.

Terminal — iniciar o servidor
# Sélectionner le GPU Arc via Level Zero
export ONEAPI_DEVICE_SELECTOR=level_zero:0
# Cache de compilation SYCL (accélère les lancements suivants)
export SYCL_CACHE_PERSISTENT=1
# Forcer l'offload de toutes les couches sur le GPU
export OLLAMA_NUM_GPU=999

# Démarrer le daemon (depuis le dossier ollama-arc)
./ollama serve

Em um segundo terminal, baixe um modelo e inicie uma conversa. Comece com um modelo pequeno para validar toda a sequência antes de carregar um 12B.

Terminal — primeiro modelo
# Télécharger et lancer un modèle 8-9B en Q4_K_M
./ollama run qwen3.5:9b

# ou un modèle plus léger pour un premier test
./ollama run granite4.2:3b

No primeiro prompt, a compilação dos kernels SYCL introduz um pequeno atraso; graças a SYCL_CACHE_PERSISTENT, as inicializações seguintes são muito mais rápidas. Para confirmar que a GPU está trabalhando, monitore sua utilização com a ferramenta dedicada da Intel.

Terminal — monitorar o GPU (Linux)
# Occupation et mémoire du GPU Intel en temps réel
sudo xpu-smi dump -d 0 -m 0,1,2

# Alternative légère si xpu-smi n'est pas installé
intel_gpu_top
→
Conectar uma interface
O daemon expõe a API padrão do Ollama na porta 11434. Você pode, então, conectar o Open WebUI ou o LM Studio a essa API exatamente como em uma máquina NVIDIA — nada muda no lado do cliente.

#Tokens por segundo medidos na B580 e na A770

Os números abaixo são estimativas observadas em modelos comuns em Q4_K_M, contexto curto, geração pura (fora do tempo de carregamento). Variam conforme o driver, a versão do IPEX-LLM e o sistema de refrigeração, mas dão uma imagem realista do que se obtém.

Granite 4.2 3B (Q4) — B580
≈ 45-55 tok/s. Fluido para chat e tarefas rápidas.
Granite 4.2 8B (Q4) — B580
≈ 25-32 tok/s. Confortável para uso diário como assistente.
Qwen 3.5 9B (Q4) — A770
≈ 20-28 tok/s. Um nível abaixo da B580 no formato pequeno, mas perfeitamente utilizável, e ainda com recursos de visão.
Gemma 4 12B (Q4) — A770
≈ 11-16 tok/s. Os 16 GB fazem a diferença: o modelo multimodal cabe na memória sem offload para a CPU.
Gemma 4 12B (Q4) — B580
≈ 9-13 tok/s, no limite dos 12 GB conforme o contexto; um contexto longo pode forçar um offload e fazer a taxa de geração cair.

O veredito é claro: com modelos de 8–9B, as duas placas oferecem uma experiência agradável em tempo real, muitas vezes comparável à de uma RTX 3060 de 12 GB. Com modelos de 12B, a A770 mantém a vantagem graças à sua VRAM. Para contextualizar, a RTX 3060 de 12 GB continua sendo a referência de entrada no segmento NVIDIA — a Arc compete nessa categoria, não contra uma RTX 4080.

i
Processamento de prompt
Nas placas Arc, o ponto fraco costuma ser a velocidade de processamento do prompt (prompt eval), mais do que a geração. Para RAG com contextos longos, espere um tempo inicial de “reflexão” mais longo do que nas placas NVIDIA com a mesma quantidade de VRAM.

#Limitações em relação à NVIDIA

Sejamos honestos: o Arc é uma opção econômica inteligente, não um substituto sem concessões para uma placa CUDA. Aqui estão os pontos a conhecer antes de comprar.

Ecossistema de software
Você depende do IPEX-LLM e do backend SYCL. Alguns projetos recentes (novos runtimes, funcionalidades do llama.cpp) chegam com atraso em relação ao CUDA. A versão 'padrão' do Ollama não é suficiente.
Quantizações suportadas
Os formatos GGUF clássicos são compatíveis (Q4_K_M, Q5_K_M, Q8_0, FP16). No entanto, algumas quantizações exóticas ou muito recentes podem não estar otimizadas, ou até acabar sendo processadas na CPU.
Fine-tuning e frameworks avançados
O treinamento/LoRA é possível via IPEX-LLM, mas é bem menos documentado e conta com menos ferramentas do que em GPUs NVIDIA. Para um fine-tuning sério, CUDA continua sendo o melhor caminho.
Maturidade dos drivers
A situação melhora rapidamente, mas um driver ou uma versão de IPEX-LLM pode causar regressão. Fixe uma versão que funcione antes de atualizar sem verificação.
!
Para quem o Arc NÃO é a escolha certa
Se você quer o máximo de compatibilidade «isso funciona de primeira», fine-tuning intenso ou rodar os últimos projetos de pesquisa, continue com NVIDIA. Arc recompensa quem aceita um pouco de ajuste em troca de VRAM barata.

#Solução de problemas comuns

O modelo roda no CPU em vez do GPU
Verifique ONEAPI_DEVICE_SELECTOR=level_zero:0 e OLLAMA_NUM_GPU=999 e confirme que sycl-ls lista a placa. O ReBAR desativado também pode forçar a execução na CPU.
Velocidade muito baixa apesar da GPU ativa
Quase sempre é o Resizable BAR que não está ativado no BIOS. É a primeira coisa a verificar.
Erro « out of memory » mesmo com VRAM aparentemente suficiente
O contexto (num_ctx) aumenta o consumo de memória. Reduza a janela de contexto ou mude para uma quantização mais leve (Q4 em vez de Q5/Q8).
Primeiro prompt muito lento depois normal
Compilação dos kernels SYCL. Certifique-se de que SYCL_CACHE_PERSISTENT=1 esteja devidamente exportado para não arcar novamente com esse custo a cada execução.
O GPU não aparece no sycl-ls
Runtime de computação ausente: instale intel-opencl-icd e level-zero (Linux) ou reinstale os drivers Arc (Windows).

#Para se aprofundar

Assim que o Ollama estiver funcionando na sua Arc, os próximos passos serão os mesmos que em qualquer outra máquina. Estes guias do site dão continuidade a este guia:

Escolher sua quantização (Q4, Q5, Q8, FP16)
Decisivo nas placas Arc, onde a VRAM é limitada: entender o equilíbrio entre qualidade e memória para aproveitar ao máximo seus 12 ou 16 GB.
Escolher sua GPU para IA local
Comparar o Arc com as RTX e os Macs para confirmar se é realmente a compra certa para o seu uso.
Instalar o Ollama: Windows, macOS e Linux
O guia de instalação básica e de uso da API na porta 11434, útil para conectar o Open WebUI usando sua Arc como GPU de processamento.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.