LLM local em GPU Intel Arc (B580, A770) com Ollama e IPEX-LLM
Executar um LLM localmente em um GPU Intel Arc não é algo simples: o ecossistema foi projetado para CUDA. Mas com o IPEX-LLM e seu backend SYCL, a combinação intel arc + ollama torna-se realmente utilizável, e a relação VRAM/euro de uma A770 16 GB ou de uma B580 12 GB é difícil de superar. Este guia mostra como instalar a stack, o que se obtém concretamente em tokens por segundo, e onde estão as verdadeiras limitações.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.
Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#Por que Intel Arc para IA local?
Em 2026, o item de despesa que determina o que você pode rodar é a VRAM. E é justamente nesse ponto que a Intel Arc compete agressivamente: a Arc A770 vem com 16 GB de GDDR6 e costuma ser encontrada usada por menos de 300 €, enquanto a nova Arc B580 (arquitetura Battlemage) oferece 12 GB por um preço de lançamento em torno de 250 €. A esse preço, nenhuma placa NVIDIA nova oferece tanta memória.
O interesse é, portanto, simples: a VRAM determina o tamanho do modelo que você carrega sem transferir parte da execução para a CPU. Com 16 GB, um Qwen 3.5 9B ou um Granite 4.2 8B em Q4_K_M cabem com folga na memória, e um Gemma 4 12B em Q4 continua sendo perfeitamente viável. A contrapartida está no software: a Intel não tem CUDA, e é necessário usar sua própria pilha oneAPI/SYCL e a biblioteca IPEX-LLM.
#B580 vs A770: qual escolher
As duas placas não desempenham exatamente o mesmo papel. A B580 é mais recente, mais eficiente energeticamente e tem melhor suporte nos drivers atuais, mas é limitada a 12 GB. A A770 é mais antiga (Alchemist, 2022) e consome mais energia, mas seus 16 GB abrem espaço para modelos maiores ou para um contexto mais longo.
- Arc B580 (Battlemage)
- 12 GB GDDR6, ~250 € para uma placa nova. Melhor eficiência e drivers mais maduros. Uma boa escolha se você busca principalmente modelos 7B-8B rápidos.
- Arc A770 (Alchemist)
- 16 GB GDDR6, muitas vezes por menos de 300 € de segunda mão. Mais VRAM para modelos de 14B e contexto mais amplo, à custa de um consumo maior.
- Arc A750 / B570
- 8 GB / 10 GB: pode servir como solução de emergência para um modelo 7B em Q4, com pouca folga, mas o limite de VRAM é atingido rapidamente. Reservar para orçamentos pequenos.
#Requisitos de hardware e drivers
Antes de instalar qualquer coisa, certifique-se de ter uma base bem configurada. O ponto mais importante é o Resizable BAR (ReBAR): nas GPUs Arc, ele não é opcional. Sem ele, o desempenho despenca e alguns carregamentos falham.
- 01Ativar o Resizable BARNo BIOS/UEFI da placa-mãe, ative « Resizable BAR » (e « Above 4G Decoding »). Isso é essencial para que o Arc funcione corretamente.
- 02Atualizar os drivers da GPUNo Windows, instale os últimos drivers Intel Arc (Intel Arc Control). No Linux, use um kernel recente (6.2+) com o driver i915/xe e o runtime de computação Intel (intel-opencl-icd, level-zero).
- 03Verificar a detecçãoNo Linux, o comando clinfo ou sycl-ls deve listar sua GPU Arc como um dispositivo Level Zero. Isso comprova que a camada oneAPI detecta a placa.
#Instalar IPEX-LLM e o backend SYCL
IPEX-LLM é a biblioteca da Intel que otimiza a inferência de LLMs nas GPUs da Intel. Ela se baseia em oneAPI e no backend SYCL do llama.cpp e fornece uma versão pré-compilada do Ollama para Arc. É essa versão “IPEX-LLM” do Ollama que deve ser usada, não o binário padrão do Ollama, que, por sua vez, só conhece CUDA/ROCm/Metal.
O caminho mais simples é usar o pacote Python ipex-llm[cpp], que instala o comando init-ollama para gerar os binários do Ollama vinculados ao backend Intel. Crie um ambiente dedicado para não comprometer o que já funciona.
No Windows, a Intel também distribui um arquivo compactado « Ollama portable » pronto para uso: descompacte-o e execute diretamente start-ollama.bat, sem instalar Python. É a opção mais rápida para testar.
#Iniciar o Ollama no Arc
Depois de gerar os binários, o daemon do Ollama é iniciado como de costume — ele escuta em http://localhost:11434 —, mas com algumas variáveis de ambiente definidas para indicar ao SYCL que use a GPU e transfira toda a carga de execução para ela.
Em um segundo terminal, baixe um modelo e inicie uma conversa. Comece com um modelo pequeno para validar toda a sequência antes de carregar um 12B.
No primeiro prompt, a compilação dos kernels SYCL introduz um pequeno atraso; graças a SYCL_CACHE_PERSISTENT, as inicializações seguintes são muito mais rápidas. Para confirmar que a GPU está trabalhando, monitore sua utilização com a ferramenta dedicada da Intel.
#Tokens por segundo medidos na B580 e na A770
Os números abaixo são estimativas observadas em modelos comuns em Q4_K_M, contexto curto, geração pura (fora do tempo de carregamento). Variam conforme o driver, a versão do IPEX-LLM e o sistema de refrigeração, mas dão uma imagem realista do que se obtém.
- Granite 4.2 3B (Q4) — B580
- ≈ 45-55 tok/s. Fluido para chat e tarefas rápidas.
- Granite 4.2 8B (Q4) — B580
- ≈ 25-32 tok/s. Confortável para uso diário como assistente.
- Qwen 3.5 9B (Q4) — A770
- ≈ 20-28 tok/s. Um nível abaixo da B580 no formato pequeno, mas perfeitamente utilizável, e ainda com recursos de visão.
- Gemma 4 12B (Q4) — A770
- ≈ 11-16 tok/s. Os 16 GB fazem a diferença: o modelo multimodal cabe na memória sem offload para a CPU.
- Gemma 4 12B (Q4) — B580
- ≈ 9-13 tok/s, no limite dos 12 GB conforme o contexto; um contexto longo pode forçar um offload e fazer a taxa de geração cair.
O veredito é claro: com modelos de 8–9B, as duas placas oferecem uma experiência agradável em tempo real, muitas vezes comparável à de uma RTX 3060 de 12 GB. Com modelos de 12B, a A770 mantém a vantagem graças à sua VRAM. Para contextualizar, a RTX 3060 de 12 GB continua sendo a referência de entrada no segmento NVIDIA — a Arc compete nessa categoria, não contra uma RTX 4080.
#Limitações em relação à NVIDIA
Sejamos honestos: o Arc é uma opção econômica inteligente, não um substituto sem concessões para uma placa CUDA. Aqui estão os pontos a conhecer antes de comprar.
- Ecossistema de software
- Você depende do IPEX-LLM e do backend SYCL. Alguns projetos recentes (novos runtimes, funcionalidades do llama.cpp) chegam com atraso em relação ao CUDA. A versão 'padrão' do Ollama não é suficiente.
- Quantizações suportadas
- Os formatos GGUF clássicos são compatíveis (Q4_K_M, Q5_K_M, Q8_0, FP16). No entanto, algumas quantizações exóticas ou muito recentes podem não estar otimizadas, ou até acabar sendo processadas na CPU.
- Fine-tuning e frameworks avançados
- O treinamento/LoRA é possível via IPEX-LLM, mas é bem menos documentado e conta com menos ferramentas do que em GPUs NVIDIA. Para um fine-tuning sério, CUDA continua sendo o melhor caminho.
- Maturidade dos drivers
- A situação melhora rapidamente, mas um driver ou uma versão de IPEX-LLM pode causar regressão. Fixe uma versão que funcione antes de atualizar sem verificação.
#Solução de problemas comuns
- O modelo roda no CPU em vez do GPU
- Verifique ONEAPI_DEVICE_SELECTOR=level_zero:0 e OLLAMA_NUM_GPU=999 e confirme que sycl-ls lista a placa. O ReBAR desativado também pode forçar a execução na CPU.
- Velocidade muito baixa apesar da GPU ativa
- Quase sempre é o Resizable BAR que não está ativado no BIOS. É a primeira coisa a verificar.
- Erro « out of memory » mesmo com VRAM aparentemente suficiente
- O contexto (num_ctx) aumenta o consumo de memória. Reduza a janela de contexto ou mude para uma quantização mais leve (Q4 em vez de Q5/Q8).
- Primeiro prompt muito lento depois normal
- Compilação dos kernels SYCL. Certifique-se de que SYCL_CACHE_PERSISTENT=1 esteja devidamente exportado para não arcar novamente com esse custo a cada execução.
- O GPU não aparece no sycl-ls
- Runtime de computação ausente: instale intel-opencl-icd e level-zero (Linux) ou reinstale os drivers Arc (Windows).
#Para se aprofundar
Assim que o Ollama estiver funcionando na sua Arc, os próximos passos serão os mesmos que em qualquer outra máquina. Estes guias do site dão continuidade a este guia:
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Decisivo nas placas Arc, onde a VRAM é limitada: entender o equilíbrio entre qualidade e memória para aproveitar ao máximo seus 12 ou 16 GB.
- Escolher sua GPU para IA local
- Comparar o Arc com as RTX e os Macs para confirmar se é realmente a compra certa para o seu uso.
- Instalar o Ollama: Windows, macOS e Linux
- O guia de instalação básica e de uso da API na porta 11434, útil para conectar o Open WebUI usando sua Arc como GPU de processamento.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.