Intermediário 13 minNPU

Ryzen AI 9 HX: o NPU de 50 TOPS realmente serve para LLMs? ?

O Ryzen AI 9 HX 370 exibe orgulhosamente 50 TOPS na sua NPU XDNA 2 — um número que o marketing da AMD adora destacar diante da Intel e da Apple. A verdadeira pergunta para quem quer rodar um LLM local: essa NPU serve para alguma coisa, ou é preciso continuar contando com a GPU integrada Radeon 890M? Este guia testa de forma honesta a stack Ryzen AI para LLM (LM Studio Ryzen AI, Lemonade SDK), compara os resultados com a execução apenas na CPU e na iGPU e dá o veredito — sem exageros.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux
Hardware recomendado

Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.

Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#Por que um NPU para um LLM local?

Um NPU (Unidade de Processamento Neural) é um acelerador dedicado às operações matriciais INT8 e INT4 típicas da inferência. No Ryzen AI 9 HX 370, o bloco XDNA 2 fornece até 50 TOPS INT8 com cerca de 2 W de consumo. À primeira vista, essa combinação é imbatível para uso portátil — um LLM que roda sem acionar as ventoinhas e sem esgotar a bateria em 40 minutos.

A palavra-chave Ryzen AI 9 HX LLM NPU aparece em todas as demonstrações da AMD, mas na realidade o ecossistema de software ainda é jovem. A maioria das stacks de LLM (llama.cpp, Ollama, vLLM) ignora completamente a NPU e executa tudo na CPU AVX-512 ou na GPU integrada via Vulkan / ROCm. Para aproveitar a XDNA 2, é necessário usar runtimes específicos compilados pela AMD ou pela comunidade.

i
O que XDNA 2 realmente sabe fazer
O NPU foi projetado para inferência INT8/INT4 em modelos pequenos com contexto curto. Não substitui a GPU para treinar, fazer fine-tuning ou executar um modelo de 32B. Pense em "assistente leve de 3B-8B que responde em segundo plano", não em "estação de trabalho de IA".

#XDNA 2 na prática: o que diz o silício

A arquitetura XDNA 2 integrada ao Strix Point (geração Ryzen AI 300) dobra os TOPS em comparação com a XDNA 1 (16 → 50 TOPS) e introduz suporte nativo a ponto flutuante em blocos nos formatos FP8 e FP16. É a primeira NPU da AMD capaz de executar um LLM de forma razoável, mas com duas grandes restrições.

Largura de banda da memória
O NPU compartilha a memória do sistema (LPDDR5X-7500 ou 8000 nas máquinas Strix Point). Oferece cerca de 120 a 128 GB/s, compartilhados com CPU, GPU e sistema operacional. O NPU nunca poderá atingir seu desempenho teórico máximo de cálculo.
Quantização obrigatória
O pipeline oficial da AMD exige modelos quantizados em INT4 ou INT8 via o formato ONNX otimizado. Os GGUF Q4_K_M clássicos não funcionam diretamente — é necessária uma conversão.
Compilação prévia ONNX
Cada modelo deve ser compilado para XDNA 2 (subgrafos alocados à NPU, o restante à CPU). É a etapa que desencoraja 95 % dos usuários.
Sem suporte a múltiplos usuários
O NPU só atende a um processo por vez. Se um LLM o ocupar, nenhuma outra IA do Windows (Studio Effects, Recall, se você o usar) poderá utilizá-lo em paralelo.

#Pré-requisitos de hardware e software

CPU
Ryzen AI 9 HX 370, HX 365 ou HX PRO 370 (Strix Point, codinome Krackan). Os Ryzen AI 7/5 funcionam com um NPU mais modesto, mas a mesma stack de software.
RAM
No mínimo 32 GB de LPDDR5X para um uso confortável. 64 GB se você quiser testar um modelo de 14B na GPU integrada em paralelo.
OS
Windows 11 24H2 ou superior. Existem drivers para as NPUs XDNA no Linux (o driver está integrado ao kernel oficial desde a versão 6.11), mas as ferramentas disponíveis para o usuário estão muito atrasadas.
Drivers da NPU
AMD Ryzen AI Software 1.3 ou superior (download separado em amd.com, não incluído no driver Adrenalin).
Armazenamento
~20 GB livres para modelos ONNX pré-compilados (mais volumosos que os equivalentes GGUF).
!
Verifique o NPU antes de tudo
No Gerenciador de Dispositivos → Processadores neurais → "AMD Ryzen AI NPU" deve aparecer sem triângulo amarelo. Caso contrário, você tem um driver de chipset genérico: instale o pacote dedicado AMD Ryzen AI Software.

#1. LM Studio Ryzen AI: a via mais simples

A AMD distribui um fork oficial do LM Studio pré-configurado para XDNA 2. É o caminho recomendado para quem quer testar sem mexer em Python nem no ONNX Runtime.

  1. 01
    Baixar o binário
    Acesse amd.com/lmstudio (página oficial « LM Studio for Ryzen AI »). O binário para Windows é assinado pela AMD.
  2. 02
    Instalação clássica
    O instalador coloca o LM Studio na pasta Program Files e configura automaticamente o runtime ONNX RyzenAI Execution Provider.
  3. 03
    Selecionar um modelo otimizado para NPU
    Na aba Discover, filtre pelo selo “Ryzen AI”. Você encontrará Qwen 3.5 9B, Granite 4.2 3B e Granite 4.2 8B pré-compilados para XDNA 2 (sufixo -hybrid).
  4. 04
    Carregar e testar
    Ao carregar, o LM Studio exibe um seletor de ambiente de execução: GPU, CPU ou "Ryzen AI Hybrid" (NPU + iGPU). Escolha Hybrid para aproveitar o NPU.
  5. 05
    Verificar se o NPU está sendo utilizado
    Abra o Gerenciador de Tarefas → aba Desempenho → NPU. A curva deve subir para 60-95% durante a geração. Se permanecer em 0, o runtime passou a usar a CPU.
Verificar o NPU na linha de comando
# Lister les périphériques de calcul disponibles
Get-PnpDevice -Class "ComputeAccelerator" | Format-Table FriendlyName, Status

# Doit afficher : AMD Ryzen AI NPU - OK

#2. Lemonade SDK: para ir além de LM Studio

O Lemonade SDK é a ferramenta oficial da AMD para desenvolvedores. Ele tem dois objetivos: (1) compilar seus próprios modelos GGUF/HF para o formato ONNX híbrido, (2) expor uma API compatível com OpenAI que pode ser usada a partir do Open WebUI, Continue.dev etc.

Instalação do Lemonade SDK
# Python 3.11 recommandé
python -m venv .venv
.\.venv\Scripts\Activate.ps1

# Installation du SDK
pip install lemonade-sdk[npu]

# Test : lister les modèles déjà disponibles
lemonade list
Iniciar um servidor compatível com OpenAI
# Charge Qwen 3.5 9B précompilé en mode hybride NPU+iGPU
lemonade serve --model qwen3.5-9b-instruct-hybrid --port 8000

# L'endpoint http://localhost:8000/v1/chat/completions est désormais utilisable
# par toute app qui parle OpenAI (Open WebUI, Continue, etc.)
→
Compilar um modelo personalizado
Para seus próprios modelos, o comando `lemonade onnx-export --source granite-4.2-8b-instruct --target hybrid` gera uma pasta ONNX pré-compilada. Preveja de 15 a 30 minutos de compilação na primeira vez e cerca de 8 a 12 GB em disco para um modelo de 8B em INT4.

#3. Recorrer à Radeon 890M: muitas vezes a melhor opção

O Ryzen AI 9 HX 370 também possui uma iGPU Radeon 890M (RDNA 3.5, 16 CU). No LM Studio padrão ou no Ollama, essa iGPU pode ser utilizada via Vulkan e às vezes supera o NPU em velocidade de processamento. Veja como utilizá-la.

Ollama na Radeon 890M (Vulkan)
# Installation Ollama Windows (build avec Vulkan)
winget install Ollama.Ollama

# Forcer le backend Vulkan
$env:OLLAMA_VULKAN = "1"

# Lancer un Qwen 3.5 9B
ollama serve
ollama run qwen3.5:9b
Alocação dinâmica de VRAM
O Radeon 890M compartilha a RAM do sistema. No BIOS UEFI, procure « UMA Frame Buffer Size » e defina pelo menos 8 GB (se possível, 16 GB) antes de qualquer teste de LLM.
Driver
Adrenalin 24.10 ou superior para aproveitar o caminho Vulkan otimizado compute. Os drivers OEM Lenovo/Asus costumam estar atrasados em 2 versões.
ROCm no Linux
ROCm 6.3+ suporta oficialmente Strix Point desde abril de 2026. No Ubuntu 24.04, é possível usar, mas a unidade gráfica integrada continua limitada pela largura de banda da memória compartilhada.

#Testes de desempenho: NPU vs iGPU vs CPU

Ordens de grandeza registradas em um Asus Zenbook S 14 (Ryzen AI 9 HX 370, 32 GB LPDDR5X-7500, Windows 11 24H2, AMD Ryzen AI Software 1.3, Adrenalin 24.10.1). Prompt curto (~50 tokens), geração de 256 tokens, temperatura 0.7. Média de 5 execuções.

Qwen 3.5 9B — CPU AVX-512
4,1 tok/s · 28 W no encapsulamento do processador · ventilador audível
Qwen 3.5 9B — Radeon 890M (Vulkan)
9,8 tok/s · 35 W no package · ventilador em funcionamento intenso
Qwen 3.5 9B híbrido — NPU + iGPU (LM Studio Ryzen AI)
11,2 tok/s · 18 W no package · ventilador pouco audível
Granite 4.2 3B — somente na NPU
24 tok/s · 9 W no encapsulamento do chip · ventilador desligado
Granite 4.2 8B — NPU + iGPU
13,5 tok/s · 19 W no package · ventilador silencioso
Gemma 4 12B — Radeon 890M (Vulkan)
4,2 tok/s · 38 W · grande demais para a NPU sozinha
i
O que esses números mostram
O NPU não é o mais rápido absolutamente — o iGPU pode igualá-lo em modelos de 7B a 8B. Mas com o mesmo desempenho, o NPU consome 2 vezes menos e aquece 2 vezes menos. Essa é sua verdadeira vantagem: manter uma sessão LLM por 3 horas com bateria sem degradação térmica.

#Casos de uso em que a NPU se destaca

Chatbot de assistência permanente
Um Granite 4.2 3B ou Qwen 3.5 4B na NPU consome ~5 W e fica disponível 24 horas por dia sem impacto significativo na bateria. Ideal para integração em um aplicativo de produtividade.
Resumo automático de e-mails / documentos
Tarefa curta em lote, contexto de 4 a 8 mil tokens, modelos de 3B a 8B. Perfeito para a NPU: ventoinha desligada, processamento silencioso em segundo plano enquanto você trabalha.
Voz para texto em tempo real + resumo
Whisper (no iGPU) + Granite 4.2 8B (no NPU) em pipeline — é possível exatamente porque os dois blocos são independentes.
Modo avião prolongado
Usando a bateria, o uso de NPU + iGPU permite 4 a 5 horas de uso ativo do LLM contra 1h30 em uma configuração apenas com CPU/iGPU.
→
Combine NPU e iGPU de forma inteligente
O modo « Hybrid » do LM Studio Ryzen AI distribui automaticamente as camadas: os blocos Attention na NPU (INT4 denso), os FFN na iGPU (onde a largura de banda da memória é melhor explorada). É esse modo que oferece o melhor equilíbrio entre desempenho e consumo, e não a NPU sozinha.

#Armadilhas e limitações a conhecer

Contexto limitado
A maioria dos modelos pré-compilados AMD limita-se a 4096 tokens de contexto. Para 32k ou mais, você precisa recompilar — e isso consome muito mais memória.
Sem modelos com mais de 8B apenas na NPU
Acima de 8B, mesmo em INT4, falta largura de banda ao NPU. Acima de 13B, a iGPU necessariamente assume o processamento.
Modelos indisponíveis
Qwen 3.5, DeepSeek, Gemma 4 não são todos oficialmente pré-compilados. Verifique o hub Ryzen AI antes de comprar uma configuração pensando em rodar um modelo específico.
Atualização do Windows que causa falhas
Algumas atualizações cumulativas 24H2 desativaram temporariamente a enumeração do NPU. Mantenha o pacote AMD Ryzen AI Software atualizado e verifique o Gerenciador de Dispositivos após cada atualização cumulativa.
Sem fine-tuning
O XDNA 2 realiza apenas inferência. Para treinar ou fazer ajuste fino com LoRA, é necessária uma GPU dedicada — ponto.
!
A NPU não substitui uma GPU dedicada
Se o seu objetivo é rodar um Qwen 3.6 35B, um modelo de 70B ou fazer fine-tuning, o Ryzen AI 9 HX 370 não é a máquina adequada. Um PC de mesa com RTX 4070 / 4080 / 4090 continua imbatível. O NPU é uma solução para mobilidade — não um substituto para a GPU.

#Para se aprofundar

Três caminhos para se aprofundar, de acordo com sua próxima etapa:

Compreender as quantizações
O NPU XDNA 2 só processa INT4/INT8. O guia « Escolher a quantização (Q4, Q5, Q8, FP16) » explica por que Q4_K_M continua o padrão para CPU/GPU e o que muda com INT4 no NPU.
Comparar com uma configuração real de GPU
Se você está em dúvida entre essa opção e um computador de mesa, o guia "Escolher sua GPU para IA local" compara RTX 4070, 4090, M-Max e apresenta os critérios mínimos de compra conforme o uso.
Configuração mais convencional do Ollama
Para manter a stack padrão com sua Radeon 890M, o guia de instalação do Ollama no Windows abrange a configuração Vulkan e a gestão de VRAM/RAM compartilhada.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.