Ryzen AI 9 HX: o NPU de 50 TOPS realmente serve para LLMs? ?
O Ryzen AI 9 HX 370 exibe orgulhosamente 50 TOPS na sua NPU XDNA 2 — um número que o marketing da AMD adora destacar diante da Intel e da Apple. A verdadeira pergunta para quem quer rodar um LLM local: essa NPU serve para alguma coisa, ou é preciso continuar contando com a GPU integrada Radeon 890M? Este guia testa de forma honesta a stack Ryzen AI para LLM (LM Studio Ryzen AI, Lemonade SDK), compara os resultados com a execução apenas na CPU e na iGPU e dá o veredito — sem exageros.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.
Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#Por que um NPU para um LLM local?
Um NPU (Unidade de Processamento Neural) é um acelerador dedicado às operações matriciais INT8 e INT4 típicas da inferência. No Ryzen AI 9 HX 370, o bloco XDNA 2 fornece até 50 TOPS INT8 com cerca de 2 W de consumo. À primeira vista, essa combinação é imbatível para uso portátil — um LLM que roda sem acionar as ventoinhas e sem esgotar a bateria em 40 minutos.
A palavra-chave Ryzen AI 9 HX LLM NPU aparece em todas as demonstrações da AMD, mas na realidade o ecossistema de software ainda é jovem. A maioria das stacks de LLM (llama.cpp, Ollama, vLLM) ignora completamente a NPU e executa tudo na CPU AVX-512 ou na GPU integrada via Vulkan / ROCm. Para aproveitar a XDNA 2, é necessário usar runtimes específicos compilados pela AMD ou pela comunidade.
#XDNA 2 na prática: o que diz o silício
A arquitetura XDNA 2 integrada ao Strix Point (geração Ryzen AI 300) dobra os TOPS em comparação com a XDNA 1 (16 → 50 TOPS) e introduz suporte nativo a ponto flutuante em blocos nos formatos FP8 e FP16. É a primeira NPU da AMD capaz de executar um LLM de forma razoável, mas com duas grandes restrições.
- Largura de banda da memória
- O NPU compartilha a memória do sistema (LPDDR5X-7500 ou 8000 nas máquinas Strix Point). Oferece cerca de 120 a 128 GB/s, compartilhados com CPU, GPU e sistema operacional. O NPU nunca poderá atingir seu desempenho teórico máximo de cálculo.
- Quantização obrigatória
- O pipeline oficial da AMD exige modelos quantizados em INT4 ou INT8 via o formato ONNX otimizado. Os GGUF Q4_K_M clássicos não funcionam diretamente — é necessária uma conversão.
- Compilação prévia ONNX
- Cada modelo deve ser compilado para XDNA 2 (subgrafos alocados à NPU, o restante à CPU). É a etapa que desencoraja 95 % dos usuários.
- Sem suporte a múltiplos usuários
- O NPU só atende a um processo por vez. Se um LLM o ocupar, nenhuma outra IA do Windows (Studio Effects, Recall, se você o usar) poderá utilizá-lo em paralelo.
#Pré-requisitos de hardware e software
- CPU
- Ryzen AI 9 HX 370, HX 365 ou HX PRO 370 (Strix Point, codinome Krackan). Os Ryzen AI 7/5 funcionam com um NPU mais modesto, mas a mesma stack de software.
- RAM
- No mínimo 32 GB de LPDDR5X para um uso confortável. 64 GB se você quiser testar um modelo de 14B na GPU integrada em paralelo.
- OS
- Windows 11 24H2 ou superior. Existem drivers para as NPUs XDNA no Linux (o driver está integrado ao kernel oficial desde a versão 6.11), mas as ferramentas disponíveis para o usuário estão muito atrasadas.
- Drivers da NPU
- AMD Ryzen AI Software 1.3 ou superior (download separado em amd.com, não incluído no driver Adrenalin).
- Armazenamento
- ~20 GB livres para modelos ONNX pré-compilados (mais volumosos que os equivalentes GGUF).
#1. LM Studio Ryzen AI: a via mais simples
A AMD distribui um fork oficial do LM Studio pré-configurado para XDNA 2. É o caminho recomendado para quem quer testar sem mexer em Python nem no ONNX Runtime.
- 01Baixar o binárioAcesse amd.com/lmstudio (página oficial « LM Studio for Ryzen AI »). O binário para Windows é assinado pela AMD.
- 02Instalação clássicaO instalador coloca o LM Studio na pasta Program Files e configura automaticamente o runtime ONNX RyzenAI Execution Provider.
- 03Selecionar um modelo otimizado para NPUNa aba Discover, filtre pelo selo “Ryzen AI”. Você encontrará Qwen 3.5 9B, Granite 4.2 3B e Granite 4.2 8B pré-compilados para XDNA 2 (sufixo -hybrid).
- 04Carregar e testarAo carregar, o LM Studio exibe um seletor de ambiente de execução: GPU, CPU ou "Ryzen AI Hybrid" (NPU + iGPU). Escolha Hybrid para aproveitar o NPU.
- 05Verificar se o NPU está sendo utilizadoAbra o Gerenciador de Tarefas → aba Desempenho → NPU. A curva deve subir para 60-95% durante a geração. Se permanecer em 0, o runtime passou a usar a CPU.
#2. Lemonade SDK: para ir além de LM Studio
O Lemonade SDK é a ferramenta oficial da AMD para desenvolvedores. Ele tem dois objetivos: (1) compilar seus próprios modelos GGUF/HF para o formato ONNX híbrido, (2) expor uma API compatível com OpenAI que pode ser usada a partir do Open WebUI, Continue.dev etc.
#3. Recorrer à Radeon 890M: muitas vezes a melhor opção
O Ryzen AI 9 HX 370 também possui uma iGPU Radeon 890M (RDNA 3.5, 16 CU). No LM Studio padrão ou no Ollama, essa iGPU pode ser utilizada via Vulkan e às vezes supera o NPU em velocidade de processamento. Veja como utilizá-la.
- Alocação dinâmica de VRAM
- O Radeon 890M compartilha a RAM do sistema. No BIOS UEFI, procure « UMA Frame Buffer Size » e defina pelo menos 8 GB (se possível, 16 GB) antes de qualquer teste de LLM.
- Driver
- Adrenalin 24.10 ou superior para aproveitar o caminho Vulkan otimizado compute. Os drivers OEM Lenovo/Asus costumam estar atrasados em 2 versões.
- ROCm no Linux
- ROCm 6.3+ suporta oficialmente Strix Point desde abril de 2026. No Ubuntu 24.04, é possível usar, mas a unidade gráfica integrada continua limitada pela largura de banda da memória compartilhada.
#Testes de desempenho: NPU vs iGPU vs CPU
Ordens de grandeza registradas em um Asus Zenbook S 14 (Ryzen AI 9 HX 370, 32 GB LPDDR5X-7500, Windows 11 24H2, AMD Ryzen AI Software 1.3, Adrenalin 24.10.1). Prompt curto (~50 tokens), geração de 256 tokens, temperatura 0.7. Média de 5 execuções.
- Qwen 3.5 9B — CPU AVX-512
- 4,1 tok/s · 28 W no encapsulamento do processador · ventilador audível
- Qwen 3.5 9B — Radeon 890M (Vulkan)
- 9,8 tok/s · 35 W no package · ventilador em funcionamento intenso
- Qwen 3.5 9B híbrido — NPU + iGPU (LM Studio Ryzen AI)
- 11,2 tok/s · 18 W no package · ventilador pouco audível
- Granite 4.2 3B — somente na NPU
- 24 tok/s · 9 W no encapsulamento do chip · ventilador desligado
- Granite 4.2 8B — NPU + iGPU
- 13,5 tok/s · 19 W no package · ventilador silencioso
- Gemma 4 12B — Radeon 890M (Vulkan)
- 4,2 tok/s · 38 W · grande demais para a NPU sozinha
#Casos de uso em que a NPU se destaca
- Chatbot de assistência permanente
- Um Granite 4.2 3B ou Qwen 3.5 4B na NPU consome ~5 W e fica disponível 24 horas por dia sem impacto significativo na bateria. Ideal para integração em um aplicativo de produtividade.
- Resumo automático de e-mails / documentos
- Tarefa curta em lote, contexto de 4 a 8 mil tokens, modelos de 3B a 8B. Perfeito para a NPU: ventoinha desligada, processamento silencioso em segundo plano enquanto você trabalha.
- Voz para texto em tempo real + resumo
- Whisper (no iGPU) + Granite 4.2 8B (no NPU) em pipeline — é possível exatamente porque os dois blocos são independentes.
- Modo avião prolongado
- Usando a bateria, o uso de NPU + iGPU permite 4 a 5 horas de uso ativo do LLM contra 1h30 em uma configuração apenas com CPU/iGPU.
#Armadilhas e limitações a conhecer
- Contexto limitado
- A maioria dos modelos pré-compilados AMD limita-se a 4096 tokens de contexto. Para 32k ou mais, você precisa recompilar — e isso consome muito mais memória.
- Sem modelos com mais de 8B apenas na NPU
- Acima de 8B, mesmo em INT4, falta largura de banda ao NPU. Acima de 13B, a iGPU necessariamente assume o processamento.
- Modelos indisponíveis
- Qwen 3.5, DeepSeek, Gemma 4 não são todos oficialmente pré-compilados. Verifique o hub Ryzen AI antes de comprar uma configuração pensando em rodar um modelo específico.
- Atualização do Windows que causa falhas
- Algumas atualizações cumulativas 24H2 desativaram temporariamente a enumeração do NPU. Mantenha o pacote AMD Ryzen AI Software atualizado e verifique o Gerenciador de Dispositivos após cada atualização cumulativa.
- Sem fine-tuning
- O XDNA 2 realiza apenas inferência. Para treinar ou fazer ajuste fino com LoRA, é necessária uma GPU dedicada — ponto.
#Para se aprofundar
Três caminhos para se aprofundar, de acordo com sua próxima etapa:
- Compreender as quantizações
- O NPU XDNA 2 só processa INT4/INT8. O guia « Escolher a quantização (Q4, Q5, Q8, FP16) » explica por que Q4_K_M continua o padrão para CPU/GPU e o que muda com INT4 no NPU.
- Comparar com uma configuração real de GPU
- Se você está em dúvida entre essa opção e um computador de mesa, o guia "Escolher sua GPU para IA local" compara RTX 4070, 4090, M-Max e apresenta os critérios mínimos de compra conforme o uso.
- Configuração mais convencional do Ollama
- Para manter a stack padrão com sua Radeon 890M, o guia de instalação do Ollama no Windows abrange a configuração Vulkan e a gestão de VRAM/RAM compartilhada.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.