Melhor LLM para PCs de IA da AMD (Ryzen AI & NPU)
Un PC com IA da AMD designa uma máquina equipada com um processador Ryzen AI, ou seja, uma APU que reúne núcleos Zen 5, uma GPU Radeon integrada e uma NPU XDNA 2. Escolher o melhor LLM para um PC AMD AI equivale, portanto, a responder a uma pergunta precisa: quanta memória unificada a máquina pode disponibilizar ao modelo e qual largura de banda alimenta essa memória? A resposta não é a mesma para um notebook Ryzen AI 9 HX com 32 GB e para uma estação Ryzen AI Max+ 395 com 128 GB. Este artigo detalha as duas famílias de máquinas, os modelos do catálogo QualLLM que realmente cabem em sua memória, o papel da NPU, as ferramentas de inferência compatíveis e as licenças, e depois responde às perguntas mais frequentes.
Duas famílias de PCs com IA da AMD, dois orçamentos de memória
O termo AMD AI PC abrange máquinas muito diferentes. É necessário distingui-las antes de falar sobre modelos.
- Ryzen AI 300 (HX 370, HX 375, 9 365) : GPU Radeon 890M, memória LPDDR5X em barramento de 128 bits, largura de banda de aproximadamente 120 GB/s (estimada). Os notebooks disponíveis no mercado vêm com 16, 32 ou às vezes 64 GB compartilhados entre o sistema e a GPU. Nosso guia Ryzen AI 9 HX detalha esta configuração.
- Ryzen AI Max (385, 390, Max+ 395, nome de código Strix Halo) : GPU Radeon 8060S com 40 unidades de computação no Max+ 395, barramento de memória de 256 bits, largura de banda de aproximadamente 256 GB/s (estimada). Os mini-PCs e estações são vendidos com 64 ou 128 GB de memória LPDDR5X soldada. O guia Ryzen AI Max+ 395 abrange as configurações do BIOS e do Linux.
A regra prática é simples. O peso do modelo quantizado deve caber na parcela de memória alocada à GPU, com margem para o cache KV e o sistema. Em uma máquina de 128 GB, a parcela destinada à GPU, ajustável no BIOS, normalmente chega a 96 GB no Windows e a valores maiores no Linux por meio da alocação GTT (valor exato a confirmar conforme a placa-mãe e o kernel).
Quais modelos do catálogo cabem em um Ryzen AI Max+ 395 com 128 GB
Com cerca de 96 GB disponíveis para a GPU, uma estação Ryzen AI Max+ 395 comporta vários modelos com 118 a 142 bilhões de parâmetros em quantização Q4. Aqui estão os modelos do catálogo QualLLM, com o tamanho em Q4 indexado e estimativas para as demais quantizações (Q5 ≈ ×1,2, Q8 ≈ ×1,9, FP16 ≈ ×3,4, estimado).
- Qwen 3.5 122B-A10B (Alibaba, Apache 2.0): Q4 ~73 GB, Q5 ~88 GB (estimado), Q8 ~139 GB (não cabe), contexto de 262 000 tokens. Arquitetura MoE com aproximadamente 10 bilhões de parâmetros ativos por token, o que o torna o candidato mais rápido desta lista. Os pesos são publicados por Alibaba no Hugging Face.
- Qwen3.8 Flash Next 125B-A6B (Qwen, licença específica de pesos abertos): Q4 ~72 GB, contexto de 256.000 tokens. Apenas 6 bilhões de parâmetros ativos, portanto uma taxa de processamento ainda superior à do modelo anterior (estimada), com a contrapartida de uma licença que deve ser lida com atenção antes do uso comercial.
- Mistral Small 4 (Mistral AI, Apache 2.0): Q4 ~72 GB, contexto 256.000 tokens. Boa performance em francês, publicado por Mistral AI no Hugging Face.
- Mistral Medium 3.5 128B (Mistral AI, Modified MIT): Q4 ~74 GB, contexto de 256 000 tokens. Posicionado acima do Small 4 em qualidade; verificar as pontuações nas fichas.
- Nemotron 3 Super 120B (NVIDIA, NVIDIA Open Model License): Q4 ~72 GB, contexto de 128 000 tokens. Orientado para raciocínio e agentes. Pesos disponíveis em NVIDIA no Hugging Face.
- Laguna S 2.1 (Poolside, OpenMDW 1.1): Q4 ~68 GB, contexto 262 144 tokens. O mais leve da seleção, especializado em código, publicado por Poolside no Hugging Face.
- Mixtral 8x22B Instruct (Mistral AI, Apache 2.0): Q4 ~82 GB, contexto de 64 000 tokens. Ainda cabe em 96 GB, mas deixa pouco espaço para o cache KV. Modelo mais antigo, útil principalmente como referência.
- dots.llm1 Instruct (Rednote, MIT) : Q4 ~85 GB, contexto de 32.768 tokens. Limite alto para alocação de 96 GB, contexto curto.
Acima disso, Step 3.5 Flash (Q4 ~118 GB) e MiniMax-M2.7 (Q4 ~138 GB) ultrapassam a memória de um PC AMD AI de 128 GB, mesmo sob Linux. Não são opções realistas nessa plataforma sem quantização mais agressiva (Q2 ou Q3, qualidade a confirmar).
Taxa esperada: a largura de banda decide, não o número de núcleos
Em um chip com memória unificada, a geração de tokens é limitada pela largura de banda da memória. Cada token exige que a GPU leia novamente todos os parâmetros ativos. O cálculo aproximado é, portanto: taxa máxima ≈ largura de banda ÷ bytes lidos por token.
- Modelo MoE com 10 bilhões de parâmetros ativos em Q4 (caso do Qwen 3.5 122B-A10B): cerca de 5 a 6 GB lidos por token. Com os 256 GB/s do Ryzen AI Max+ 395, isso resulta em um limite teórico de 40 a 50 tokens/s e uma taxa real de geração de 20 a 35 tokens/s, considerando o cache KV e a sobrecarga do runtime (estimada, não medida pelo QualLLM nessa máquina).
- Modelo MoE com 6 bilhões de parâmetros ativos (Qwen3.8 Flash Next): taxa real estimada de geração de 30 a 50 tokens/s, a confirmar.
- Modelo denso de 70 a 120 bilhões de parâmetros em Q4 : 40 a 70 GB lidos por token, ou seja, 3 a 6 tokens/s. Isso é legível, mas lento para uso interativo. Verifique, portanto, a arquitetura do modelo em sua página de detalhes antes de baixá-lo: a menção «A10B» ou «A6B» indica um MoE.
- Ryzen AI 9 HX 370 : com aproximadamente 120 GB/s, os mesmos MoE de 120 bilhões de parâmetros não cabem na memória. O problema não é a taxa de transferência, mas a capacidade.
Já o processamento do prompt (prefill) depende da capacidade bruta de processamento, e não da largura de banda. Um contexto de 30.000 tokens pode levar várias dezenas de segundos em uma Radeon 8060S. Leve isso em conta ao usar RAG ou analisar documentos longos.
E o NPU XDNA 2? Útil, mas não para modelos grandes
O NPU integrado aos Ryzen AI anuncia cerca de 50 TOPS em INT8. É necessário esclarecer exatamente o que ele faz para um LLM local.
- O que ele faz : executar modelos compilados no formato ONNX através da pilha de software Ryzen AI da AMD, em modo híbrido NPU + GPU para geração. Os modelos suportados são atualmente de pequeno porte, com entre 1 e 8 bilhões de parâmetros (a confirmar conforme a versão da pilha de software).
- O que ele não faz : acelerar um modelo GGUF carregado em llama.cpp ou Ollama. Esses runtimes dependem do GPU Radeon via Vulkan ou ROCm e ignoram o NPU.
- Sua vantagem : aliviar a carga da GPU e reduzir o consumo da bateria nas tarefas em segundo plano (transcrição, pequeno assistente residente, embeddings) enquanto a GPU executa um modelo maior.
Para os modelos com 118 bilhões de parâmetros ou mais listados acima, a NPU não entra em ação. A GPU Radeon e a memória unificada fazem todo o trabalho. Nosso artigo o que é um NPU aprofunda esse ponto.
Ferramentas de inferência compatíveis com Ryzen AI
Existem três opções para rodar um modelo do catálogo em um PC AMD AI.
- llama.cpp com backend Vulkan : a opção mais robusta tanto no Windows quanto no Linux. O backend Vulkan funciona em todos os Radeon integrados sem necessidade de instalar o ROCm. Os ganhos de desempenho relacionados ao formato de quantização (Q4_K_M, Q5_K_M, Q8_0) são comparáveis aos observados em GPUs dedicadas.
- Ollama com ROCm : sob Linux, o ROCm utiliza nativamente o Radeon 8060S. A configuração exige algumas variáveis de ambiente, descritas em nosso guia Ollama em GPU AMD com ROCm. No Windows, o Ollama utiliza Vulkan (suporte a confirmar conforme a versão).
- vLLM : possível no Linux com ROCm, mas voltado para servidores multiusuário. Para uma única estação de trabalho, llama.cpp continua mais simples. A documentação vLLM lista as GPUs AMD compatíveis.
Em todos os casos, configure a memória da GPU no máximo no BIOS (opção frequentemente chamada de “UMA frame buffer” ou “variable graphics memory”), depois verifique com o runtime se o modelo está realmente carregado inteiramente na GPU e não parcialmente na CPU.
Licenças e benchmarks: o que é preciso verificar antes de escolher
A licença condiciona o uso profissional. Os modelos citados se distribuem assim.
- Apache 2.0 : Qwen 3.5 122B-A10B, Mistral Small 4, Mixtral 8x22B. Uso comercial livre, modificação e redistribuição autorizadas.
- MIT ou Modified MIT : dots.llm1 (MIT), Mistral Medium 3.5 (Modified MIT). Ler as cláusulas adicionadas à versão modificada.
- Licenças dos fornecedores : Nemotron 3 Super 120B (NVIDIA Open Model License), Laguna S 2.1 (OpenMDW 1.1), Qwen3.8 Flash Next (licença específica de pesos abertos). Esses textos geralmente permitem o uso comercial, mas acrescentam condições de atribuição ou uso. Nosso guia sobre a conformidade dos modelos de pesos abertos com a Lei da IA ajuda a documentar essa escolha.
Quanto aos benchmarks, QualLLM não mediu esses modelos no Ryzen AI. As pontuações publicadas pelos desenvolvedores dos modelos (MMLU para conhecimentos gerais, HumanEval e SWE-bench para código, AIME para raciocínio matemático) devem ser confirmadas nas fichas e noOpen LLM Leaderboard. Uma pontuação de benchmark não substitui um teste com seus próprios documentos em francês. Nosso guia compreender os leaderboards explica as armadilhas de interpretação.
FAQ
P: Qual LLM escolher para um AMD AI PC com 32 GB de RAM?
Nenhum dos modelos com 118 bilhões de parâmetros ou mais desta seleção cabe em 32 GB. Em um notebook com Ryzen AI 9 HX, busque modelos com 7 a 14 bilhões de parâmetros em Q4, que ocupam 5 a 10 GB. Nosso guia de configuração 32 GB e a página melhor LLM com 8 GB de VRAM listam candidatos adequados.
P: O Ryzen AI Max+ 395 com 128 GB é melhor do que uma placa de vídeo dedicada?
Isso depende do modelo desejado. Uma RX 9070 XT com 16 GB oferece uma largura de banda muito superior e será mais rápida em um modelo de 30 bilhões de parâmetros. Mas ela nunca carregará um modelo de 120 bilhões em Q4. O Ryzen AI Max+ 395 prioriza a capacidade em relação à taxa de geração. Ver nossa página melhor LLM para RX 9070 XT para comparar.
P: É possível usar o NPU para acelerar Ollama ou llama.cpp?
Não, até o momento. Esses dois runtimes usam a GPU Radeon via Vulkan ou ROCm. A NPU XDNA 2 serve apenas aos modelos ONNX executados pela pilha de software Ryzen AI, com aproximadamente 1 a 8 bilhões de parâmetros. Para modelos grandes, conte apenas com a GPU e a memória unificada.
P: É necessário Windows ou Linux em um PC AMD com IA para inferência local?
Os dois funcionam. Windows oferece Vulkan via llama.cpp sem configuração especial. Linux adiciona ROCm e permite alocar mais memória para a GPU além do limite do BIOS, o que é relevante em uma máquina de 128 GB. Para carregar Mixtral 8x22B ou dots.llm1 acima de 80 GB, Linux é a opção mais segura.
Q: Qual quantização escolher em um Ryzen AI Max+ 395?
Q4_K_M oferece um bom equilíbrio para modelos com 118 a 128 bilhões de parâmetros, em torno de 72 GB. Q5 continua sendo possível para os menores, como Laguna S 2.1, com uma estimativa de cerca de 82 GB. Q8 ultrapassa a memória disponível para toda essa seleção. Mantenha pelo menos 10 GB livres para o cache KV se usar contextos longos.
P: Esses modelos são bons em francês?
Mistral Small 4 e Mistral Medium 3.5 são treinados por uma desenvolvedora francesa e apresentam bom desempenho em francês. Qwen 3.5 122B-A10B é multilíngue e oferece suporte adequado ao francês. As pontuações exatas por idioma precisam ser confirmadas nas fichas. Nossa página melhor LLM em francês compara vários modelos nesse critério.
Conclusão
O melhor LLM para um PC AMD com inteligência artificial depende, antes de tudo, da memória disponível. Em um Ryzen AI Max+ 395 com 128 GB, Qwen 3.5 122B-A10B, Mistral Small 4 e Nemotron 3 Super 120B cabem em Q4, com velocidade suficiente para uso interativo nas arquiteturas MoE. Em um Ryzen AI 9 HX com 32 GB, opte por modelos muito menores. O NPU continua sendo um recurso auxiliar para tarefas pequenas. Para refinar a escolha conforme sua máquina específica, use o configurador ou navegue pelo catálogo filtrado por VRAM.
O hardware para rodar um LLM localmente
Para executar esses modelos localmente com conforto, uma RTX 5070 Ti oferece uma excelente relação preço/desempenho. Compare os preços:
Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.