Melhor LLM para PCs de IA da AMD (Ryzen AI & NPU)

Un PC com IA da AMD designa uma máquina equipada com um processador Ryzen AI, ou seja, uma APU que reúne núcleos Zen 5, uma GPU Radeon integrada e uma NPU XDNA 2. Escolher o melhor LLM para um PC AMD AI equivale, portanto, a responder a uma pergunta precisa: quanta memória unificada a máquina pode disponibilizar ao modelo e qual largura de banda alimenta essa memória? A resposta não é a mesma para um notebook Ryzen AI 9 HX com 32 GB e para uma estação Ryzen AI Max+ 395 com 128 GB. Este artigo detalha as duas famílias de máquinas, os modelos do catálogo QualLLM que realmente cabem em sua memória, o papel da NPU, as ferramentas de inferência compatíveis e as licenças, e depois responde às perguntas mais frequentes.

Duas famílias de PCs com IA da AMD, dois orçamentos de memória

O termo AMD AI PC abrange máquinas muito diferentes. É necessário distingui-las antes de falar sobre modelos.

A regra prática é simples. O peso do modelo quantizado deve caber na parcela de memória alocada à GPU, com margem para o cache KV e o sistema. Em uma máquina de 128 GB, a parcela destinada à GPU, ajustável no BIOS, normalmente chega a 96 GB no Windows e a valores maiores no Linux por meio da alocação GTT (valor exato a confirmar conforme a placa-mãe e o kernel).

Quais modelos do catálogo cabem em um Ryzen AI Max+ 395 com 128 GB

Com cerca de 96 GB disponíveis para a GPU, uma estação Ryzen AI Max+ 395 comporta vários modelos com 118 a 142 bilhões de parâmetros em quantização Q4. Aqui estão os modelos do catálogo QualLLM, com o tamanho em Q4 indexado e estimativas para as demais quantizações (Q5 ≈ ×1,2, Q8 ≈ ×1,9, FP16 ≈ ×3,4, estimado).

Acima disso, Step 3.5 Flash (Q4 ~118 GB) e MiniMax-M2.7 (Q4 ~138 GB) ultrapassam a memória de um PC AMD AI de 128 GB, mesmo sob Linux. Não são opções realistas nessa plataforma sem quantização mais agressiva (Q2 ou Q3, qualidade a confirmar).

Taxa esperada: a largura de banda decide, não o número de núcleos

Em um chip com memória unificada, a geração de tokens é limitada pela largura de banda da memória. Cada token exige que a GPU leia novamente todos os parâmetros ativos. O cálculo aproximado é, portanto: taxa máxima ≈ largura de banda ÷ bytes lidos por token.

Já o processamento do prompt (prefill) depende da capacidade bruta de processamento, e não da largura de banda. Um contexto de 30.000 tokens pode levar várias dezenas de segundos em uma Radeon 8060S. Leve isso em conta ao usar RAG ou analisar documentos longos.

E o NPU XDNA 2? Útil, mas não para modelos grandes

O NPU integrado aos Ryzen AI anuncia cerca de 50 TOPS em INT8. É necessário esclarecer exatamente o que ele faz para um LLM local.

Para os modelos com 118 bilhões de parâmetros ou mais listados acima, a NPU não entra em ação. A GPU Radeon e a memória unificada fazem todo o trabalho. Nosso artigo o que é um NPU aprofunda esse ponto.

Ferramentas de inferência compatíveis com Ryzen AI

Existem três opções para rodar um modelo do catálogo em um PC AMD AI.

Em todos os casos, configure a memória da GPU no máximo no BIOS (opção frequentemente chamada de “UMA frame buffer” ou “variable graphics memory”), depois verifique com o runtime se o modelo está realmente carregado inteiramente na GPU e não parcialmente na CPU.

Licenças e benchmarks: o que é preciso verificar antes de escolher

A licença condiciona o uso profissional. Os modelos citados se distribuem assim.

Quanto aos benchmarks, QualLLM não mediu esses modelos no Ryzen AI. As pontuações publicadas pelos desenvolvedores dos modelos (MMLU para conhecimentos gerais, HumanEval e SWE-bench para código, AIME para raciocínio matemático) devem ser confirmadas nas fichas e noOpen LLM Leaderboard. Uma pontuação de benchmark não substitui um teste com seus próprios documentos em francês. Nosso guia compreender os leaderboards explica as armadilhas de interpretação.

FAQ

P: Qual LLM escolher para um AMD AI PC com 32 GB de RAM?

Nenhum dos modelos com 118 bilhões de parâmetros ou mais desta seleção cabe em 32 GB. Em um notebook com Ryzen AI 9 HX, busque modelos com 7 a 14 bilhões de parâmetros em Q4, que ocupam 5 a 10 GB. Nosso guia de configuração 32 GB e a página melhor LLM com 8 GB de VRAM listam candidatos adequados.

P: O Ryzen AI Max+ 395 com 128 GB é melhor do que uma placa de vídeo dedicada?

Isso depende do modelo desejado. Uma RX 9070 XT com 16 GB oferece uma largura de banda muito superior e será mais rápida em um modelo de 30 bilhões de parâmetros. Mas ela nunca carregará um modelo de 120 bilhões em Q4. O Ryzen AI Max+ 395 prioriza a capacidade em relação à taxa de geração. Ver nossa página melhor LLM para RX 9070 XT para comparar.

P: É possível usar o NPU para acelerar Ollama ou llama.cpp?

Não, até o momento. Esses dois runtimes usam a GPU Radeon via Vulkan ou ROCm. A NPU XDNA 2 serve apenas aos modelos ONNX executados pela pilha de software Ryzen AI, com aproximadamente 1 a 8 bilhões de parâmetros. Para modelos grandes, conte apenas com a GPU e a memória unificada.

P: É necessário Windows ou Linux em um PC AMD com IA para inferência local?

Os dois funcionam. Windows oferece Vulkan via llama.cpp sem configuração especial. Linux adiciona ROCm e permite alocar mais memória para a GPU além do limite do BIOS, o que é relevante em uma máquina de 128 GB. Para carregar Mixtral 8x22B ou dots.llm1 acima de 80 GB, Linux é a opção mais segura.

Q: Qual quantização escolher em um Ryzen AI Max+ 395?

Q4_K_M oferece um bom equilíbrio para modelos com 118 a 128 bilhões de parâmetros, em torno de 72 GB. Q5 continua sendo possível para os menores, como Laguna S 2.1, com uma estimativa de cerca de 82 GB. Q8 ultrapassa a memória disponível para toda essa seleção. Mantenha pelo menos 10 GB livres para o cache KV se usar contextos longos.

P: Esses modelos são bons em francês?

Mistral Small 4 e Mistral Medium 3.5 são treinados por uma desenvolvedora francesa e apresentam bom desempenho em francês. Qwen 3.5 122B-A10B é multilíngue e oferece suporte adequado ao francês. As pontuações exatas por idioma precisam ser confirmadas nas fichas. Nossa página melhor LLM em francês compara vários modelos nesse critério.

Conclusão

O melhor LLM para um PC AMD com inteligência artificial depende, antes de tudo, da memória disponível. Em um Ryzen AI Max+ 395 com 128 GB, Qwen 3.5 122B-A10B, Mistral Small 4 e Nemotron 3 Super 120B cabem em Q4, com velocidade suficiente para uso interativo nas arquiteturas MoE. Em um Ryzen AI 9 HX com 32 GB, opte por modelos muito menores. O NPU continua sendo um recurso auxiliar para tarefas pequenas. Para refinar a escolha conforme sua máquina específica, use o configurador ou navegue pelo catálogo filtrado por VRAM.

O hardware para rodar um LLM localmente

Para executar esses modelos localmente com conforto, uma RTX 5070 Ti oferece uma excelente relação preço/desempenho. Compare os preços:

Amazon RTX 5070 Ti →

Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

Artigo publicado e atualizado em por Mohamed Meguedmi · Fonte de dados: /api/models.json · Licença de conteúdo: CC BY 4.0.

Algum erro ou alguma atualização para informar? Contribuir.