Melhor LLM para Ryzen AI 9

Escolher o melhor LLM para Ryzen AI 9 não é uma questão de potência bruta, mas de adequação entre a memória unificada disponível, a arquitetura do modelo (densa ou Mixture-of-Experts) e a taxa real de processamento da iGPU RDNA e da NPU XDNA. Nessas plataformas, um modelo MoE com poucos parâmetros ativos frequentemente supera um modelo denso menor. Este artigo detalha as especificações de VRAM por quantização, as taxas de processamento esperadas, as licenças, as referências de benchmark e os casos de uso concretos para montar uma estação de inferência local coerente no Ryzen AI 9.

Compreender a restrição de memória do Ryzen AI 9

As APUs Ryzen AI 9 (HX e Max) se baseiam em memória unificada compartilhada entre CPU, iGPU e NPU. A quantidade de memória que pode ser alocada à GPU determina diretamente qual modelo você poderá carregar. Em uma configuração Ryzen AI Max 395 com 128 GB de memória unificada, a capacidade de memória utilizável para inferência supera em muito a de um HX 370 limitado a cerca de 32 GB.

Referências de dimensionamento (ordens de grandeza, a confirmar conforme sua alocação no BIOS):

Para conhecer o procedimento completo de alocação entre NPU e iGPU, consulte o guia Ryzen AI 9 HX e o guia Ryzen AI Max 395. A escolha da quantização é detalhada no nosso guia Q4/Q5/Q8.

Por que preferir modelos MoE com baixa ativação

Em uma iGPU com largura de banda de memória moderada, o fator limitante é o número de parâmetros actifs por token, não o total. Um modelo Mixture-of-Experts ativa apenas uma fração de seus pesos em cada passagem.

Esses três modelos só cabem em Q4 em configurações com memória unificada elevada (tipo Ryzen AI Max 395, 128 GB). Em um HX 370 com 32 GB, ficam fora do alcance local sem offload em disco muito lento.

Modelos compactos densos e alternativas

Se sua carga de trabalho exigir um modelo denso mais previsível:

Com a mesma VRAM, um modelo denso exige mais largura de banda por token do que um MoE com baixa ativação: espere uma taxa de geração menor na iGPU. As taxas exatas de tokens por segundo no Ryzen AI dependem do backend e da alocação de memória e ainda precisam ser confirmadas na sua máquina.

Licenças e conformidade

Para uso profissional, a licença é tão importante quanto a taxa de processamento:

Para os desafios regulatórios europeus, consulte nosso guia de conformidade com a Lei da IA.

Backends de inferência recomendados

A escolha do motor de inferência influencia fortemente a taxa de geração obtida:

Mantenha a inferência estritamente local: o objetivo de um computador com Ryzen AI 9 é manter seus dados na própria máquina.

FAQ

P: Qual modelo cabe em um Ryzen AI 9 HX 370 (32 GB)?

Com ~32 GB de memória unificada, dos quais uma parte é reservada para a GPU, os modelos listados aqui (68 GB+ em Q4) não cabem. O HX 370 é mais voltado a modelos mais leves, fora desta seleção. Consulte o catálogo filtrado por VRAM e o configurador para um dimensionamento adequado à sua memória real.

P: MoE ou denso para uma iGPU AMD?

Um MoE com baixa ativação como Qwen3.8 Flash Next 125B-A6B (~6B ativos) exige menos largura de banda por token do que um modelo denso de 120B. Em uma iGPU com largura de banda limitada, o MoE geralmente oferece uma melhor taxa de geração de tokens no uso interativo com qualidade comparável, ao custo de uma ocupação total de memória maior.

P: Qual quantização escolher?

O Q4 maximiza o número de parâmetros que podem ser carregados e continua sendo o ponto de equilíbrio mais comum. O Q5 melhora ligeiramente a fidelidade com ~20% a mais de VRAM. O Q8 dobra o uso de memória: reserve-o para configurações de 128 GB. Detalhes no guia Q4/Q5/Q8.

P: A NPU acelera a inferência de LLM?

O NPU XDNA se destina principalmente a cargas específicas e sua integração aos backends de LLM open-source está em evolução. Na prática, a iGPU RDNA via Vulkan/ROCm responde pela maior parte da inferência hoje. Verifique o suporte atualizado em llama.cpp — o estado exato ainda precisa ser confirmado conforme seu driver.

P: Qual licença para uso comercial?

Prefira Apache 2.0 (Qwen 3.5 122B-A10B, Mixtral 8x22B, Mistral Small 4) ou MIT (dots.llm1 Instruct) para maior liberdade de uso. As licenças NVIDIA e Databricks impõem condições específicas que devem ser lidas antes de qualquer implantação.

Conclusão

Le melhor LLM para Ryzen AI 9 depende principalmente da sua memória unificada: em uma configuração de 128 GB como a do Ryzen AI Max 395, os modelos MoE com baixa ativação, como Qwen 3.5 122B-A10B ou Qwen3.8 Flash Next 125B-A6B, oferecem a melhor relação entre taxa de geração e qualidade em Q4, enquanto Mistral Small 4 continua sendo uma opção densa permissiva. Verifique suas taxas de geração reais antes de definir uma escolha. Dimensione seu computador com o configurador ou navegue pelo catálogo complet.

O hardware para rodar um LLM localmente

Para executar esses modelos localmente com conforto, uma RTX 5070 Ti oferece uma excelente relação preço/desempenho. Compare os preços:

Amazon RTX 5070 Ti →

Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

Artigo publicado e atualizado em por Mohamed Meguedmi · Fonte de dados: /api/models.json · Licença de conteúdo: CC BY 4.0.

Algum erro ou alguma atualização para informar? Contribuir.