Melhor LLM para Ryzen AI 9
Escolher o melhor LLM para Ryzen AI 9 não é uma questão de potência bruta, mas de adequação entre a memória unificada disponível, a arquitetura do modelo (densa ou Mixture-of-Experts) e a taxa real de processamento da iGPU RDNA e da NPU XDNA. Nessas plataformas, um modelo MoE com poucos parâmetros ativos frequentemente supera um modelo denso menor. Este artigo detalha as especificações de VRAM por quantização, as taxas de processamento esperadas, as licenças, as referências de benchmark e os casos de uso concretos para montar uma estação de inferência local coerente no Ryzen AI 9.
Compreender a restrição de memória do Ryzen AI 9
As APUs Ryzen AI 9 (HX e Max) se baseiam em memória unificada compartilhada entre CPU, iGPU e NPU. A quantidade de memória que pode ser alocada à GPU determina diretamente qual modelo você poderá carregar. Em uma configuração Ryzen AI Max 395 com 128 GB de memória unificada, a capacidade de memória utilizável para inferência supera em muito a de um HX 370 limitado a cerca de 32 GB.
Referências de dimensionamento (ordens de grandeza, a confirmar conforme sua alocação no BIOS):
- Q4 : ~0,55 a 0,60 GB de VRAM por bilhão de parâmetros armazenados
- Q5 : aproximadamente +20% em relação ao Q4
- Q8 : aproximadamente o dobro do Q4
- FP16 : aproximadamente o quádruplo do Q4
Para conhecer o procedimento completo de alocação entre NPU e iGPU, consulte o guia Ryzen AI 9 HX e o guia Ryzen AI Max 395. A escolha da quantização é detalhada no nosso guia Q4/Q5/Q8.
Por que preferir modelos MoE com baixa ativação
Em uma iGPU com largura de banda de memória moderada, o fator limitante é o número de parâmetros actifs por token, não o total. Um modelo Mixture-of-Experts ativa apenas uma fração de seus pesos em cada passagem.
- Qwen3.8 Flash Next 125B-A6B (125B, ~72 GB em Q4, ctx 256000): apenas ~6B de parâmetros ativos, o que o torna um candidato eficiente para uma taxa de geração interativa em sistemas com grande capacidade de memória unificada. Veja a ficha Qwen3.8 Flash Next e a desenvolvedora Alibaba no Hugging Face.
- Qwen 3.5 122B-A10B (122B, ~73 GB Q4, ctx 262000, Apache 2.0): ~10B ativos, bom equilíbrio entre qualidade e taxa de geração. Veja a ficha do Qwen 3.5 122B-A10B.
- Mixtral 8x22B Instruct (141B, ~82 GB Q4, ctx 64000, Apache 2.0): modelo MoE histórico da Mistral AI no Hugging Face, uma escolha confiável. Ver a ficha Mixtral 8x22B.
Esses três modelos só cabem em Q4 em configurações com memória unificada elevada (tipo Ryzen AI Max 395, 128 GB). Em um HX 370 com 32 GB, ficam fora do alcance local sem offload em disco muito lento.
Modelos compactos densos e alternativas
Se sua carga de trabalho exigir um modelo denso mais previsível:
- Mistral Small 4 (119B, ~72 GB Q4, ctx 256000, Apache 2.0): licença permissiva para uso comercial. Veja a ficha Mistral Small 4.
- Nemotron 3 Super 120B (120B, ~72 GB Q4, ctx 128000, NVIDIA Open Model License): veja a ficha Nemotron 3 Super et NVIDIA no Hugging Face.
- DBRX Instruct (132B, ~76 GB Q4, ctx 32768, Databricks Open Model License): ver a ficha DBRX Instruct.
- dots.llm1 Instruct (142B, ~85 GB Q4, ctx 32768, MIT) : ver a ficha do dots.llm1.
Com a mesma VRAM, um modelo denso exige mais largura de banda por token do que um MoE com baixa ativação: espere uma taxa de geração menor na iGPU. As taxas exatas de tokens por segundo no Ryzen AI dependem do backend e da alocação de memória e ainda precisam ser confirmadas na sua máquina.
Licenças e conformidade
Para uso profissional, a licença é tão importante quanto a taxa de processamento:
- Apache 2.0 : Qwen 3.5 122B-A10B, Mixtral 8x22B, Mistral Small 4 — uso comercial amplo.
- MIT : dots.llm1 Instruct — muito permissiva.
- NVIDIA Open Model License : Nemotron 3 Super 120B — verifique as cláusulas de atribuição.
- Databricks Open Model License : DBRX Instruct — condições específicas que devem ser lidas.
Para os desafios regulatórios europeus, consulte nosso guia de conformidade com a Lei da IA.
Backends de inferência recomendados
A escolha do motor de inferência influencia fortemente a taxa de geração obtida:
- llama.cpp : suporte a Vulkan/ROCm para iGPU AMD, formato GGUF quantizado, ideal para hospedagem própria em Ryzen AI.
- Ollama : camada prática para gerenciar modelos GGUF localmente.
- vLLM : voltado à taxa de processamento do servidor, relevante se você disponibiliza uma API interna.
Mantenha a inferência estritamente local: o objetivo de um computador com Ryzen AI 9 é manter seus dados na própria máquina.
FAQ
P: Qual modelo cabe em um Ryzen AI 9 HX 370 (32 GB)?
Com ~32 GB de memória unificada, dos quais uma parte é reservada para a GPU, os modelos listados aqui (68 GB+ em Q4) não cabem. O HX 370 é mais voltado a modelos mais leves, fora desta seleção. Consulte o catálogo filtrado por VRAM e o configurador para um dimensionamento adequado à sua memória real.
P: MoE ou denso para uma iGPU AMD?
Um MoE com baixa ativação como Qwen3.8 Flash Next 125B-A6B (~6B ativos) exige menos largura de banda por token do que um modelo denso de 120B. Em uma iGPU com largura de banda limitada, o MoE geralmente oferece uma melhor taxa de geração de tokens no uso interativo com qualidade comparável, ao custo de uma ocupação total de memória maior.
P: Qual quantização escolher?
O Q4 maximiza o número de parâmetros que podem ser carregados e continua sendo o ponto de equilíbrio mais comum. O Q5 melhora ligeiramente a fidelidade com ~20% a mais de VRAM. O Q8 dobra o uso de memória: reserve-o para configurações de 128 GB. Detalhes no guia Q4/Q5/Q8.
P: A NPU acelera a inferência de LLM?
O NPU XDNA se destina principalmente a cargas específicas e sua integração aos backends de LLM open-source está em evolução. Na prática, a iGPU RDNA via Vulkan/ROCm responde pela maior parte da inferência hoje. Verifique o suporte atualizado em llama.cpp — o estado exato ainda precisa ser confirmado conforme seu driver.
P: Qual licença para uso comercial?
Prefira Apache 2.0 (Qwen 3.5 122B-A10B, Mixtral 8x22B, Mistral Small 4) ou MIT (dots.llm1 Instruct) para maior liberdade de uso. As licenças NVIDIA e Databricks impõem condições específicas que devem ser lidas antes de qualquer implantação.
Conclusão
Le melhor LLM para Ryzen AI 9 depende principalmente da sua memória unificada: em uma configuração de 128 GB como a do Ryzen AI Max 395, os modelos MoE com baixa ativação, como Qwen 3.5 122B-A10B ou Qwen3.8 Flash Next 125B-A6B, oferecem a melhor relação entre taxa de geração e qualidade em Q4, enquanto Mistral Small 4 continua sendo uma opção densa permissiva. Verifique suas taxas de geração reais antes de definir uma escolha. Dimensione seu computador com o configurador ou navegue pelo catálogo complet.
O hardware para rodar um LLM localmente
Para executar esses modelos localmente com conforto, uma RTX 5070 Ti oferece uma excelente relação preço/desempenho. Compare os preços:
Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.