Ryzen AI Max+ 395 (Strix Halo): 128 GB de memória para LLM locaux
O Ryzen AI Max+ 395 (codinome Strix Halo) é a APU com a qual a AMD disputa diretamente o mercado de IA local, até agora dominado por Macs com memória unificada e GPUs de 24 GB. Seu grande trunfo: até 128 GB de memória compartilhada entre CPU, GPU e NPU, cuja esmagadora maioria pode ser alocada ao modelo. Este guia faz um balanço honesto do que o Ryzen AI Max+ 395 realmente permite fazer com LLMs — quais modelos de 70B e MoE se tornam acessíveis, a que velocidade, em comparação com GPUs dedicadas e Macs, e como configurá-lo com ROCm e Vulkan.
Você está escolhendo uma máquina? Nossas escolhas por orçamento → · Nossa ficha mini-PC Ryzen AI Max 128 GB →
Opção de compra para este guia: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#Por que o Ryzen AI Max+ 395 muda a dinâmica para o LLM local
Executar um modelo grande localmente quase sempre esbarra no mesmo limite: a memória de vídeo. Uma RTX 4090 tem um limite de 24 GB, uma RTX 5090 de 32 GB, e, para ir além, é necessário combinar várias placas ou recorrer a um Mac Studio. O Ryzen AI Max+ 395 aborda esse limite por outro ângulo: em vez de uma VRAM dedicada limitada, ele compartilha um grande conjunto de memória unificada entre a CPU, a GPU integrada e a NPU. Em uma máquina equipada com 128 GB, é possível reservar mais de 90 GB para a GPU para inferência.
Na prática, isso abre uma categoria de máquinas que não existia no universo dos PCs: mini-PCs e laptops com preços muito variáveis, cuja capacidade de carregar um modelo 70B, ou até modelos de mistura de especialistas muito maiores, precisa ser verificada, sem placa de vídeo dedicada e sem configuração com múltiplas GPUs. É o primeiro concorrente x86 de peso do Mac Studio para IA local com grande capacidade de memória.
#O chip em detalhes
O Ryzen AI Max+ 395 é uma APU monolítica que combina três motores de cálculo em um único die, todos conectados ao mesmo controlador de memória. Para o LLM, são principalmente a GPU e a memória que importam, mas o conjunto forma um todo coerente.
- CPU — 16 núcleos Zen 5
- 16 núcleos / 32 threads Zen 5, úteis para o pré-processamento, o offload parcial para a CPU e tudo o que não seja a própria inferência na GPU.
- GPU — Radeon 8060S (RDNA 3.5)
- 40 unidades de cálculo na arquitetura RDNA 3.5. É o maior GPU integrado do mercado de PCs e é ele que realiza a inferência via ROCm ou Vulkan.
- NPU — XDNA 2, ~50 TOPS
- Um acelerador dedicado à IA, com baixo consumo de energia. Adequado para certas cargas otimizadas, mas a maioria dos runtimes de LLM (Ollama, llama.cpp) é voltada hoje para a GPU, não para a NPU.
- Memória — LPDDR5X até 128 GB
- Barramento de 256 bits, LPDDR5X a 8000 MT/s, ou seja, cerca de 256 GB/s de largura de banda compartilhada. Unificada entre CPU, GPU e NPU.
#Memória unificada de 128 GB, o principal atrativo
Em uma GPU convencional, a VRAM e a RAM do sistema são dois conjuntos de memória separados: um modelo que excede a capacidade da VRAM passa a usar a RAM via PCIe, e o desempenho da inferência despenca. No Ryzen AI Max+ 395, há um único conjunto físico de memória. A GPU acessa diretamente a memória unificada, exatamente como no caso da memória unificada de um Mac Apple Silicon. Sem cópia entre dois espaços, sem gargalo no PCIe.
A quantidade efetivamente disponível para o modelo depende da divisão entre memória do “sistema” e memória da “GPU”. Conforme o firmware e o sistema operacional, reserva-se uma parte fixa para a GPU (parâmetro UMA no BIOS) e/ou permite-se que o driver aloque dinamicamente o restante (GTT no Linux). Na prática, em uma máquina com 128 GB, é comum disponibilizar 96 GB, e muitas vezes mais, para a GPU realizar a inferência.
- Um único pool
- 128 GB compartilhados. O que o modelo não usa permanece disponível para o sistema e vice-versa.
- Alocação de GPU generosa
- 90 GB ou mais utilizáveis para os pesos do modelo e o cache de contexto, dependendo da configuração do BIOS/driver.
- Sem barreira PCIe
- Ao contrário de uma GPU dedicada que precisa transferir parte dos dados para a RAM, aqui tudo cabe no mesmo espaço de memória de alta velocidade.
- Uso confortável de contextos longos
- A margem de memória permite janelas de contexto extensas em situações nas quais uma GPU de 24 GB precisa sacrificar o tamanho do modelo ou o contexto.
#Quais modelos cabem (70B Q4, MoE)
Com cerca de 90 GB disponíveis, o Ryzen AI Max+ 395 muda completamente a lista de modelos possíveis em comparação com um GPU de 16 a 24 GB. Aqui estão os níveis concretos, mantendo os referenciais de VRAM habituais em Q4: 7B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19 GB, 70B ≈ 40 GB.
- 70B em Q4_K_M (~40 GB)
- Cabe com folga, com margem para um contexto grande. É o principal caso de uso: um modelo denso de 70B ou equivalente, impossível em uma única RTX 4090.
- 70B em Q8_0 (~75 GB)
- Também cabe, quase sem perda de qualidade. Impensável em uma GPU de consumo sem usar múltiplas GPUs.
- Modelos MoE como Qwen 3.6 35B-A3B ou GLM 4.7 Flash
- Os modelos mixture-of-experts são ideais: todos os pesos são carregados na memória (o que ocupa bastante espaço), mas apenas alguns bilhões de parâmetros ficam ativos por token, então a velocidade continua boa.
- Modelos MoE grandes (200B+ em Q4)
- Modelos como Qwen3-235B-A22B com quantização agressiva podem caber em 90 GB. A taxa de geração depende do número de parâmetros ativos, não do tamanho total.
- DeepSeek 671B e similares
- Grandes demais mesmo em Q4 (bem acima de 100 GB para os pesos). Continuam fora de alcance sem offload para disco — prefira um Mac Studio com uma capacidade de memória muito grande ou uma estação dedicada ao llama.cpp.
#Desempenho real: a largura de banda decide
Esse é o ponto que você precisa entender antes de qualquer compra. A geração de tokens de um modelo denso é limitada pela largura de banda da memória, não pela capacidade bruta de processamento. A taxa teórica máxima pode ser calculada aproximadamente dividindo a largura de banda pelo tamanho do modelo na memória.
O Ryzen AI Max+ 395 oferece cerca de 256 GB/s. Um modelo de 70B em Q4 (~40 GB) tem, portanto, um limite teórico de cerca de 6 tokens/s, e na prática observa-se algo mais próximo de 4 a 5 tokens/s na geração — dá para acompanhar a leitura, mas não é rápido. Em contrapartida, um MoE 30B-A3B lê apenas uma pequena parte dos pesos por token e chega facilmente a várias dezenas de tokens/s. Já o pré-processamento do prompt utiliza as 40 CU da GPU e mantém um desempenho razoável.
- Modelo denso 70B Q4
- ≈ 4–5 tok/s na geração. Confortável para redação e análise, lento para chats muito interativos.
- Modelo denso 32B Q4
- Muito mais fluido (~19 GB lidos/token), bom equilíbrio entre qualidade e velocidade no dia a dia.
- MoE 30B-A3B
- Dezenas de tok/s: a velocidade depende dos ~3B ativos, não dos 30B totais.
- Comparação RTX
- Uma RTX 4090 (~1000 GB/s) supera de longe o Strix Halo em taxa de transferência bruta, mas fica limitada a 24 GB e simplesmente não consegue carregar um modelo de 70B sozinha.
#Mini-PC versus laptop versus Mac Studio, o comparativo honesto
O Ryzen AI Max+ 395 está disponível em vários formatos. A escolha depende da mobilidade, da capacidade de manter o resfriamento e do preço, enquanto o chip permanece idêntico. Frente a ele, a referência a superar continua sendo o Mac Studio e suas variantes M-Max/Ultra com grande capacidade de memória unificada.
- Mini-PC (ex. Framework Desktop, GMKtec EVO-X2)
- A melhor relação desempenho sustentado/preço. Resfriamento estável para inferência longa, compacto, silencioso, ideal como servidor doméstico 24/7.
- Notebook (ex. HP ZBook Ultra G1a, Asus ROG Flow Z13)
- A mesma capacidade de memória em um dispositivo portátil, mas com throttling térmico sob carga prolongada e autonomia limitada durante a inferência. Prático para trabalhar em qualquer lugar, menos adequado para um servidor.
- Mac Studio (M-Max / Ultra)
- Largura de banda da memória muito superior (várias centenas de GB/s, até ~800 GB/s no Ultra) e ecossistema MLX muito otimizado. Mais rápido em modelos densos, mas significativamente mais caro para a mesma capacidade de memória.
- Mac mini M4 Pro
- Menos memória máxima, mas excelente para modelos até 32B. Considere se você não precisar de modelos de 70B ou mais.
Em resumo: o Strix Halo leva vantagem no preço em configurações com alta capacidade de memória e no ecossistema x86/Linux; o Mac Studio leva vantagem na velocidade de geração e na maturidade do software. Para usar um modelo 70B de forma « acessível » sem gastar uma fortuna, o Ryzen AI Max+ 395 em um mini-PC com 128 GB é hoje a opção x86 mais adequada.
#Configuração do ROCm e Vulkan no Linux
No Linux, existem duas rotas para o GPU integrado: ROCm (a stack de cálculo da AMD) e Vulkan (portável e muitas vezes mais fácil de configurar nesse GPU recente). A etapa-chave, comum às duas, é garantir que uma quantidade suficiente de memória seja acessível ao GPU.
- 01Configurar a alocação de memória da GPU no BIOSEntre no BIOS/UEFI e procure o parâmetro UMA Frame Buffer Size (ou 'Dedicated GPU Memory'). Reserve uma parte generosa para a GPU. O restante será alocado dinamicamente pelo driver amdgpu via memória GTT.
- 02Verificar a memória GTT reconhecida pelo driverNo Linux, a memória que pode ser alocada dinamicamente à GPU passa pelo mecanismo GTT do driver amdgpu. Um kernel recente (6.10+) e um firmware amdgpu atualizado maximizam a parcela utilizável para inferência.
- 03Instalar uma stack voltada para a GPUA maneira mais simples é usar uma build do Ollama ou do llama.cpp com backend Vulkan, que detecta o Radeon 8060S sem uma configuração complexa do ROCm. Para o ROCm, instale o pacote oficial e verifique se a GPU aparece na lista.
- 04Forçar a arquitetura-alvo da GPU, se necessárioComo a GPU integrada nem sempre está na lista oficial de alvos do ROCm, às vezes é necessário indicar a versão da arquitetura GFX por meio de uma variável de ambiente para que Ollama/llama.cpp a aceite.
- 05Iniciar um modelo e verificar o offloadInicie um modelo e confirme que ele está realmente rodando na GPU (e não na CPU) antes de tirar qualquer conclusão sobre o desempenho.
#Configuração no Windows
No Windows, a experiência é mais "plug and play" em relação ao driver, mas a alocação de memória continua sendo o ponto sensível. A lógica é a mesma: disponibilizar memória suficiente para a GPU e depois usar um runtime que a aproveite.
- 01Instalar o último driver AMD AdrenalinUse o driver mais recente para o Ryzen AI Max+ 395: o suporte a LLMs da GPU integrada e a alocação de memória melhoram a cada versão. Os drivers mais recentes expõem uma parte importante da memória unificada como VRAM.
- 02Ajustar a memória gráfica dedicadaNo BIOS (UMA Frame Buffer Size) ou pelo utilitário AMD, aumente a memória gráfica dedicada para deixar espaço para modelos grandes. Um valor muito baixo fará com que parte do modelo passe a ser executada na CPU.
- 03Instalar LM Studio ou OllamaLM Studio detecta a GPU AMD e oferece um backend adequado; é a opção mais simples sem linha de comando. Ollama para Windows também funciona e expõe seu endpoint em http://localhost:11434.
- 04Carregar um GGUF e verificar o offload para a GPUNo LM Studio, carregue um modelo 70B em Q4 e mova o controle deslizante de offload para a GPU até o máximo. Verifique se as camadas estão realmente na GPU, e não na CPU.
#Solução de problemas e dicas
- O modelo roda na CPU, não na GPU
- Verifique « ollama ps » / « rocm-smi ». Muitas vezes, a quantidade de memória alocada à GPU é muito pequena: aumente o UMA Frame Buffer no BIOS ou verifique a GTT no Linux.
- ROCm não detecta o Radeon 8060S
- O GPU integrado RDNA 3.5 não está sempre na lista oficial. Exporte HSA_OVERRIDE_GFX_VERSION ou mude para o backend Vulkan, que o detecta sem sobrecarga.
- Geração anormalmente lenta em um 70B denso
- É esperado: ~4–5 tok/s é o limite realista a 256 GB/s. Para maior velocidade, passe para um modelo MoE ou um modelo menor — não é um bug.
- Impossível alocar 90 GB para a GPU
- Firmware do BIOS e driver/kernel muito antigos limitam a alocação. Atualize o BIOS, o driver Adrenalin (Windows) ou o kernel/firmware amdgpu (Linux).
- Contexto longo que causa travamento
- O cache KV se soma aos pesos na memória. Reduza num_ctx ou o tamanho do modelo se estiver perto do limite de ~90 GB.
#As máquinas que incorporam Strix Halo (agosto de 2026)
O sucesso do chip é evidente no seu catálogo: mais de uma dúzia de máquinas já o incorporam, do mini-PC agressivo à workstation de marca, do console portátil ao gabinete modular. Os preços indicativos abaixo são os observados em agosto de 2026 para configurações de 128 GB — eles mudam rapidamente.
| Máquina | Formato | Particularidade | Preço indicativo |
|---|---|---|---|
| Bosgame M5 | Mini-PC | O mais barato do segmento | ~1 700 $ |
| GMKtec EVO-X2 | Mini-PC | 4 saídas 8K | preço muito variável, verificar |
| Beelink GTR9 Pro | Mini-PC | Duas portas de 10 GbE | ~2 000 $ |
| Framework Desktop | Gabinete modular | Reparável, queridíssimo entre os desenvolvedores | preço muito variável, verificar |
| Corsair AI Workstation 300 | SFF | Marca consolidada, garantia sólida | 2 000-3 400 $ |
| Minisforum MS-S1 MAX | Mini-PC | Slot PCIe x16: único que permite upgrades | ~2 500 $ |
| HP Z2 Mini G1a | Workstation 2,7 L | Com certificação ISV, canal profissional (PRO 395) | 2 400-3 500 $ |
| Geekom A9 Mega | Mini-PC | 2 TB de SSD de fábrica | ~3 200 $ |
| Peladn YO1 | Mini-PC 2,4 L | Vendido para « implantar um 70B » | ~1 850 $ |
| Acemagic M1A Pro+ | Mini-PC | Até 24 TB de armazenamento | n.c. |
| Aoostar NEX395 | Mini-PC | TDP de 140 W (o mais potente) | China, UE futuramente |
| GPD Win 5 | Console portátil | Um 70B nas mãos | anunciado |
| Minix ER939-AI | Mini-PC | Variante com duas conexões de 10 GbE | n.c. |
Nossa dica de compra cabe em uma linha: com especificações iguais (o chip é o mesmo em todos os casos), escolha com base no preço, na garantia e na refrigeração. Os testes de cada máquina chegam progressivamente à nossa seção Opiniões & testes.
#Perguntas frequentes
Os 128 GB de memória são realmente utilizáveis para um LLM?+
Qual o maior modelo utilizável no Strix Halo?+
O Strix Halo substitui uma RTX 5090?+
Qual máquina Strix Halo escolher?+
Windows ou Linux para IA local no Strix Halo?+
#Para se aprofundar
O Ryzen AI Max+ 395 está inserido em uma reflexão mais ampla sobre hardware e modelos para IA local. Esses guias do site complementam esse conteúdo:
- Escolher sua GPU para IA local
- Guia de compra que coloca o Strix Halo em perspectiva em relação às RTX e aos Mac, de acordo com seu orçamento e modelos-alvo.
- Ollama com GPU AMD (ROCm)
- A configuração detalhada do ROCm, útil para tirar o máximo do Radeon 8060S uma vez que a plataforma estiver em mãos.
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Para escolher entre Q4 rápido e Q8 quase sem perdas quando não falta memória — exatamente o caso de uma máquina com 128 GB.
Os preços mudam rápido: nosso monitoramento registra toda segunda e quinta-feira o menor preço das placas de vídeo para IA local, com o preço por GB de VRAM.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.