Intermediário 14 minAPU

Ryzen AI Max+ 395 (Strix Halo): 128 GB de memória para LLM locaux

O Ryzen AI Max+ 395 (codinome Strix Halo) é a APU com a qual a AMD disputa diretamente o mercado de IA local, até agora dominado por Macs com memória unificada e GPUs de 24 GB. Seu grande trunfo: até 128 GB de memória compartilhada entre CPU, GPU e NPU, cuja esmagadora maioria pode ser alocada ao modelo. Este guia faz um balanço honesto do que o Ryzen AI Max+ 395 realmente permite fazer com LLMs — quais modelos de 70B e MoE se tornam acessíveis, a que velocidade, em comparação com GPUs dedicadas e Macs, e como configurá-lo com ROCm e Vulkan.

Você está escolhendo uma máquina? Nossas escolhas por orçamento → · Nossa ficha mini-PC Ryzen AI Max 128 GB →

Por Samir K.·Atualização 2026-08-27·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#Por que o Ryzen AI Max+ 395 muda a dinâmica para o LLM local

Executar um modelo grande localmente quase sempre esbarra no mesmo limite: a memória de vídeo. Uma RTX 4090 tem um limite de 24 GB, uma RTX 5090 de 32 GB, e, para ir além, é necessário combinar várias placas ou recorrer a um Mac Studio. O Ryzen AI Max+ 395 aborda esse limite por outro ângulo: em vez de uma VRAM dedicada limitada, ele compartilha um grande conjunto de memória unificada entre a CPU, a GPU integrada e a NPU. Em uma máquina equipada com 128 GB, é possível reservar mais de 90 GB para a GPU para inferência.

Na prática, isso abre uma categoria de máquinas que não existia no universo dos PCs: mini-PCs e laptops com preços muito variáveis, cuja capacidade de carregar um modelo 70B, ou até modelos de mistura de especialistas muito maiores, precisa ser verificada, sem placa de vídeo dedicada e sem configuração com múltiplas GPUs. É o primeiro concorrente x86 de peso do Mac Studio para IA local com grande capacidade de memória.

i
Strix Halo, Ryzen AI Max, Radeon 8060S: de que se trata?
« Strix Halo » é o codinome da geração. « Ryzen AI Max+ 395 » é o modelo topo de linha da série Ryzen AI Max. Sua GPU integrada se chama Radeon 8060S. Os três designam aspectos do mesmo chip — você encontrará os três nomes dependendo da ficha do produto.

#O chip em detalhes

O Ryzen AI Max+ 395 é uma APU monolítica que combina três motores de cálculo em um único die, todos conectados ao mesmo controlador de memória. Para o LLM, são principalmente a GPU e a memória que importam, mas o conjunto forma um todo coerente.

CPU — 16 núcleos Zen 5
16 núcleos / 32 threads Zen 5, úteis para o pré-processamento, o offload parcial para a CPU e tudo o que não seja a própria inferência na GPU.
GPU — Radeon 8060S (RDNA 3.5)
40 unidades de cálculo na arquitetura RDNA 3.5. É o maior GPU integrado do mercado de PCs e é ele que realiza a inferência via ROCm ou Vulkan.
NPU — XDNA 2, ~50 TOPS
Um acelerador dedicado à IA, com baixo consumo de energia. Adequado para certas cargas otimizadas, mas a maioria dos runtimes de LLM (Ollama, llama.cpp) é voltada hoje para a GPU, não para a NPU.
Memória — LPDDR5X até 128 GB
Barramento de 256 bits, LPDDR5X a 8000 MT/s, ou seja, cerca de 256 GB/s de largura de banda compartilhada. Unificada entre CPU, GPU e NPU.
!
A memória é soldada; escolha a capacidade na compra
A memória LPDDR5X do Strix Halo é soldada na placa: não há módulos SO-DIMM nem possibilidade de expansão posterior. Se você pretende usar modelos 70B+, escolha desde o início a versão de 128 GB. As versões de 32 ou 64 GB limitam todas as vantagens da plataforma para LLMs grandes.
i
Por que este chip é histórico
Há dez anos, executar um modelo grande em casa significava empilhar GPUs caríssimas para conseguir um pouco mais de VRAM. O Strix Halo muda completamente o cenário: a AMD integra 16 núcleos Zen 5, uma GPU da classe RTX 4060-4070 e uma NPU de 50 TOPS em torno de um único conjunto de 128 GB de memória — e, de repente, um modelo de 70B quantizado cabe por inteiro, enquanto uma RTX 5090 que custa ≈ 5.700 € no final de setembro de 2026 fica limitada a 32 GB. É o primeiro chip voltado ao consumidor projetado para inferência local, em vez de adaptado para ela.

#Memória unificada de 128 GB, o principal atrativo

Em uma GPU convencional, a VRAM e a RAM do sistema são dois conjuntos de memória separados: um modelo que excede a capacidade da VRAM passa a usar a RAM via PCIe, e o desempenho da inferência despenca. No Ryzen AI Max+ 395, há um único conjunto físico de memória. A GPU acessa diretamente a memória unificada, exatamente como no caso da memória unificada de um Mac Apple Silicon. Sem cópia entre dois espaços, sem gargalo no PCIe.

A quantidade efetivamente disponível para o modelo depende da divisão entre memória do “sistema” e memória da “GPU”. Conforme o firmware e o sistema operacional, reserva-se uma parte fixa para a GPU (parâmetro UMA no BIOS) e/ou permite-se que o driver aloque dinamicamente o restante (GTT no Linux). Na prática, em uma máquina com 128 GB, é comum disponibilizar 96 GB, e muitas vezes mais, para a GPU realizar a inferência.

Um único pool
128 GB compartilhados. O que o modelo não usa permanece disponível para o sistema e vice-versa.
Alocação de GPU generosa
90 GB ou mais utilizáveis para os pesos do modelo e o cache de contexto, dependendo da configuração do BIOS/driver.
Sem barreira PCIe
Ao contrário de uma GPU dedicada que precisa transferir parte dos dados para a RAM, aqui tudo cabe no mesmo espaço de memória de alta velocidade.
Uso confortável de contextos longos
A margem de memória permite janelas de contexto extensas em situações nas quais uma GPU de 24 GB precisa sacrificar o tamanho do modelo ou o contexto.

#Quais modelos cabem (70B Q4, MoE)

Com cerca de 90 GB disponíveis, o Ryzen AI Max+ 395 muda completamente a lista de modelos possíveis em comparação com um GPU de 16 a 24 GB. Aqui estão os níveis concretos, mantendo os referenciais de VRAM habituais em Q4: 7B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19 GB, 70B ≈ 40 GB.

70B em Q4_K_M (~40 GB)
Cabe com folga, com margem para um contexto grande. É o principal caso de uso: um modelo denso de 70B ou equivalente, impossível em uma única RTX 4090.
70B em Q8_0 (~75 GB)
Também cabe, quase sem perda de qualidade. Impensável em uma GPU de consumo sem usar múltiplas GPUs.
Modelos MoE como Qwen 3.6 35B-A3B ou GLM 4.7 Flash
Os modelos mixture-of-experts são ideais: todos os pesos são carregados na memória (o que ocupa bastante espaço), mas apenas alguns bilhões de parâmetros ficam ativos por token, então a velocidade continua boa.
Modelos MoE grandes (200B+ em Q4)
Modelos como Qwen3-235B-A22B com quantização agressiva podem caber em 90 GB. A taxa de geração depende do número de parâmetros ativos, não do tamanho total.
DeepSeek 671B e similares
Grandes demais mesmo em Q4 (bem acima de 100 GB para os pesos). Continuam fora de alcance sem offload para disco — prefira um Mac Studio com uma capacidade de memória muito grande ou uma estação dedicada ao llama.cpp.
→
Os MoE são feitos para esta máquina
Um modelo denso de 70B lê 40 GB de pesos a cada token: a largura de banda se torna o fator limitante. Um MoE com a mesma ocupação de memória, mas com apenas 3B de parâmetros ativos, lê apenas uma fração da memória por token, portanto roda muito mais rápido. No Strix Halo, prefira arquiteturas MoE quando a velocidade for importante.

#Desempenho real: a largura de banda decide

Esse é o ponto que você precisa entender antes de qualquer compra. A geração de tokens de um modelo denso é limitada pela largura de banda da memória, não pela capacidade bruta de processamento. A taxa teórica máxima pode ser calculada aproximadamente dividindo a largura de banda pelo tamanho do modelo na memória.

O Ryzen AI Max+ 395 oferece cerca de 256 GB/s. Um modelo de 70B em Q4 (~40 GB) tem, portanto, um limite teórico de cerca de 6 tokens/s, e na prática observa-se algo mais próximo de 4 a 5 tokens/s na geração — dá para acompanhar a leitura, mas não é rápido. Em contrapartida, um MoE 30B-A3B lê apenas uma pequena parte dos pesos por token e chega facilmente a várias dezenas de tokens/s. Já o pré-processamento do prompt utiliza as 40 CU da GPU e mantém um desempenho razoável.

Modelo denso 70B Q4
≈ 4–5 tok/s na geração. Confortável para redação e análise, lento para chats muito interativos.
Modelo denso 32B Q4
Muito mais fluido (~19 GB lidos/token), bom equilíbrio entre qualidade e velocidade no dia a dia.
MoE 30B-A3B
Dezenas de tok/s: a velocidade depende dos ~3B ativos, não dos 30B totais.
Comparação RTX
Uma RTX 4090 (~1000 GB/s) supera de longe o Strix Halo em taxa de transferência bruta, mas fica limitada a 24 GB e simplesmente não consegue carregar um modelo de 70B sozinha.
i
Capacidade vs velocidade: o bom equilíbrio
Com o Ryzen AI Max+ 395, você compra capacidade de memória, não velocidade. Se você precisa “rodar um modelo grande que nenhuma placa de 24 GB consegue carregar”, ele é excelente. Se você precisa do “máximo de tokens/s em um modelo de 7B–14B”, uma GPU dedicada continua sendo mais rápida e mais barata.

#Mini-PC versus laptop versus Mac Studio, o comparativo honesto

O Ryzen AI Max+ 395 está disponível em vários formatos. A escolha depende da mobilidade, da capacidade de manter o resfriamento e do preço, enquanto o chip permanece idêntico. Frente a ele, a referência a superar continua sendo o Mac Studio e suas variantes M-Max/Ultra com grande capacidade de memória unificada.

Mini-PC (ex. Framework Desktop, GMKtec EVO-X2)
A melhor relação desempenho sustentado/preço. Resfriamento estável para inferência longa, compacto, silencioso, ideal como servidor doméstico 24/7.
Notebook (ex. HP ZBook Ultra G1a, Asus ROG Flow Z13)
A mesma capacidade de memória em um dispositivo portátil, mas com throttling térmico sob carga prolongada e autonomia limitada durante a inferência. Prático para trabalhar em qualquer lugar, menos adequado para um servidor.
Mac Studio (M-Max / Ultra)
Largura de banda da memória muito superior (várias centenas de GB/s, até ~800 GB/s no Ultra) e ecossistema MLX muito otimizado. Mais rápido em modelos densos, mas significativamente mais caro para a mesma capacidade de memória.
Mac mini M4 Pro
Menos memória máxima, mas excelente para modelos até 32B. Considere se você não precisar de modelos de 70B ou mais.

Em resumo: o Strix Halo leva vantagem no preço em configurações com alta capacidade de memória e no ecossistema x86/Linux; o Mac Studio leva vantagem na velocidade de geração e na maturidade do software. Para usar um modelo 70B de forma « acessível » sem gastar uma fortuna, o Ryzen AI Max+ 395 em um mini-PC com 128 GB é hoje a opção x86 mais adequada.

#Configuração do ROCm e Vulkan no Linux

No Linux, existem duas rotas para o GPU integrado: ROCm (a stack de cálculo da AMD) e Vulkan (portável e muitas vezes mais fácil de configurar nesse GPU recente). A etapa-chave, comum às duas, é garantir que uma quantidade suficiente de memória seja acessível ao GPU.

  1. 01
    Configurar a alocação de memória da GPU no BIOS
    Entre no BIOS/UEFI e procure o parâmetro UMA Frame Buffer Size (ou 'Dedicated GPU Memory'). Reserve uma parte generosa para a GPU. O restante será alocado dinamicamente pelo driver amdgpu via memória GTT.
  2. 02
    Verificar a memória GTT reconhecida pelo driver
    No Linux, a memória que pode ser alocada dinamicamente à GPU passa pelo mecanismo GTT do driver amdgpu. Um kernel recente (6.10+) e um firmware amdgpu atualizado maximizam a parcela utilizável para inferência.
  3. 03
    Instalar uma stack voltada para a GPU
    A maneira mais simples é usar uma build do Ollama ou do llama.cpp com backend Vulkan, que detecta o Radeon 8060S sem uma configuração complexa do ROCm. Para o ROCm, instale o pacote oficial e verifique se a GPU aparece na lista.
  4. 04
    Forçar a arquitetura-alvo da GPU, se necessário
    Como a GPU integrada nem sempre está na lista oficial de alvos do ROCm, às vezes é necessário indicar a versão da arquitetura GFX por meio de uma variável de ambiente para que Ollama/llama.cpp a aceite.
  5. 05
    Iniciar um modelo e verificar o offload
    Inicie um modelo e confirme que ele está realmente rodando na GPU (e não na CPU) antes de tirar qualquer conclusão sobre o desempenho.
Terminal — verificar a GPU e iniciar um modelo
# Vérifier que le GPU AMD est détecté par ROCm
rocminfo | grep -i "gfx"

# Voir l'occupation mémoire du GPU en temps réel
rocm-smi

# Lancer un gros MoE 2026 avec Ollama
ollama run qwen3.6:35b

# Confirmer que le modèle est sur GPU (et pas CPU)
ollama ps
Terminal — forçar o alvo GFX para ROCm (se não for detectado)
# Le Radeon 8060S (RDNA 3.5) n'est pas toujours reconnu par défaut.
# Indiquez la version GFX pour qu'Ollama accepte le GPU.
export HSA_OVERRIDE_GFX_VERSION=11.0.0
ollama serve
→
Vulkan primeiro, depois ROCm
Nesta plataforma muito recente, o backend Vulkan do llama.cpp/Ollama costuma ser o caminho mais curto para fazer a GPU funcionar: menos dependências, detecção automática. Deixe o ROCm para otimizar o desempenho depois que tudo estiver funcionando. O guia de Vulkan do site explica a compilação em detalhes.

#Configuração no Windows

No Windows, a experiência é mais "plug and play" em relação ao driver, mas a alocação de memória continua sendo o ponto sensível. A lógica é a mesma: disponibilizar memória suficiente para a GPU e depois usar um runtime que a aproveite.

  1. 01
    Instalar o último driver AMD Adrenalin
    Use o driver mais recente para o Ryzen AI Max+ 395: o suporte a LLMs da GPU integrada e a alocação de memória melhoram a cada versão. Os drivers mais recentes expõem uma parte importante da memória unificada como VRAM.
  2. 02
    Ajustar a memória gráfica dedicada
    No BIOS (UMA Frame Buffer Size) ou pelo utilitário AMD, aumente a memória gráfica dedicada para deixar espaço para modelos grandes. Um valor muito baixo fará com que parte do modelo passe a ser executada na CPU.
  3. 03
    Instalar LM Studio ou Ollama
    LM Studio detecta a GPU AMD e oferece um backend adequado; é a opção mais simples sem linha de comando. Ollama para Windows também funciona e expõe seu endpoint em http://localhost:11434.
  4. 04
    Carregar um GGUF e verificar o offload para a GPU
    No LM Studio, carregue um modelo 70B em Q4 e mova o controle deslizante de offload para a GPU até o máximo. Verifique se as camadas estão realmente na GPU, e não na CPU.
PowerShell — Ollama no Windows
# Vérifier la version d'Ollama
ollama --version

# Lancer un gros MoE 2026 ; l'endpoint local reste sur :11434
ollama run qwen3.6:35b

# Vérifier l'exécution sur GPU
ollama ps
i
Stack recomendada
A combinação mais confortável continua sendo o Ollama (o daemon de inferência, com endpoint compatível com OpenAI em :11434) mais uma interface como Open WebUI ou LM Studio. Não há nada específico do Strix Halo aqui: uma vez que a GPU está sendo utilizada, o restante do fluxo de trabalho é igual ao de qualquer outra máquina.

#Solução de problemas e dicas

O modelo roda na CPU, não na GPU
Verifique « ollama ps » / « rocm-smi ». Muitas vezes, a quantidade de memória alocada à GPU é muito pequena: aumente o UMA Frame Buffer no BIOS ou verifique a GTT no Linux.
ROCm não detecta o Radeon 8060S
O GPU integrado RDNA 3.5 não está sempre na lista oficial. Exporte HSA_OVERRIDE_GFX_VERSION ou mude para o backend Vulkan, que o detecta sem sobrecarga.
Geração anormalmente lenta em um 70B denso
É esperado: ~4–5 tok/s é o limite realista a 256 GB/s. Para maior velocidade, passe para um modelo MoE ou um modelo menor — não é um bug.
Impossível alocar 90 GB para a GPU
Firmware do BIOS e driver/kernel muito antigos limitam a alocação. Atualize o BIOS, o driver Adrenalin (Windows) ou o kernel/firmware amdgpu (Linux).
Contexto longo que causa travamento
O cache KV se soma aos pesos na memória. Reduza num_ctx ou o tamanho do modelo se estiver perto do limite de ~90 GB.

#As máquinas que incorporam Strix Halo (agosto de 2026)

O sucesso do chip é evidente no seu catálogo: mais de uma dúzia de máquinas já o incorporam, do mini-PC agressivo à workstation de marca, do console portátil ao gabinete modular. Os preços indicativos abaixo são os observados em agosto de 2026 para configurações de 128 GB — eles mudam rapidamente.

Máquinas Ryzen AI Max+ 395 disponíveis ou anunciadas (preços indicativos de agosto de 2026, configuração de 128 GB)
MáquinaFormatoParticularidadePreço indicativo
Bosgame M5Mini-PCO mais barato do segmento~1 700 $
GMKtec EVO-X2Mini-PC4 saídas 8Kpreço muito variável, verificar
Beelink GTR9 ProMini-PCDuas portas de 10 GbE~2 000 $
Framework DesktopGabinete modularReparável, queridíssimo entre os desenvolvedorespreço muito variável, verificar
Corsair AI Workstation 300SFFMarca consolidada, garantia sólida2 000-3 400 $
Minisforum MS-S1 MAXMini-PCSlot PCIe x16: único que permite upgrades~2 500 $
HP Z2 Mini G1aWorkstation 2,7 LCom certificação ISV, canal profissional (PRO 395)2 400-3 500 $
Geekom A9 MegaMini-PC2 TB de SSD de fábrica~3 200 $
Peladn YO1Mini-PC 2,4 LVendido para « implantar um 70B »~1 850 $
Acemagic M1A Pro+Mini-PCAté 24 TB de armazenamenton.c.
Aoostar NEX395Mini-PCTDP de 140 W (o mais potente)China, UE futuramente
GPD Win 5Console portátilUm 70B nas mãosanunciado
Minix ER939-AIMini-PCVariante com duas conexões de 10 GbEn.c.

Nossa dica de compra cabe em uma linha: com especificações iguais (o chip é o mesmo em todos os casos), escolha com base no preço, na garantia e na refrigeração. Os testes de cada máquina chegam progressivamente à nossa seção Opiniões & testes.

#Perguntas frequentes

Os 128 GB de memória são realmente utilizáveis para um LLM?+
Em grande parte, sim. A memória é unificada: o GPU pode receber até 96 GB no Windows e ainda mais no Linux com as configurações corretas. Um modelo de 70B quantizado em Q4 (~40 GB) cabe, portanto, inteiramente na memória do GPU, com espaço para o contexto.
Qual o maior modelo utilizável no Strix Halo?+
Um modelo 70B quantizado funciona confortavelmente. A AMD demonstrou até ~120 bilhões de parâmetros via LM Studio aumentando a alocação de memória. Acima disso, o limite não é mais a capacidade, mas a velocidade: a largura de banda de 256 GB/s torna a geração lenta em modelos muito grandes e densos. Os MoE (como GLM ou Qwen3-30B-A3B) funcionam particularmente bem nesse hardware: poucos parâmetros ativos, muitos parâmetros acomodados na memória.
O Strix Halo substitui uma RTX 5090?+
Não — eles não disputam o mesmo jogo. A RTX 5090 é muito mais rápida em tudo o que cabe nos seus 32 GB. O Strix Halo leva vantagem assim que o modelo ultrapassa esse limite: ele executa o que a 5090 simplesmente não consegue carregar, por um preço de computador completo inferior ao preço da placa sozinha.
Qual máquina Strix Halo escolher?+
Como o chip é o mesmo em todas as máquinas, os critérios que realmente importam são o preço (o Bosgame M5 tem o preço mais competitivo), a garantia e a qualidade do atendimento pós-venda (Corsair, HP e Framework inspiram confiança), a possibilidade de expansão (o Minisforum MS-S1 MAX é o único com um slot PCIe x16) e a refrigeração. Consulte nossas avaliações de cada máquina antes de comprar.
Windows ou Linux para IA local no Strix Halo?+
Os dois funcionam. O Linux oferece a alocação de memória da GPU mais generosa e o melhor desempenho com llama.cpp/ROCm; o Windows é mais simples com o LM Studio, que gerencia o chip nativamente. Nosso guia de configuração cobre os dois sistemas, seção por seção.

#Para se aprofundar

O Ryzen AI Max+ 395 está inserido em uma reflexão mais ampla sobre hardware e modelos para IA local. Esses guias do site complementam esse conteúdo:

Escolher sua GPU para IA local
Guia de compra que coloca o Strix Halo em perspectiva em relação às RTX e aos Mac, de acordo com seu orçamento e modelos-alvo.
Ollama com GPU AMD (ROCm)
A configuração detalhada do ROCm, útil para tirar o máximo do Radeon 8060S uma vez que a plataforma estiver em mãos.
Escolher sua quantização (Q4, Q5, Q8, FP16)
Para escolher entre Q4 rápido e Q8 quase sem perdas quando não falta memória — exatamente o caso de uma máquina com 128 GB.

Os preços mudam rápido: nosso monitoramento registra toda segunda e quinta-feira o menor preço das placas de vídeo para IA local, com o preço por GB de VRAM.

Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.