Iniciante 11 minRadeon RX 9000

Qual LLM na Radeon RX 9060 XT (8 / 16 GB) ?

Resposta direta

A RX 9060 XT pode ser usada para LLMs locais, desde que você escolha a versão de 16 GB: os mesmos 320 GB/s da versão de 8 GB, segundo a AMD, mas com memória suficiente para modelos de 12 a 24 bilhões de parâmetros em Q4. A versão de 8 GB limita-se a modelos de 9 bilhões de parâmetros. Ela tem suporte no ROCm 7 no Linux.

A RX 9060 XT é a Radeon RDNA 4 de entrada para IA local. Este guia compara suas duas versões de memória, explica o que cabe em cada uma, indica o limite de velocidade permitido por seus 320 GB/s e especifica sua compatibilidade com Linux e Windows.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-29·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: Radeon RX 9070 XT 16 GB.

Por que essa escolha? Nossa ficha completa sobre Radeon RX 9070 XT 16 GB →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#RX 9060 XT: a versão de 16 GB é a única séria para LLMs

Para rodar LLMs localmente, escolha a Radeon RX 9060 XT na versão de 16 GB. As duas versões compartilham o mesmo processador gráfico e a mesma largura de banda de 320 GB/s; apenas a capacidade muda, e é ela que determina o que você consegue carregar. Com 8 GB, você está limitado a modelos com 7 a 9 bilhões de parâmetros em Q4, com contexto curto. Com 16 GB, você passa para modelos com 12 a 24 bilhões de parâmetros, com contexto mais longo e quantização mais fiel. No lançamento, a AMD anunciava 299 dólares para a versão de 8 GB e 349 dólares para a de 16 GB: uma diferença de 50 dólares para dobrar a memória.

RX 9060 XT 8 GB e 16 GB de acordo com a AMD
Característica8 GB16 GB
Memória8 GB GDDR616 GB GDDR6
Barramento de memória e largura de banda128 bits, até 320 GB/s128 bits, até 320 GB/s
Potência típica da placa150 W160 W
Fonte de alimentação mínima recomendada450 W450 W
Preço recomendado americano no lançamento (maio de 2025)299 $349 $

Os preços mudam; para saber o preço do dia e o preço por gigabyte de VRAM, consulte o acompanhamento de preços das placas de vídeo para IA local. O princípio a lembrar: em uma placa barata, o acréscimo para a versão de 16 GB é pequeno em relação às possibilidades que ela oferece.

#Compatibilidade com ROCm, Vulkan e Windows

A RX 9060 XT consta na matriz de compatibilidade do ROCm 7.2.1 para placas Radeon, com Ubuntu 22.04, 24.04 e 25.10. O Ollama também a lista entre as placas compatíveis com ROCm no Linux, com o driver ROCm v7. No Linux, a instalação do Ollama com ROCm segue, portanto, o mesmo procedimento usado com as outras placas Radeon: o guia Ollama com GPU AMD detalha os passos a seguir.

No Windows, é preciso cautela. A lista de placas que a documentação do Ollama apresenta para ROCm no Windows vai apenas até as RX 7000 e não menciona as RX 9000. O Ollama também informa que o Vulkan oferece suporte adicional no Windows e no Linux, ativado por padrão. Uma RX 9060 XT pode, portanto, funcionar no Windows via Vulkan; verifique com ollama ps se o modelo está realmente na GPU e não no processador. LM Studio e llama.cpp também oferecem um backend Vulkan.

i
Um ponto para você mesmo verificar
O site não testa as placas: a compatibilidade acima é a anunciada pela AMD e pelo Ollama. Após a instalação, dois comandos bastam para confirmar: rocm-smi no Linux para verificar se a placa aparece, e ollama ps após uma resposta para ler a porcentagem alocada na GPU.

#O que cabe em 8 GB e em 16 GB

Os pesos abaixo vêm do catálogo QuelLLM, em Q4, salvo indicação em contrário. A esses pesos somam-se o cache KV, que cresce com o contexto, e uma margem de aproximadamente um gigabyte para o sistema e os buffers. Portanto, um modelo cujos pesos ocupam 100% da memória da placa é grande demais.

Tamanho dos modelos (catálogo QuelLLM) e avaliação por versão
ModeloTamanho do modelo8 GB16 GB
Qwen 3.5 9B Q46 GBNo limite, contexto curtoConfortável
Qwen 3.5 9B Q810 GBNãoConfortável
Gemma 4 12B Q47 GBMuito apertadoConfortável
Gemma 4 12B Q813 GBNãoApertado
gpt-oss 20B Q413 GBNãoSim, contexto moderado
Mistral Small 24B Q414 GBNãoApertado, 2 GB para o contexto
Qwen 3.8 27B Q416 GBNãoNão, excede a VRAM disponível

A conclusão prática cabe em uma frase: a placa de 16 GB abre a categoria de 12 a 24 bilhões de parâmetros, onde estão modelos claramente mais capazes para raciocínio, código e francês. O guia sobre os 16 GB de VRAM fornece a lista completa, enquanto o guia sobre os 8 GB traz dicas para aproveitar melhor a memória disponível.

#Velocidade esperada: a largura de banda define o limite

A geração de texto lê, a cada token, a maior parte dos pesos do modelo: a velocidade máxima é, portanto, a largura de banda dividida pelo tamanho dos pesos lidos. Com 320 GB/s, isso representa um limite de aproximadamente 53 tokens por segundo para um Qwen 3.5 9B em Q4 (6 GB), 46 para um Gemma 4 12B (7 GB), 23 para um Mistral Small 24B (14 GB) e cerca de 32 para o mesmo Qwen 3.5 9B em Q8 (10 GB). Esses valores são limites máximos teóricos, nunca atingidos exatamente; os modelos MoE, que só leem seus pesos ativos, escapam parcialmente dessa limitação.

O único parâmetro público comparável é a tabela da comunidade llama.cpp sobre ROCm: para a RX 9060 XT, um participante registra 1 420 tokens por segundo na leitura do prompt e 68 na geração em um Llama 2 7B em Q4_0, sem Flash Attention. Esse pequeno modelo é muito mais leve do que os da tabela anterior. Ele dá a ordem de grandeza, não a velocidade de um 12B ou de um 24B na sua instalação, que variará com o driver, o sistema e a placa do fabricante.

Limite teórico com largura de banda de 320 GB/s (largura de banda ÷ peso Q4 do catálogo)
ModeloPesos lidos por tokenLimite teórica
Qwen 3.5 9B Q46 GB≈ 53 tokens/s
Qwen 3.5 9B Q810 GB≈ 32 tokens/s
Gemma 4 12B Q47 GB≈ 46 tokens/s
Mistral Small 24B Q414 GB≈ 23 tokens/s
→
Q8 ou Q4: o verdadeiro custo
Passar de Q4 para Q8 quase dobra o tamanho dos pesos lidos por token, ou seja, reduz quase à metade a velocidade máxima. Em uma placa com 320 GB/s, Q4_K_M continua o melhor equilíbrio para bate-papo; reserve o Q8 para tarefas onde a precisão importa mais do que a fluidez.

#Ajustar o Ollama para não ultrapassar os 16 GB

Com 16 GB, cada gigabyte de margem conta. Três ajustes evitam a transferência silenciosa de parte do processamento para a CPU, que faz a velocidade cair sem mensagem de erro. O primeiro é o tamanho do contexto: a documentação do Ollama indica uma janela padrão de 4.096 tokens, que pode ser alterada com OLLAMA_CONTEXT_LENGTH; cada duplicação do contexto aumenta o cache KV. O segundo é o próprio cache KV, que pode ser quantizado com OLLAMA_KV_CACHE_TYPE (f16 por padrão, q8_0 para reduzi-lo) quando o Flash Attention está ativo. O terceiro é a verificação: após uma resposta, ollama ps mostra a distribuição entre GPU e processador.

Servidor com contexto 16k e cache KV em q8_0
OLLAMA_CONTEXT_LENGTH=16384 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve
# dans un autre terminal
ollama run <nom-du-modèle>
ollama ps

Exemplo de raciocínio: um modelo de 14 GB como Mistral Small 24B em Q4 em uma placa de 16 GB deixa cerca de 2 GB para o contexto, o cache e os buffers. Se ollama ps mostrar uma divisão entre GPU e processador, reduza primeiro o contexto, depois quantize o cache KV e, em seguida, passe para um nível menor de quantização, em vez de deixar parte do modelo passar para a RAM do sistema. O guia sobre a quantização do cache KV detalha o procedimento.

#Comprar, esperar ou buscar 24 GB

Há três situações. Se você já tem um PC de mesa recente e uma fonte de alimentação de 450 W ou mais, a 9060 XT 16 GB é uma forma simples de passar de um uso limitado a modelos pequenos para um uso sério de chat, tradução e código leve. Se você busca modelos com 27 a 35 bilhões de parâmetros, nem os 16 GB nem a largura de banda de 320 GB/s são suficientes: veja as placas de 24 GB, incluindo o guia da RX 7900 XTX. Se você não consegue decidir com base no preço, compare, no acompanhamento do site, o custo por gigabyte de VRAM, que é o critério certo para a IA local.

#Duas RX 9060 XT: 32 GB por um preço mais baixo?

A pergunta aparece com frequência nas buscas. No llama.cpp, o modo de distribuição padrão divide o modelo por camadas entre as placas, em pipeline, e uma opção ajusta a proporção por placa. Duas 9060 XT de 16 GB oferecem 32 GB de VRAM no total, com cerca de 320 W de potência típica segundo a AMD, o que permite carregar um Qwen 3.8 27B em Q4 (16 GB de pesos) com bastante contexto, ou um MoE de 30 a 35 bilhões de parâmetros (19 a 21 GB).

Duas limitações a conhecer. A velocidade por token não dobra: as placas trabalham uma após a outra em cada token, e cada uma mantém sua largura de banda de 320 GB/s. Além disso, a placa-mãe precisa oferecer dois slots PCIe utilizáveis, e o gabinete deve ser ventilado. Uma única placa de 24 GB, como a 7900 XTX, oferece 960 GB/s em um único barramento; para um modelo que cabe nela, a geração é muito mais rápida.

#FP8: uma vantagem no papel, pouco impacto com o Ollama

As Radeon RX 9000 são da geração RDNA 4, e a AMD informa para a 9060 XT um desempenho de 205 TFLOPs em FP8, algo que a ficha da RX 7900 XTX não menciona. Para uso comum com Ollama ou LM Studio, esse ponto importa pouco: os modelos no formato GGUF são quantizados em inteiros (Q4, Q5, Q8), não em FP8. Ele se torna útil com motores que utilizam pesos FP8, como o vLLM, cuja documentação lista as RX 9000. Não use isso como argumento de compra se você continuar com Ollama.

#RX 9060 XT ou RTX 5060 Ti: o duelo com 16 GB

A NVIDIA oferece a RTX 5060 Ti em versões de 16 GB e 8 GB, com GDDR7 em um barramento de 128 bits, contra GDDR6 em um barramento de 128 bits na placa AMD. A memória mais rápida dá à NVIDIA a vantagem em largura de banda e, portanto, em velocidade de geração; consulte a ficha técnica da NVIDIA para a taxa de transferência exata. A outra vantagem está no software: CUDA é o alvo padrão da maioria dos projetos de IA.

Critérios de decisão com 16 GB
Sua prioridadeEscolhaMotivo
Velocidade máxima de geração, CUDA exigidoRTX 5060 Ti 16 GBMemória GDDR7, ecossistema CUDA
Linux, Ollama ou llama.cpp, orçamento moderadoRX 9060 XT 16 GBROCm 7 e Vulkan cobrem o uso comum
Windows, sem vontade de depurarRTX 5060 Ti 16 GBDrivers e ferramentas mais universais
Modelos com mais de 16 GBNenhuma das duasOpte por 24 GB: RX 7900 XTX ou RTX 3090
Orçamento muito apertadoRX 9060 XT 8 GBReservado para modelos com 9 bilhões de parâmetros
!
Sem recomendação de compra sem preço do dia
As diferenças de preço entre essas placas mudam a cada semana e podem mudar a decisão. Compare os preços no acompanhamento de preços do site antes de decidir.

#Perguntas frequentes

Perguntas frequentes
RX 9060 XT 8 GB ou 16 GB para LLMs?+
Escolha a versão de 16 GB. As duas têm 320 GB/s de largura de banda segundo a AMD, mas a versão de 8 GB limita-se a modelos com 9 bilhões de parâmetros em Q4 com contexto curto. A versão de 16 GB carrega Gemma 4 12B, gpt-oss 20B ou Mistral Small 24B em Q4. No lançamento, a diferença entre os preços sugeridos era de 50 dólares.
Quantos tokens por segundo uma RX 9060 XT gera?+
Depende do modelo. O limite teórico é a largura de banda (320 GB/s) dividida pelos pesos: cerca de 53 tokens/s para um modelo de 9B em Q4 e 23 para um de 24B. Em um Llama 2 7B em Q4_0, um participante da tabela do llama.cpp registra 68 tokens/s na geração com ROCm.
A RX 9060 XT funciona com Ollama?+
Sim no Linux: Ollama a lista entre as cartas suportadas com ROCm v7. No Windows, a lista de ROCm termina nos RX 7000, mas Vulkan, ativado por padrão, oferece suporte adicional. Verifique com o comando ollama ps se o modelo está localizado em 100% no GPU.
A RX 9060 XT suporta o FP8?+
A ficha técnica da AMD lista 205 TFLOPs de cálculo matricial FP8, informação que não consta na ficha técnica da RX 7900 XTX. Ollama e os modelos GGUF em Q4 não tiram proveito disso diretamente. O FP8 interessa principalmente ao vLLM, que lista as Radeon RX 9000 entre os hardwares compatíveis.
É possível conectar duas RX 9060 XT para ter 32 GB?+
Sim com llama.cpp, que distribui por padrão as camadas entre os GPUs. Você obtém 32 GB de capacidade, mas não o dobro de velocidade: cada placa mantém seus 320 GB/s e trabalha alternadamente. Estime cerca de 320 W para as duas placas de acordo com a AMD, mais o restante do PC.
Qual fonte de alimentação usar para uma RX 9060 XT?+
A AMD recomenda 450 W como mínimo para as duas versões, com consumo típico de 150 W para a versão de 8 GB e de 160 W para a de 16 GB. Adicione o consumo do processador e dos discos para dimensionar a fonte, depois verifique a ficha do modelo exato, pois alguns fabricantes de placas recomendam mais do que o mínimo da AMD.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.