Qual LLM na Radeon RX 9060 XT (8 / 16 GB) ?
A RX 9060 XT pode ser usada para LLMs locais, desde que você escolha a versão de 16 GB: os mesmos 320 GB/s da versão de 8 GB, segundo a AMD, mas com memória suficiente para modelos de 12 a 24 bilhões de parâmetros em Q4. A versão de 8 GB limita-se a modelos de 9 bilhões de parâmetros. Ela tem suporte no ROCm 7 no Linux.
A RX 9060 XT é a Radeon RDNA 4 de entrada para IA local. Este guia compara suas duas versões de memória, explica o que cabe em cada uma, indica o limite de velocidade permitido por seus 320 GB/s e especifica sua compatibilidade com Linux e Windows.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: Radeon RX 9070 XT 16 GB.
Por que essa escolha? Nossa ficha completa sobre Radeon RX 9070 XT 16 GB →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#RX 9060 XT: a versão de 16 GB é a única séria para LLMs
Para rodar LLMs localmente, escolha a Radeon RX 9060 XT na versão de 16 GB. As duas versões compartilham o mesmo processador gráfico e a mesma largura de banda de 320 GB/s; apenas a capacidade muda, e é ela que determina o que você consegue carregar. Com 8 GB, você está limitado a modelos com 7 a 9 bilhões de parâmetros em Q4, com contexto curto. Com 16 GB, você passa para modelos com 12 a 24 bilhões de parâmetros, com contexto mais longo e quantização mais fiel. No lançamento, a AMD anunciava 299 dólares para a versão de 8 GB e 349 dólares para a de 16 GB: uma diferença de 50 dólares para dobrar a memória.
| Característica | 8 GB | 16 GB |
|---|---|---|
| Memória | 8 GB GDDR6 | 16 GB GDDR6 |
| Barramento de memória e largura de banda | 128 bits, até 320 GB/s | 128 bits, até 320 GB/s |
| Potência típica da placa | 150 W | 160 W |
| Fonte de alimentação mínima recomendada | 450 W | 450 W |
| Preço recomendado americano no lançamento (maio de 2025) | 299 $ | 349 $ |
Os preços mudam; para saber o preço do dia e o preço por gigabyte de VRAM, consulte o acompanhamento de preços das placas de vídeo para IA local. O princípio a lembrar: em uma placa barata, o acréscimo para a versão de 16 GB é pequeno em relação às possibilidades que ela oferece.
#Compatibilidade com ROCm, Vulkan e Windows
A RX 9060 XT consta na matriz de compatibilidade do ROCm 7.2.1 para placas Radeon, com Ubuntu 22.04, 24.04 e 25.10. O Ollama também a lista entre as placas compatíveis com ROCm no Linux, com o driver ROCm v7. No Linux, a instalação do Ollama com ROCm segue, portanto, o mesmo procedimento usado com as outras placas Radeon: o guia Ollama com GPU AMD detalha os passos a seguir.
No Windows, é preciso cautela. A lista de placas que a documentação do Ollama apresenta para ROCm no Windows vai apenas até as RX 7000 e não menciona as RX 9000. O Ollama também informa que o Vulkan oferece suporte adicional no Windows e no Linux, ativado por padrão. Uma RX 9060 XT pode, portanto, funcionar no Windows via Vulkan; verifique com ollama ps se o modelo está realmente na GPU e não no processador. LM Studio e llama.cpp também oferecem um backend Vulkan.
#O que cabe em 8 GB e em 16 GB
Os pesos abaixo vêm do catálogo QuelLLM, em Q4, salvo indicação em contrário. A esses pesos somam-se o cache KV, que cresce com o contexto, e uma margem de aproximadamente um gigabyte para o sistema e os buffers. Portanto, um modelo cujos pesos ocupam 100% da memória da placa é grande demais.
| Modelo | Tamanho do modelo | 8 GB | 16 GB |
|---|---|---|---|
| Qwen 3.5 9B Q4 | 6 GB | No limite, contexto curto | Confortável |
| Qwen 3.5 9B Q8 | 10 GB | Não | Confortável |
| Gemma 4 12B Q4 | 7 GB | Muito apertado | Confortável |
| Gemma 4 12B Q8 | 13 GB | Não | Apertado |
| gpt-oss 20B Q4 | 13 GB | Não | Sim, contexto moderado |
| Mistral Small 24B Q4 | 14 GB | Não | Apertado, 2 GB para o contexto |
| Qwen 3.8 27B Q4 | 16 GB | Não | Não, excede a VRAM disponível |
A conclusão prática cabe em uma frase: a placa de 16 GB abre a categoria de 12 a 24 bilhões de parâmetros, onde estão modelos claramente mais capazes para raciocínio, código e francês. O guia sobre os 16 GB de VRAM fornece a lista completa, enquanto o guia sobre os 8 GB traz dicas para aproveitar melhor a memória disponível.
#Velocidade esperada: a largura de banda define o limite
A geração de texto lê, a cada token, a maior parte dos pesos do modelo: a velocidade máxima é, portanto, a largura de banda dividida pelo tamanho dos pesos lidos. Com 320 GB/s, isso representa um limite de aproximadamente 53 tokens por segundo para um Qwen 3.5 9B em Q4 (6 GB), 46 para um Gemma 4 12B (7 GB), 23 para um Mistral Small 24B (14 GB) e cerca de 32 para o mesmo Qwen 3.5 9B em Q8 (10 GB). Esses valores são limites máximos teóricos, nunca atingidos exatamente; os modelos MoE, que só leem seus pesos ativos, escapam parcialmente dessa limitação.
O único parâmetro público comparável é a tabela da comunidade llama.cpp sobre ROCm: para a RX 9060 XT, um participante registra 1 420 tokens por segundo na leitura do prompt e 68 na geração em um Llama 2 7B em Q4_0, sem Flash Attention. Esse pequeno modelo é muito mais leve do que os da tabela anterior. Ele dá a ordem de grandeza, não a velocidade de um 12B ou de um 24B na sua instalação, que variará com o driver, o sistema e a placa do fabricante.
| Modelo | Pesos lidos por token | Limite teórica |
|---|---|---|
| Qwen 3.5 9B Q4 | 6 GB | ≈ 53 tokens/s |
| Qwen 3.5 9B Q8 | 10 GB | ≈ 32 tokens/s |
| Gemma 4 12B Q4 | 7 GB | ≈ 46 tokens/s |
| Mistral Small 24B Q4 | 14 GB | ≈ 23 tokens/s |
#Ajustar o Ollama para não ultrapassar os 16 GB
Com 16 GB, cada gigabyte de margem conta. Três ajustes evitam a transferência silenciosa de parte do processamento para a CPU, que faz a velocidade cair sem mensagem de erro. O primeiro é o tamanho do contexto: a documentação do Ollama indica uma janela padrão de 4.096 tokens, que pode ser alterada com OLLAMA_CONTEXT_LENGTH; cada duplicação do contexto aumenta o cache KV. O segundo é o próprio cache KV, que pode ser quantizado com OLLAMA_KV_CACHE_TYPE (f16 por padrão, q8_0 para reduzi-lo) quando o Flash Attention está ativo. O terceiro é a verificação: após uma resposta, ollama ps mostra a distribuição entre GPU e processador.
Exemplo de raciocínio: um modelo de 14 GB como Mistral Small 24B em Q4 em uma placa de 16 GB deixa cerca de 2 GB para o contexto, o cache e os buffers. Se ollama ps mostrar uma divisão entre GPU e processador, reduza primeiro o contexto, depois quantize o cache KV e, em seguida, passe para um nível menor de quantização, em vez de deixar parte do modelo passar para a RAM do sistema. O guia sobre a quantização do cache KV detalha o procedimento.
#Comprar, esperar ou buscar 24 GB
Há três situações. Se você já tem um PC de mesa recente e uma fonte de alimentação de 450 W ou mais, a 9060 XT 16 GB é uma forma simples de passar de um uso limitado a modelos pequenos para um uso sério de chat, tradução e código leve. Se você busca modelos com 27 a 35 bilhões de parâmetros, nem os 16 GB nem a largura de banda de 320 GB/s são suficientes: veja as placas de 24 GB, incluindo o guia da RX 7900 XTX. Se você não consegue decidir com base no preço, compare, no acompanhamento do site, o custo por gigabyte de VRAM, que é o critério certo para a IA local.
#Duas RX 9060 XT: 32 GB por um preço mais baixo?
A pergunta aparece com frequência nas buscas. No llama.cpp, o modo de distribuição padrão divide o modelo por camadas entre as placas, em pipeline, e uma opção ajusta a proporção por placa. Duas 9060 XT de 16 GB oferecem 32 GB de VRAM no total, com cerca de 320 W de potência típica segundo a AMD, o que permite carregar um Qwen 3.8 27B em Q4 (16 GB de pesos) com bastante contexto, ou um MoE de 30 a 35 bilhões de parâmetros (19 a 21 GB).
Duas limitações a conhecer. A velocidade por token não dobra: as placas trabalham uma após a outra em cada token, e cada uma mantém sua largura de banda de 320 GB/s. Além disso, a placa-mãe precisa oferecer dois slots PCIe utilizáveis, e o gabinete deve ser ventilado. Uma única placa de 24 GB, como a 7900 XTX, oferece 960 GB/s em um único barramento; para um modelo que cabe nela, a geração é muito mais rápida.
#FP8: uma vantagem no papel, pouco impacto com o Ollama
As Radeon RX 9000 são da geração RDNA 4, e a AMD informa para a 9060 XT um desempenho de 205 TFLOPs em FP8, algo que a ficha da RX 7900 XTX não menciona. Para uso comum com Ollama ou LM Studio, esse ponto importa pouco: os modelos no formato GGUF são quantizados em inteiros (Q4, Q5, Q8), não em FP8. Ele se torna útil com motores que utilizam pesos FP8, como o vLLM, cuja documentação lista as RX 9000. Não use isso como argumento de compra se você continuar com Ollama.
#RX 9060 XT ou RTX 5060 Ti: o duelo com 16 GB
A NVIDIA oferece a RTX 5060 Ti em versões de 16 GB e 8 GB, com GDDR7 em um barramento de 128 bits, contra GDDR6 em um barramento de 128 bits na placa AMD. A memória mais rápida dá à NVIDIA a vantagem em largura de banda e, portanto, em velocidade de geração; consulte a ficha técnica da NVIDIA para a taxa de transferência exata. A outra vantagem está no software: CUDA é o alvo padrão da maioria dos projetos de IA.
| Sua prioridade | Escolha | Motivo |
|---|---|---|
| Velocidade máxima de geração, CUDA exigido | RTX 5060 Ti 16 GB | Memória GDDR7, ecossistema CUDA |
| Linux, Ollama ou llama.cpp, orçamento moderado | RX 9060 XT 16 GB | ROCm 7 e Vulkan cobrem o uso comum |
| Windows, sem vontade de depurar | RTX 5060 Ti 16 GB | Drivers e ferramentas mais universais |
| Modelos com mais de 16 GB | Nenhuma das duas | Opte por 24 GB: RX 7900 XTX ou RTX 3090 |
| Orçamento muito apertado | RX 9060 XT 8 GB | Reservado para modelos com 9 bilhões de parâmetros |
- Qual LLM para 16 GB de VRAM: a lista completa
- Qual LLM para 8 GB de VRAM: dicas e limites
- Ollama com GPU AMD (ROCm): instalação passo a passo
- LLM na RTX 5060 Ti (8 / 16 GB)
- LLM na RX 7900 XTX (24 GB)
- Preços de placas de vídeo para IA local
- Fonte: ficha técnica da AMD para a RX 9060 XT (16 GB)
- Fonte: documentação do Ollama sobre GPUs
- Fonte: compatibilidade ROCm no Radeon
- Fonte: tabela de desempenho do llama.cpp em ROCm
#Perguntas frequentes
RX 9060 XT 8 GB ou 16 GB para LLMs?+
Quantos tokens por segundo uma RX 9060 XT gera?+
A RX 9060 XT funciona com Ollama?+
A RX 9060 XT suporta o FP8?+
É possível conectar duas RX 9060 XT para ter 32 GB?+
Qual fonte de alimentação usar para uma RX 9060 XT?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.