Otimizar o desempenho térmico em inferência
Para inferência contínua, a medida térmica com melhor custo-benefício é limitar a potência da GPU: de acordo com uma medição publicada com uma RTX 3090, passar de 350 W para 250 W reduz a velocidade de geração em menos de 3%, enquanto abaixo desse limite a velocidade cai drasticamente. Verifique primeiro o que realmente limita a placa (temperatura ou potência) com nvidia-smi, antes de mexer nas ventoinhas, na tensão ou na pasta térmica.
Uma máquina que responde a requisições o dia inteiro aquece de forma diferente de quando executa um videogame: carga constante, memória muito exigida, gabinete fechado. Esta página explica como saber se a sua placa está ficando mais lenta, qual ajuste tentar primeiro, quanto o limite de potência realmente custa em tokens por segundo e quando a manutenção (poeira, pasta térmica, gabinete) é a verdadeira solução.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.
Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#Por que o comportamento térmico importa para um servidor de inferência
Uma GPU protege seu chip: quando a temperatura ou a potência ultrapassa o que seu firmware permite, ela reduz suas frequências. Esse mecanismo se chama throttling. A documentação do nvidia-smi distingue suas causas: uma desaceleração por software relacionada à temperatura (« sw thermal slowdown »), uma desaceleração por hardware mais brusca que reduz as frequências por um fator de 2 ou mais (« hw thermal slowdown ») e um limite de potência (« sw power cap »). Se todas essas causas estiverem indicadas como inativas, as frequências ficam no nível mais alto possível.
O limite não é o mesmo em todas as placas. A NVIDIA o define como “GPU Slowdown Temp”, a temperatura em que o hardware começa a ajustar as frequências para resfriar, e o disponibiliza no nvidia-smi. Portanto, não se baseie em um número genérico como “83 °C”: consulte o valor da sua placa. As consequências do throttling são a redução da velocidade e, se os ventiladores compensarem, o ruído; a longo prazo, uma placa que funciona constantemente em temperaturas elevadas envelhece mais rápido, mas não temos um número confiável para citar sobre esse ponto.
#Medir antes de ajustar: o que realmente diz a placa
O ponto de partida é saber se a placa está ficando mais lenta e por quê. Dois comandos bastam em uma placa NVIDIA. O primeiro exibe continuamente a temperatura, a potência, a frequência do núcleo e a utilização; o segundo detalha os motivos da redução de velocidade e os limites de temperatura do seu modelo.
Execute esses comandos durante uma geração de vários minutos, não em repouso. Duas leituras são importantes. Se a frequência do núcleo cair enquanto a temperatura sobe e um indicador de limitação térmica estiver ativo, há um problema de refrigeração. Se a frequência do núcleo permanecer alta, mas um limite de potência estiver ativo, a placa está limitada pelo seu consumo: reduzir ainda mais o limite não terá efeito significativo na velocidade de geração, mas reduzirá o calor.
| Observação durante uma geração longa | Interpretação | Primeira ação |
|---|---|---|
| Temperatura estável abaixo do limite de redução de frequência, frequência estável | Sem problemas térmicos | Não alterar nada; se necessário, limitar a potência para reduzir o ruído |
| Temperatura que atinge o limite, frequência que cai, indicador de causa térmica ativo | Resfriamento insuficiente | Fluxo de ar do gabinete, poeira, curva dos ventiladores |
| Frequência baixa, motivo “power cap” ativo, temperatura adequada | Limite de potência atingido | Normal; aumentar o limite apenas se a taxa de geração for insuficiente |
| Diferença de velocidade entre a primeira e a décima troca | Aumento progressivo de temperatura | Medir sob carga prolongada, não no início |
#O limite de potência: a configuração que traz mais retorno
Limitar a potência é mais simples que ajustar a curva de tensão, e é reversível. Para inferência limitada pela memória, a perda é baixa até um certo limite, depois torna-se brusca. O blog runaihome, que mediu uma RTX 3090 com um modelo denso de 27 bilhões de parâmetros, indica que, ao passar de 350 W para 250 W, a placa perde menos de 3% de sua velocidade com 100 W a menos, e que, a 200 W, a frequência do núcleo despenca e a velocidade cai 35%.
| Limite | Efeito medido na geração |
|---|---|
| 350 W (padrão) | Referência |
| 300 W | A menos de 3 % do valor de referência |
| 250 W | 31,7 t/s, menos de 3 % abaixo da referência |
| 200 W | 20,6 t/s, ou seja, 35 % a menos: o limite a não ultrapassar |
Para uma RTX 4090, o mesmo blog cita o Tom's Hardware, segundo o qual um limite de potência de 70% (cerca de 315 W) mantém cerca de 94% do desempenho. Esses números vêm de fontes secundárias e de uma placa específica: não os aplique à sua sem adaptações. O método confiável é medir sua taxa de geração durante uma geração longa, reduzindo o limite em etapas de 25 a 50 W e parando antes da queda de desempenho.
A documentação do nvidia-smi especifica que o valor deve estar entre os limites mínimo e máximo informados pela placa e que o comando exige permissões de root. Após uma reinicialização, verifique se o limite continua aplicado: se tiver voltado ao valor padrão, crie uma unidade systemd que o reaplique na inicialização.
Ative com sudo systemctl enable --now nvidia-power-limit.service.
#Curva dos ventiladores: agressiva desde cedo, em vez de brusca mais tarde
A curva de fábrica prioriza o silêncio: os ventiladores giram devagar até uma temperatura elevada e depois aceleram gradualmente. Para uma carga contínua, uma curva que começa a acelerar mais cedo mantém a placa mais fria com um nível de ruído comparável, pois evita picos de velocidade. No Windows, o MSI Afterburner ajusta a curva; no Linux, o LACT é um aplicativo gráfico de controle de GPUs AMD, NVIDIA e Intel que inclui o controle dos ventiladores.
| Temperatura | Velocidade do ventilador |
|---|---|
| 50 °C | 40 % |
| 60 °C | 55 % |
| 70 °C | 75 % |
| 78 °C | 90 % |
| 5 °C abaixo do limiar de redução de desempenho | 100 % |
Esses valores são apenas um ponto de partida, não uma recomendação do fabricante. Ajuste o último nível com base no valor "GPU Slowdown Temp" da sua placa e avalie o resultado com base no ruído tolerável no ambiente. No macOS, Apple controla os ventiladores: não há configuração de curva.
#Undervolting: ajuste mais preciso, mais demorado para validar
O undervolting consiste em obter a mesma frequência com uma tensão mais baixa e, portanto, menos calor. Ele é ajustado no Windows pelo MSI Afterburner (curva frequência-tensão); no Linux, a abordagem comum é travar as frequências com a opção do nvidia-smi que define o intervalo de frequências do núcleo. O ganho depende da placa: cada chip tem sua própria margem, e um ajuste agressivo demais causa erros ou travamentos mais tarde, não imediatamente.
- 01Partir de um limite de potência que funcioneComece pela limitação de potência: é o ganho mais seguro. Só adicione um undervolt se a placa continuar quente demais ou barulhenta demais.
- 02Definir uma frequência máximaFixe a frequência do núcleo em um valor inferior à frequência máxima de boost, por exemplo com nvidia-smi -lgc seguido de um intervalo de frequências em MHz.
- 03Testar por longos períodosInicie uma geração contínua de pelo menos 30 minutos. Uma instabilidade se manifesta por erros CUDA, travamentos do driver ou saídas incoerentes.
- 04CompararMeça a velocidade e a temperatura antes e depois, usando o mesmo modelo e o mesmo prompt, depois mantenha o ajuste apenas se a perda de velocidade for desprezível.
- 05Cancelar se necessárioRestaure as frequências (nvidia-smi -rgc) ou reinicie o sistema para voltar às configurações de fábrica.
#Gabinete e fluxo de ar: o ganho é medido em graus
- Caminho do ar
- Um fluxo de ar desobstruído da frente para trás, com ar fresco direcionado aos ventiladores da placa. Cabos que obstruem o fluxo fazem a temperatura subir alguns graus.
- Filtros e poeira
- Um filtro sujo reduz o fluxo de ar: limpe-o regularmente e remova a poeira do dissipador da placa com ar comprimido, mantendo as ventoinhas imobilizadas para evitar que girem em velocidade excessiva.
- Espaço ao redor da placa
- Duas placas muito próximas em uma configuração multi-GPU aquecem a primeira; deixe espaço entre elas ou adicione um ventilador lateral.
- Ambiente
- Um ambiente a 30 °C, em vez de 20 °C, acrescenta esses dez graus à temperatura da placa: um servidor em um armário fechado é um problema térmico antes de ser um problema da placa.
Para avaliar um ajuste sem se enganar, mantenha um protocolo constante: o mesmo modelo, o mesmo prompt longo e o mesmo tempo de geração, alterando apenas um parâmetro de cada vez. Anote a temperatura máxima, a frequência do núcleo e a taxa média no final da geração, não no início, pois uma placa fria sempre dá melhores resultados do que a mesma placa após vinte minutos. Repita a medição na mesma temperatura ambiente, caso contrário, a comparação será distorcida pelo ambiente, não pelo ajuste.
#Repasting: último recurso, com seus riscos
Após vários anos, a pasta e os pads térmicos de uma placa usada podem ter ressecado. O sintoma é uma temperatura mais alta do que no momento da compra sob a mesma carga, apesar de o gabinete estar limpo. Desmontar uma placa de vídeo invalida a garantia, pode danificar os pads e o chip e exige método. Só faça isso depois de descartar as causas mais simples: poeira, fluxo de ar, limite de potência e temperatura ambiente. Se você não tiver certeza, confie a placa a um profissional; compare o custo com o de uma placa de substituição.
#Notebooks e Mac: as opções de ajuste mudam
Em um notebook, você não ajusta a tensão nem a pasta térmica. O recurso útil é o modo de alimentação. A Apple descreve dois modos: o modo Economia de energia, que, no macOS Sequoia 15.1 e versões mais recentes, também reduz o ruído dos ventiladores nos modelos com refrigeração ativa, e o modo Alta potência, que permite que os ventiladores girem mais rápido para manter o desempenho em cargas muito intensas, com ruído adicional. Para um MacBook Air sem ventilador, as únicas opções são um suporte que dissipe o calor, a alimentação pela rede elétrica e um modelo menor.
- Escolher sua GPU para IA local
- Configuração de PC para IA com 32 GB
- Configuração multi-GPU com llama.cpp
- Fonte: documentação nvidia-smi
- Fonte: medições de limite de potência (runaihome)
- Fonte: Apple, modos de alimentação do Mac
#Perguntas frequentes
A que temperatura uma placa gráfica começa a desacelerar?+
Limitar a potência deixa a inferência muito mais lenta?+
Como saber se a minha GPU está em throttling?+
É necessário trocar a pasta térmica da placa?+
Redução de tensão ou limite de potência: qual escolher?+
Um MacBook tem configurações térmicas para IA local?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.