Intermediário 11 minDesempenho

Otimizar o desempenho térmico em inferência

Resposta direta

Para inferência contínua, a medida térmica com melhor custo-benefício é limitar a potência da GPU: de acordo com uma medição publicada com uma RTX 3090, passar de 350 W para 250 W reduz a velocidade de geração em menos de 3%, enquanto abaixo desse limite a velocidade cai drasticamente. Verifique primeiro o que realmente limita a placa (temperatura ou potência) com nvidia-smi, antes de mexer nas ventoinhas, na tensão ou na pasta térmica.

Uma máquina que responde a requisições o dia inteiro aquece de forma diferente de quando executa um videogame: carga constante, memória muito exigida, gabinete fechado. Esta página explica como saber se a sua placa está ficando mais lenta, qual ajuste tentar primeiro, quanto o limite de potência realmente custa em tokens por segundo e quando a manutenção (poeira, pasta térmica, gabinete) é a verdadeira solução.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.

Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#Por que o comportamento térmico importa para um servidor de inferência

Uma GPU protege seu chip: quando a temperatura ou a potência ultrapassa o que seu firmware permite, ela reduz suas frequências. Esse mecanismo se chama throttling. A documentação do nvidia-smi distingue suas causas: uma desaceleração por software relacionada à temperatura (« sw thermal slowdown »), uma desaceleração por hardware mais brusca que reduz as frequências por um fator de 2 ou mais (« hw thermal slowdown ») e um limite de potência (« sw power cap »). Se todas essas causas estiverem indicadas como inativas, as frequências ficam no nível mais alto possível.

O limite não é o mesmo em todas as placas. A NVIDIA o define como “GPU Slowdown Temp”, a temperatura em que o hardware começa a ajustar as frequências para resfriar, e o disponibiliza no nvidia-smi. Portanto, não se baseie em um número genérico como “83 °C”: consulte o valor da sua placa. As consequências do throttling são a redução da velocidade e, se os ventiladores compensarem, o ruído; a longo prazo, uma placa que funciona constantemente em temperaturas elevadas envelhece mais rápido, mas não temos um número confiável para citar sobre esse ponto.

i
Decodificação e prompt: duas sensibilidades diferentes
A geração de texto é limitada pela largura de banda da memória, portanto é pouco sensível à frequência do núcleo. O processamento do prompt é limitado pela capacidade de cálculo, portanto é mais sensível a qualquer redução de frequência. Um servidor que recebe documentos longos ou loops de agentes sofrerá mais com um limite de potência do que um chat interativo.

#Medir antes de ajustar: o que realmente diz a placa

O ponto de partida é saber se a placa está ficando mais lenta e por quê. Dois comandos bastam em uma placa NVIDIA. O primeiro exibe continuamente a temperatura, a potência, a frequência do núcleo e a utilização; o segundo detalha os motivos da redução de velocidade e os limites de temperatura do seu modelo.

Monitorar sob carga (uma linha por segundo)
nvidia-smi --query-gpu=timestamp,temperature.gpu,power.draw,clocks.current.graphics,clocks.current.memory,utilization.gpu --format=csv -l 1
Motivos de redução de desempenho e limites de temperatura
nvidia-smi -q -d PERFORMANCE
nvidia-smi -q -d TEMPERATURE
Placas AMD
rocm-smi --showtemp --showpower --showuse

Execute esses comandos durante uma geração de vários minutos, não em repouso. Duas leituras são importantes. Se a frequência do núcleo cair enquanto a temperatura sobe e um indicador de limitação térmica estiver ativo, há um problema de refrigeração. Se a frequência do núcleo permanecer alta, mas um limite de potência estiver ativo, a placa está limitada pelo seu consumo: reduzir ainda mais o limite não terá efeito significativo na velocidade de geração, mas reduzirá o calor.

O que ler, o que concluir
Observação durante uma geração longaInterpretaçãoPrimeira ação
Temperatura estável abaixo do limite de redução de frequência, frequência estávelSem problemas térmicosNão alterar nada; se necessário, limitar a potência para reduzir o ruído
Temperatura que atinge o limite, frequência que cai, indicador de causa térmica ativoResfriamento insuficienteFluxo de ar do gabinete, poeira, curva dos ventiladores
Frequência baixa, motivo “power cap” ativo, temperatura adequadaLimite de potência atingidoNormal; aumentar o limite apenas se a taxa de geração for insuficiente
Diferença de velocidade entre a primeira e a décima trocaAumento progressivo de temperaturaMedir sob carga prolongada, não no início

#O limite de potência: a configuração que traz mais retorno

Limitar a potência é mais simples que ajustar a curva de tensão, e é reversível. Para inferência limitada pela memória, a perda é baixa até um certo limite, depois torna-se brusca. O blog runaihome, que mediu uma RTX 3090 com um modelo denso de 27 bilhões de parâmetros, indica que, ao passar de 350 W para 250 W, a placa perde menos de 3% de sua velocidade com 100 W a menos, e que, a 200 W, a frequência do núcleo despenca e a velocidade cai 35%.

Limite de potência e velocidade de geração, RTX 3090 (medição publicada por runaihome)
LimiteEfeito medido na geração
350 W (padrão)Referência
300 WA menos de 3 % do valor de referência
250 W31,7 t/s, menos de 3 % abaixo da referência
200 W20,6 t/s, ou seja, 35 % a menos: o limite a não ultrapassar

Para uma RTX 4090, o mesmo blog cita o Tom's Hardware, segundo o qual um limite de potência de 70% (cerca de 315 W) mantém cerca de 94% do desempenho. Esses números vêm de fontes secundárias e de uma placa específica: não os aplique à sua sem adaptações. O método confiável é medir sua taxa de geração durante uma geração longa, reduzindo o limite em etapas de 25 a 50 W e parando antes da queda de desempenho.

Limitar a potência (Linux, adaptar para a sua placa)
# Lire la limite par défaut, minimale et maximale
nvidia-smi -q -d POWER

# Appliquer 250 W sur la carte 0 (nécessite les droits root)
sudo nvidia-smi -i 0 -pl 250

A documentação do nvidia-smi especifica que o valor deve estar entre os limites mínimo e máximo informados pela placa e que o comando exige permissões de root. Após uma reinicialização, verifique se o limite continua aplicado: se tiver voltado ao valor padrão, crie uma unidade systemd que o reaplique na inicialização.

/etc/systemd/system/nvidia-power-limit.service
[Unit]
Description=Limite de puissance GPU
After=multi-user.target

[Service]
Type=oneshot
ExecStart=/usr/bin/nvidia-smi -i 0 -pl 250
RemainAfterExit=yes

[Install]
WantedBy=multi-user.target

Ative com sudo systemctl enable --now nvidia-power-limit.service.

#Curva dos ventiladores: agressiva desde cedo, em vez de brusca mais tarde

A curva de fábrica prioriza o silêncio: os ventiladores giram devagar até uma temperatura elevada e depois aceleram gradualmente. Para uma carga contínua, uma curva que começa a acelerar mais cedo mantém a placa mais fria com um nível de ruído comparável, pois evita picos de velocidade. No Windows, o MSI Afterburner ajusta a curva; no Linux, o LACT é um aplicativo gráfico de controle de GPUs AMD, NVIDIA e Intel que inclui o controle dos ventiladores.

Exemplo de curva para carga contínua (a validar em sua placa)
TemperaturaVelocidade do ventilador
50 °C40 %
60 °C55 %
70 °C75 %
78 °C90 %
5 °C abaixo do limiar de redução de desempenho100 %

Esses valores são apenas um ponto de partida, não uma recomendação do fabricante. Ajuste o último nível com base no valor "GPU Slowdown Temp" da sua placa e avalie o resultado com base no ruído tolerável no ambiente. No macOS, Apple controla os ventiladores: não há configuração de curva.

#Undervolting: ajuste mais preciso, mais demorado para validar

O undervolting consiste em obter a mesma frequência com uma tensão mais baixa e, portanto, menos calor. Ele é ajustado no Windows pelo MSI Afterburner (curva frequência-tensão); no Linux, a abordagem comum é travar as frequências com a opção do nvidia-smi que define o intervalo de frequências do núcleo. O ganho depende da placa: cada chip tem sua própria margem, e um ajuste agressivo demais causa erros ou travamentos mais tarde, não imediatamente.

  1. 01
    Partir de um limite de potência que funcione
    Comece pela limitação de potência: é o ganho mais seguro. Só adicione um undervolt se a placa continuar quente demais ou barulhenta demais.
  2. 02
    Definir uma frequência máxima
    Fixe a frequência do núcleo em um valor inferior à frequência máxima de boost, por exemplo com nvidia-smi -lgc seguido de um intervalo de frequências em MHz.
  3. 03
    Testar por longos períodos
    Inicie uma geração contínua de pelo menos 30 minutos. Uma instabilidade se manifesta por erros CUDA, travamentos do driver ou saídas incoerentes.
  4. 04
    Comparar
    Meça a velocidade e a temperatura antes e depois, usando o mesmo modelo e o mesmo prompt, depois mantenha o ajuste apenas se a perda de velocidade for desprezível.
  5. 05
    Cancelar se necessário
    Restaure as frequências (nvidia-smi -rgc) ou reinicie o sistema para voltar às configurações de fábrica.
!
O undervolt não é garantido
Diferentemente da limitação de potência, um undervolt excessivo pode tornar o sistema instável de forma intermitente. Em um servidor que roda sem supervisão, mantenha apenas a limitação de potência se não tiver testado por várias horas.

#Gabinete e fluxo de ar: o ganho é medido em graus

Caminho do ar
Um fluxo de ar desobstruído da frente para trás, com ar fresco direcionado aos ventiladores da placa. Cabos que obstruem o fluxo fazem a temperatura subir alguns graus.
Filtros e poeira
Um filtro sujo reduz o fluxo de ar: limpe-o regularmente e remova a poeira do dissipador da placa com ar comprimido, mantendo as ventoinhas imobilizadas para evitar que girem em velocidade excessiva.
Espaço ao redor da placa
Duas placas muito próximas em uma configuração multi-GPU aquecem a primeira; deixe espaço entre elas ou adicione um ventilador lateral.
Ambiente
Um ambiente a 30 °C, em vez de 20 °C, acrescenta esses dez graus à temperatura da placa: um servidor em um armário fechado é um problema térmico antes de ser um problema da placa.

Para avaliar um ajuste sem se enganar, mantenha um protocolo constante: o mesmo modelo, o mesmo prompt longo e o mesmo tempo de geração, alterando apenas um parâmetro de cada vez. Anote a temperatura máxima, a frequência do núcleo e a taxa média no final da geração, não no início, pois uma placa fria sempre dá melhores resultados do que a mesma placa após vinte minutos. Repita a medição na mesma temperatura ambiente, caso contrário, a comparação será distorcida pelo ambiente, não pelo ajuste.

#Repasting: último recurso, com seus riscos

Após vários anos, a pasta e os pads térmicos de uma placa usada podem ter ressecado. O sintoma é uma temperatura mais alta do que no momento da compra sob a mesma carga, apesar de o gabinete estar limpo. Desmontar uma placa de vídeo invalida a garantia, pode danificar os pads e o chip e exige método. Só faça isso depois de descartar as causas mais simples: poeira, fluxo de ar, limite de potência e temperatura ambiente. Se você não tiver certeza, confie a placa a um profissional; compare o custo com o de uma placa de substituição.

#Notebooks e Mac: as opções de ajuste mudam

Em um notebook, você não ajusta a tensão nem a pasta térmica. O recurso útil é o modo de alimentação. A Apple descreve dois modos: o modo Economia de energia, que, no macOS Sequoia 15.1 e versões mais recentes, também reduz o ruído dos ventiladores nos modelos com refrigeração ativa, e o modo Alta potência, que permite que os ventiladores girem mais rápido para manter o desempenho em cargas muito intensas, com ruído adicional. Para um MacBook Air sem ventilador, as únicas opções são um suporte que dissipe o calor, a alimentação pela rede elétrica e um modelo menor.

#Perguntas frequentes

FAQ
A que temperatura uma placa gráfica começa a desacelerar?+
Isso depende do modelo. A NVIDIA define no nvidia-smi uma “GPU Slowdown Temp”, temperatura a partir da qual o hardware otimiza as frequências para resfriar. O comando nvidia-smi -q -d TEMPERATURE exibe o valor da sua placa. Não confie em um limite geral como 83 °C sem verificá-lo.
Limitar a potência deixa a inferência muito mais lenta?+
Pouco, até um limite. Uma medição publicada com uma RTX 3090 indica menos de 3% de perda ao passar de 350 W para 250 W durante a geração, seguida de uma queda de 35% a 200 W. O processamento do prompt, limitado pela capacidade de cálculo, é mais sensível. Meça na sua placa com sua carga de trabalho.
Como saber se a minha GPU está em throttling?+
Inicie uma geração longa e observe a frequência do núcleo com nvidia-smi. Se ela cair enquanto a temperatura sobe, consulte nvidia-smi -q -d PERFORMANCE: ele indica se algum motivo de limitação térmica ou de potência está ativo. Se todos os motivos estiverem inativos, as frequências estarão no nível mais alto possível.
É necessário trocar a pasta térmica da placa?+
Raramente. Primeiro, descarte como possíveis causas a poeira, o fluxo de ar do gabinete, a temperatura ambiente e o limite de potência. A desmontagem anula a garantia e apresenta riscos para os pads térmicos e o chip. Ela só se justifica se as temperaturas tiverem aumentado significativamente em uma placa limpa, depois de verificar todo o resto.
Redução de tensão ou limite de potência: qual escolher?+
Comece pelo limite de potência: ele é simples, reversível e não apresenta risco de instabilidade. O undervolting exige testes prolongados e pode causar travamentos intermitentes, especialmente em um servidor sem supervisão. Só adicione o undervolting se a placa continuar muito quente ou barulhenta apenas com o limite de potência.
Um MacBook tem configurações térmicas para IA local?+
Pouco. Apple oferece modos de alimentação: Economia de energia e Alta potência em alguns modelos com ventiladores mais rápidos, mas com mais barulho. Em um MacBook Air sem ventilador, coloque a máquina em um suporte que dissipe o calor, ligue-a à tomada e escolha um modelo menor para gerações longas.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.