Iniciante 11 minNPU

NPU: o que é e é útil para um LLM local ?

Resposta direta

Um NPU (Unidade de Processamento Neural) é um processador de baixo consumo, integrado ao chip da maioria dos notebooks vendidos desde 2024, dedicado a pequenas tarefas contínuas de IA: desfoque de fundo, legendas em tempo real, busca de fotos. Seu indicador principal, os TOPS, quase não diz nada sobre sua capacidade de rodar um LLM local: a velocidade de geração depende da largura de banda da memória, e o NPU compartilha a mesma RAM lenta do processador.

Uma NPU, sigla de Neural Processing Unit (unidade de processamento neural), é um processador especializado em cálculos de redes neurais, integrado ao chip da maioria dos notebooks vendidos desde 2024. Ela executa pequenas tarefas de IA continuamente, como o desfoque de fundo ou as legendas em tempo real, consumindo poucos watts. Seu indicador de destaque, os TOPS, é usado como argumento em todas as etiquetas de “PC com IA”. Em 20 de setembro de 2026, esse indicador, porém, quase nada diz sobre a capacidade de uma máquina de executar um LLM localmente. Veja por quê e o que observar em seu lugar.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-28·Testado no Windows, macOS e Linux
Hardware recomendado

Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.

Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#O que é uma NPU?

Uma rede neural, do ponto de vista do cálculo, resume-se a imensas sequências de multiplicações de matrizes com números de baixa precisão, repetidas bilhões de vezes. Um processador convencional consegue fazer isso, lentamente, com poucas operações por vez. Uma placa de vídeo faz isso rapidamente, em paralelo em milhares de unidades, consumindo dezenas a centenas de watts. Uma NPU é uma porção de silício projetada para fazer apenas isso, e nada mais: unidades de cálculo fixas para inteiros de 8 e 4 bits, pequenas memórias colocadas logo ao lado para evitar transferências de ida e volta custosas e um escalonador que movimenta os dados o mínimo possível. O resultado dessa especialização extrema: uma velocidade máxima modesta em comparação com uma GPU, mas uma eficiência por watt muito superior, o que conta muito quando o dispositivo funciona com bateria.

A ideia é mais antiga do que a etiqueta de marketing que a acompanha hoje. A Apple integra um Neural Engine em seus iPhones desde 2017 e em todos os seus Macs Apple Silicon desde o lançamento; os chips Pixel do Google incorporam um bloco TPU há várias gerações. O que realmente mudou em 2024 foi que Intel, AMD e Qualcomm colocaram, ao mesmo tempo, um NPU de capacidade considerável em seus processadores para notebooks voltados ao consumidor, e que a Microsoft imediatamente tornou toda uma gama de funções do Windows dependente desse componente, sob o nome comercial Copilot+ PC. É essa convergência, mais do que a tecnologia em si, que explica a explosão de etiquetas "PC com IA" nas prateleiras nos últimos dois anos.

#CPU, GPU, NPU: as diferenças

CPUGPUNPU
Concebido paraA lógica geral, a baixa latênciaComputação massivamente paralela, gráficosApenas inferência de redes neurais
Consumo sob carga de IA15 à 125 W30 W (integrado) a 575 W (RTX 5090)1 à 10 W
Memória utilizadaA RAM do sistemaSua própria VRAM, ou a RAM se integradoA RAM do sistema
Suporte de softwareUniversalMuito amplo: CUDA, ROCm, Metal, VulkanLimitado, específico de cada fabricante
Campo de atuaçãoOrquestração, modelos pequenos como alternativa de emergênciaLLMs, geração de imagens, treinamentoIA leve e contínua, funcionando com bateria

Os três chips são complementares, não concorrentes: cada um existe porque oferece um equilíbrio diferente entre velocidade, consumo e versatilidade. Em um “PC com IA”, a NPU gerencia os efeitos da webcam durante quatro horas de videoconferência enquanto a GPU permanece inativa, preservando uma boa parte da autonomia da bateria que o uso contínuo da GPU teria consumido. Peça à mesma máquina para rodar um assistente de 14 bilhões de parâmetros, e todo o trabalho será feito pela GPU, porque é nela que se encontram tanto a largura de banda de memória necessária quanto o suporte de software maduro: nenhum runtime voltado ao público geral consegue hoje rodar um LLM desse tamanho em uma NPU.

#Os TOPS: o que eles medem, o que escondem

TOPS significa “um trilhão de operações por segundo” (Tera Operations Per Second), quase sempre medidos com operações sobre inteiros de 8 bits para permitir comparações entre fichas técnicas. Trata-se da capacidade de processamento de pico, medida em laboratório sob condições favoráveis. Ela não diz nada sobre a velocidade com que os dados chegam da memória a essas unidades de cálculo, e é exatamente isso que limita um modelo de linguagem na prática: uma NPU sem dados suficientes passa a maior parte do tempo esperando, com TOPS elevados ou não.

Dados dos fabricantes · os métodos de medição diferem, uma diferença de alguns pontos não é significativa
Família de chipsNPU anunciadoElegível para Copilot+ (40 TOPS ou mais)
Intel Core Ultra série 1 (Meteor Lake)≈ 11 TOPSNão
Apple M4 (Neural Engine)38 TOPSNão se aplica (macOS)
Qualcomm Snapdragon X Elite e X Plus45 TOPSSim
Intel Core Ultra 200V (Lunar Lake)48 TOPSSim
AMD Ryzen AI 30050 TOPSSim
AMD Ryzen AI Max+ 395 (Strix Halo)50 TOPSSim
Intel Core Ultra 300 (Panther Lake, CES de janeiro de 2026)Até 50 TOPS (NPU 5)Sim
AMD Ryzen AI 400 / PRO 400 « Gorgon Point » (CES janeiro de 2026)Até 60 TOPSSim
Qualcomm Snapdragon X2 Elite (CES, janeiro de 2026)80 TOPSSim

Esta nova geração, apresentada na CES em janeiro de 2026 e já disponível em notebooks comercializados em 28 de setembro de 2026, eleva o número exibido muito acima do patamar mínimo do Copilot+: o Snapdragon X2 Elite quase dobra a pontuação do seu antecessor, com 80 TOPS contra 45 anteriormente. Nada disso muda a conclusão desta página: o argumento a seguir, sobre a largura de banda da memória compartilhada, aplica-se da mesma forma a esses novos chips, por mais impressionante que pareça o número de TOPS na etiqueta.

#Por que um NPU não acelera seus LLMs

Para produzir um único token, um modelo deve reler a maior parte de seus pesos na memória, do primeiro ao último parâmetro ativo. Um modelo de 14 bilhões de parâmetros em Q4 pesa cerca de 9 GB: gerar 20 tokens por segundo equivale, portanto, a transferir 180 GB por segundo entre a memória e as unidades de cálculo. O cálculo aritmético em si, a multiplicação propriamente dita, tem baixo custo em comparação com essa transferência contínua. A velocidade de geração acompanha, portanto, a largura de banda de memória disponível, e não a capacidade de cálculo em TOPS ou TFLOPS anunciada na ficha do produto, o que explica por que dois chips com valores de TOPS muito diferentes podem gerar texto exatamente à mesma velocidade.

Limite teórico = largura de banda ÷ tamanho do modelo (Qwen 3 14B em Q4, 9 GB no catálogo QuelLLM). Os sistemas reais se aproximam desse limite, mas não o atingem.
Onde está o modeloLargura de bandaLimite para um modelo de 9 GB
LPDDR5X de notebook (o que é compartilhado entre NPU e GPU integrado)≈ 70 a 135 GB/s≈ 8 a 15 tok/s
Memória unificada do Ryzen AI Max+ 395256 GB/s≈ 28 tok/s
RTX 4070 (GDDR6X)504 GB/s≈ 56 tok/s
RTX 5070 Ti (GDDR7)896 GB/s≈ 100 tok/s
RTX 5090 (GDDR7)1 792 GB/s≈ 200 tok/s

Uma NPU de 50 TOPS, assim como uma NPU de 80 TOPS nos chips mais recentes, está na primeira linha da tabela. Ela acessa a mesma memória LPDDR5X compartilhada com o processador: independentemente do número de TOPS exibido, ela não pode fisicamente operar mais rápido do que essa memória permite. Um notebook com 45 TOPS e outro com 80 TOPS escreverão texto exatamente na mesma velocidade se ambos tiverem memória com a mesma capacidade e taxa de transferência.

Uma NPU pode realmente ajudar na leitura do prompt, uma fase que exige sobretudo capacidade de cálculo, mais do que largura de banda, pois o modelo processa todo o texto já presente de uma vez, em vez de produzi-lo palavra por palavra. Configurações híbridas que atribuem essa leitura à NPU e a geração à GPU integrada reduzem a espera até a primeira palavra exibida e o consumo total, em modelos pequenos com bom suporte. Isso proporciona maior autonomia e uma resposta percebida como mais ágil, com ganhos mensuráveis na latência, mas não permite rodar modelos maiores nem aumentar a velocidade de geração contínua de texto.

#O verdadeiro gargalo: o software

Ollama, llama.cpp, LM Studio
Eles rodam na GPU ou na CPU. Em um notebook Copilot+, usam a GPU integrada ou o processador e ignoram a NPU.
Windows
Os modelos embarcados da Microsoft e seu ambiente Foundry Local são voltados ao NPU via ONNX Runtime, com uma seleção de modelos pequenos.
AMD
Ryzen AI Software e o servidor Lemonade executam alguns modelos ONNX em modo híbrido, com NPU e GPU integrado.
Intel
O OpenVINO pode executar os modelos compatíveis na NPU.
Qualcomm
A cadeia de ferramentas QNN e AI Hub fornecem modelos já convertidos para o NPU Hexagon.
Apple
O Core ML utiliza o Neural Engine, mas as ferramentas de LLM realmente usadas no Mac (MLX, llama.cpp, Ollama) passam pelo GPU, via Metal.

O ponto em comum entre todas essas ferramentas: usar a NPU significa escolher entre uma lista curta de modelos já convertidos e validados pelo fabricante, geralmente com 1 a 8 bilhões de parâmetros, e não baixar qualquer GGUF encontrado no Hugging Face para executá-lo diretamente. Essa conversão exige um formato e uma cadeia de ferramentas diferentes para cada fabricante, o que explica por que nenhum projeto comunitário ainda unificou o suporte a NPUs como o llama.cpp fez para as GPUs.

#O que avaliar em vez disso antes de comprar

  1. 01
    A memória que o GPU pode usar
    A VRAM de uma placa dedicada, ou a memória unificada de um Mac ou de uma máquina Strix Halo. É ela que determina quais modelos podem ser carregados.
  2. 02
    A largura de banda dessa memória
    É ela que determina diretamente a quantidade de tokens gerados por segundo.
  3. 03
    O suporte de software
    NVIDIA sem nenhuma complicação, Apple Silicon quase tão bem, AMD com suporte adequado no Linux.
  4. 04
    Os TOPS da NPU
    Úteis se você quer os recursos Copilot+ do Windows e uma longa autonomia de bateria em videoconferências. Sem efeito sobre os LLMs de pesos abertos hoje.

#FAQ

O que significa NPU?+
Neural Processing Unit, ou unidade de processamento neural. É um bloco do processador dedicado à execução eficiente de redes neurais, presente na maioria dos chips recentes de notebooks e telefones, ao lado da CPU e da GPU. Ele gerencia continuamente pequenas tarefas de IA, como o desfoque de fundo em videoconferências, sem aquecer a bateria nem esgotar rapidamente sua carga.
Uma NPU é melhor que uma GPU para IA?+
É muito mais eficiente em termos de consumo de energia para tarefas pequenas e contínuas, em torno de 1 a 10 W contra 30 W ou mais para uma GPU. Uma GPU continua sendo muito mais rápida e tem suporte muito melhor nos softwares para modelos grandes, LLMs e geradores de imagens. Eles não são concorrentes: simplesmente não fazem o mesmo trabalho, nem trabalham com modelos dos mesmos tamanhos.
Ollama ou LM Studio usam o NPU?+
Não, em 28 de setembro de 2026. Eles rodam na GPU, via CUDA, ROCm, Metal ou Vulkan, dependendo do hardware, ou no processador como último recurso. Usar a NPU exige as ferramentas próprias de cada fabricante: ONNX Runtime para Windows, Ryzen AI Software para AMD, OpenVINO para Intel, cada uma com uma lista limitada de modelos já convertidos.
É necessário um NPU para rodar uma IA localmente?+
Não, absolutamente não. Qualquer máquina com uma GPU adequada ou memória unificada suficiente executa modelos locais sem precisar de NPU, como já era o caso antes de 2024. Esse componente é exigido apenas para ativar as funções Copilot+ específicas do Windows, não para Ollama, LM Studio ou qualquer outra ferramenta de inferência comum.
Quantos TOPS são necessários?+
40 TOPS é o limiar para o selo Copilot+ PC da Microsoft. Os chips lançados na CES de janeiro de 2026, Panther Lake, Ryzen AI 400 e Snapdragon X2 Elite, chegam agora a 50, 60 e até 80 TOPS. Acima do limiar Copilot+, a diferença quase não tem efeito prático perceptível, e não tem absolutamente nenhum efeito sobre a velocidade de geração de um LLM executado localmente.
Os novos chips NPU de 2026 mudam algo para a IA local?+
Não, não para os LLM. Panther Lake, Ryzen AI 400 e Snapdragon X2 Elite aumentam os TOPS anunciados, mas a NPU continua usando a mesma memória do sistema que o processador, sem ganho de largura de banda associado. O gargalo que limita a velocidade de geração de um modelo de linguagem permanece exatamente o mesmo que com a geração anterior de chips.

Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.