NPU: o que é e é útil para um LLM local ?
Um NPU (Unidade de Processamento Neural) é um processador de baixo consumo, integrado ao chip da maioria dos notebooks vendidos desde 2024, dedicado a pequenas tarefas contínuas de IA: desfoque de fundo, legendas em tempo real, busca de fotos. Seu indicador principal, os TOPS, quase não diz nada sobre sua capacidade de rodar um LLM local: a velocidade de geração depende da largura de banda da memória, e o NPU compartilha a mesma RAM lenta do processador.
Uma NPU, sigla de Neural Processing Unit (unidade de processamento neural), é um processador especializado em cálculos de redes neurais, integrado ao chip da maioria dos notebooks vendidos desde 2024. Ela executa pequenas tarefas de IA continuamente, como o desfoque de fundo ou as legendas em tempo real, consumindo poucos watts. Seu indicador de destaque, os TOPS, é usado como argumento em todas as etiquetas de “PC com IA”. Em 20 de setembro de 2026, esse indicador, porém, quase nada diz sobre a capacidade de uma máquina de executar um LLM localmente. Veja por quê e o que observar em seu lugar.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.
Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#O que é uma NPU?
Uma rede neural, do ponto de vista do cálculo, resume-se a imensas sequências de multiplicações de matrizes com números de baixa precisão, repetidas bilhões de vezes. Um processador convencional consegue fazer isso, lentamente, com poucas operações por vez. Uma placa de vídeo faz isso rapidamente, em paralelo em milhares de unidades, consumindo dezenas a centenas de watts. Uma NPU é uma porção de silício projetada para fazer apenas isso, e nada mais: unidades de cálculo fixas para inteiros de 8 e 4 bits, pequenas memórias colocadas logo ao lado para evitar transferências de ida e volta custosas e um escalonador que movimenta os dados o mínimo possível. O resultado dessa especialização extrema: uma velocidade máxima modesta em comparação com uma GPU, mas uma eficiência por watt muito superior, o que conta muito quando o dispositivo funciona com bateria.
A ideia é mais antiga do que a etiqueta de marketing que a acompanha hoje. A Apple integra um Neural Engine em seus iPhones desde 2017 e em todos os seus Macs Apple Silicon desde o lançamento; os chips Pixel do Google incorporam um bloco TPU há várias gerações. O que realmente mudou em 2024 foi que Intel, AMD e Qualcomm colocaram, ao mesmo tempo, um NPU de capacidade considerável em seus processadores para notebooks voltados ao consumidor, e que a Microsoft imediatamente tornou toda uma gama de funções do Windows dependente desse componente, sob o nome comercial Copilot+ PC. É essa convergência, mais do que a tecnologia em si, que explica a explosão de etiquetas "PC com IA" nas prateleiras nos últimos dois anos.
#CPU, GPU, NPU: as diferenças
| CPU | GPU | NPU | |
|---|---|---|---|
| Concebido para | A lógica geral, a baixa latência | Computação massivamente paralela, gráficos | Apenas inferência de redes neurais |
| Consumo sob carga de IA | 15 à 125 W | 30 W (integrado) a 575 W (RTX 5090) | 1 à 10 W |
| Memória utilizada | A RAM do sistema | Sua própria VRAM, ou a RAM se integrado | A RAM do sistema |
| Suporte de software | Universal | Muito amplo: CUDA, ROCm, Metal, Vulkan | Limitado, específico de cada fabricante |
| Campo de atuação | Orquestração, modelos pequenos como alternativa de emergência | LLMs, geração de imagens, treinamento | IA leve e contínua, funcionando com bateria |
Os três chips são complementares, não concorrentes: cada um existe porque oferece um equilíbrio diferente entre velocidade, consumo e versatilidade. Em um “PC com IA”, a NPU gerencia os efeitos da webcam durante quatro horas de videoconferência enquanto a GPU permanece inativa, preservando uma boa parte da autonomia da bateria que o uso contínuo da GPU teria consumido. Peça à mesma máquina para rodar um assistente de 14 bilhões de parâmetros, e todo o trabalho será feito pela GPU, porque é nela que se encontram tanto a largura de banda de memória necessária quanto o suporte de software maduro: nenhum runtime voltado ao público geral consegue hoje rodar um LLM desse tamanho em uma NPU.
#Os TOPS: o que eles medem, o que escondem
TOPS significa “um trilhão de operações por segundo” (Tera Operations Per Second), quase sempre medidos com operações sobre inteiros de 8 bits para permitir comparações entre fichas técnicas. Trata-se da capacidade de processamento de pico, medida em laboratório sob condições favoráveis. Ela não diz nada sobre a velocidade com que os dados chegam da memória a essas unidades de cálculo, e é exatamente isso que limita um modelo de linguagem na prática: uma NPU sem dados suficientes passa a maior parte do tempo esperando, com TOPS elevados ou não.
| Família de chips | NPU anunciado | Elegível para Copilot+ (40 TOPS ou mais) |
|---|---|---|
| Intel Core Ultra série 1 (Meteor Lake) | ≈ 11 TOPS | Não |
| Apple M4 (Neural Engine) | 38 TOPS | Não se aplica (macOS) |
| Qualcomm Snapdragon X Elite e X Plus | 45 TOPS | Sim |
| Intel Core Ultra 200V (Lunar Lake) | 48 TOPS | Sim |
| AMD Ryzen AI 300 | 50 TOPS | Sim |
| AMD Ryzen AI Max+ 395 (Strix Halo) | 50 TOPS | Sim |
| Intel Core Ultra 300 (Panther Lake, CES de janeiro de 2026) | Até 50 TOPS (NPU 5) | Sim |
| AMD Ryzen AI 400 / PRO 400 « Gorgon Point » (CES janeiro de 2026) | Até 60 TOPS | Sim |
| Qualcomm Snapdragon X2 Elite (CES, janeiro de 2026) | 80 TOPS | Sim |
Esta nova geração, apresentada na CES em janeiro de 2026 e já disponível em notebooks comercializados em 28 de setembro de 2026, eleva o número exibido muito acima do patamar mínimo do Copilot+: o Snapdragon X2 Elite quase dobra a pontuação do seu antecessor, com 80 TOPS contra 45 anteriormente. Nada disso muda a conclusão desta página: o argumento a seguir, sobre a largura de banda da memória compartilhada, aplica-se da mesma forma a esses novos chips, por mais impressionante que pareça o número de TOPS na etiqueta.
#Por que um NPU não acelera seus LLMs
Para produzir um único token, um modelo deve reler a maior parte de seus pesos na memória, do primeiro ao último parâmetro ativo. Um modelo de 14 bilhões de parâmetros em Q4 pesa cerca de 9 GB: gerar 20 tokens por segundo equivale, portanto, a transferir 180 GB por segundo entre a memória e as unidades de cálculo. O cálculo aritmético em si, a multiplicação propriamente dita, tem baixo custo em comparação com essa transferência contínua. A velocidade de geração acompanha, portanto, a largura de banda de memória disponível, e não a capacidade de cálculo em TOPS ou TFLOPS anunciada na ficha do produto, o que explica por que dois chips com valores de TOPS muito diferentes podem gerar texto exatamente à mesma velocidade.
| Onde está o modelo | Largura de banda | Limite para um modelo de 9 GB |
|---|---|---|
| LPDDR5X de notebook (o que é compartilhado entre NPU e GPU integrado) | ≈ 70 a 135 GB/s | ≈ 8 a 15 tok/s |
| Memória unificada do Ryzen AI Max+ 395 | 256 GB/s | ≈ 28 tok/s |
| RTX 4070 (GDDR6X) | 504 GB/s | ≈ 56 tok/s |
| RTX 5070 Ti (GDDR7) | 896 GB/s | ≈ 100 tok/s |
| RTX 5090 (GDDR7) | 1 792 GB/s | ≈ 200 tok/s |
Uma NPU de 50 TOPS, assim como uma NPU de 80 TOPS nos chips mais recentes, está na primeira linha da tabela. Ela acessa a mesma memória LPDDR5X compartilhada com o processador: independentemente do número de TOPS exibido, ela não pode fisicamente operar mais rápido do que essa memória permite. Um notebook com 45 TOPS e outro com 80 TOPS escreverão texto exatamente na mesma velocidade se ambos tiverem memória com a mesma capacidade e taxa de transferência.
Uma NPU pode realmente ajudar na leitura do prompt, uma fase que exige sobretudo capacidade de cálculo, mais do que largura de banda, pois o modelo processa todo o texto já presente de uma vez, em vez de produzi-lo palavra por palavra. Configurações híbridas que atribuem essa leitura à NPU e a geração à GPU integrada reduzem a espera até a primeira palavra exibida e o consumo total, em modelos pequenos com bom suporte. Isso proporciona maior autonomia e uma resposta percebida como mais ágil, com ganhos mensuráveis na latência, mas não permite rodar modelos maiores nem aumentar a velocidade de geração contínua de texto.
#O verdadeiro gargalo: o software
- Ollama, llama.cpp, LM Studio
- Eles rodam na GPU ou na CPU. Em um notebook Copilot+, usam a GPU integrada ou o processador e ignoram a NPU.
- Windows
- Os modelos embarcados da Microsoft e seu ambiente Foundry Local são voltados ao NPU via ONNX Runtime, com uma seleção de modelos pequenos.
- AMD
- Ryzen AI Software e o servidor Lemonade executam alguns modelos ONNX em modo híbrido, com NPU e GPU integrado.
- Intel
- O OpenVINO pode executar os modelos compatíveis na NPU.
- Qualcomm
- A cadeia de ferramentas QNN e AI Hub fornecem modelos já convertidos para o NPU Hexagon.
- Apple
- O Core ML utiliza o Neural Engine, mas as ferramentas de LLM realmente usadas no Mac (MLX, llama.cpp, Ollama) passam pelo GPU, via Metal.
O ponto em comum entre todas essas ferramentas: usar a NPU significa escolher entre uma lista curta de modelos já convertidos e validados pelo fabricante, geralmente com 1 a 8 bilhões de parâmetros, e não baixar qualquer GGUF encontrado no Hugging Face para executá-lo diretamente. Essa conversão exige um formato e uma cadeia de ferramentas diferentes para cada fabricante, o que explica por que nenhum projeto comunitário ainda unificou o suporte a NPUs como o llama.cpp fez para as GPUs.
- Ryzen AI 9 HX: o que o NPU realmente oferece com um LLM local
- Snapdragon X Elite: LLM local no PC ARM
#O que avaliar em vez disso antes de comprar
- 01A memória que o GPU pode usarA VRAM de uma placa dedicada, ou a memória unificada de um Mac ou de uma máquina Strix Halo. É ela que determina quais modelos podem ser carregados.
- 02A largura de banda dessa memóriaÉ ela que determina diretamente a quantidade de tokens gerados por segundo.
- 03O suporte de softwareNVIDIA sem nenhuma complicação, Apple Silicon quase tão bem, AMD com suporte adequado no Linux.
- 04Os TOPS da NPUÚteis se você quer os recursos Copilot+ do Windows e uma longa autonomia de bateria em videoconferências. Sem efeito sobre os LLMs de pesos abertos hoje.
- Hardware para IA local: nossas fichas de máquinas
- Mini-PC Ryzen AI Max+ 395: o caso em que a memória unificada muda o cenário
- Qual GPU para um LLM local?
- Microsoft: dispositivos Copilot+ e sua NPU
- Fonte: Wikipedia, história e arquitetura das NPUs
- Fonte: comunicado da AMD, Ryzen AI 400 (CES 2026)
#FAQ
O que significa NPU?+
Uma NPU é melhor que uma GPU para IA?+
Ollama ou LM Studio usam o NPU?+
É necessário um NPU para rodar uma IA localmente?+
Quantos TOPS são necessários?+
Os novos chips NPU de 2026 mudam algo para a IA local?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.