Intermediário 21 minMini-PC

GB10 128 GB: quais LLMs realmente rodam (mesures)

Resposta direta

Em uma GIGABYTE AI TOP ATOM (NVIDIA GB10, 128 GB), os 13 modelos medidos, do 4B ao 235B, funcionam com 32 768 tokens de contexto e pelo menos 20 GB de margem. Os grandes modelos MoE, que ativam apenas parte dos seus parâmetros a cada token, são muito mais rápidos que um modelo denso do mesmo tamanho: gpt-oss 120B escreve 58 tokens por segundo. Um modelo denso de 70B escreve a 4,8 tokens por segundo: é a largura de banda da memória, e não o espaço, que determina a velocidade.

Cento e vinte e oito gigabytes de memória unificada: essa é a vantagem das máquinas GB10 em relação às placas de vídeo. Mas o que realmente pode ser carregado nelas, com que margem e a que velocidade? Medimos 13 modelos, do 4B ao 235B, em uma AI TOP ATOM fornecida gratuitamente pela GIGABYTE, com um protocolo definido antes da primeira medição. Veja o que cabe, o que é agradável no dia a dia e para quem essa é a compra certa.

Por Mohamed Meguedmi·Atualização 2026-10-08·Medido na GIGABYTE AI TOP ATOM
i
Transparência
Hardware fornecido gratuitamente pela GIGABYTE para esta série de guias. As medições e opiniões são nossas; a GIGABYTE não revisou nem validou este conteúdo antes da publicação. Esta página não contém nenhum link de afiliado. Nossos dados, infográficos e fotos podem ser reutilizados livremente sob a licença CC BY 4.0, com atribuição a QualLLM.
Os números principais
13modelos
de 4B a 235B, todos carregados com contexto de 32 768 tokens
58tok/s
escritos por gpt-oss 120B, um modelo de 117 bilhões de parâmetros
160,3tok/s
no total para 16 usuários simultâneos em gpt-oss 120B
20GB
de margem no mínimo para cada um dos 13 modelos, incluindo o contexto
A AI TOP ATOM da GIGABYTE vista em perspectiva pelo lado direito, apoiada horizontalmente: tampa cinza-escura e frente com ripas pretas.
O AI TOP ATOM da GIGABYTE: 1,2 kg e aproximadamente um litro para um chip NVIDIA GB10 e 128 GB de memória unificada. Foto da nossa unidade, com o fundo neutralizado. Ampliar ↗

#A máquina testada

Ficha da máquina testada: GIGABYTE AI TOP ATOM ATAGB10-9000, registrada em 2026-10-06: chip NVIDIA GB10 (Grace Blackwell), 20 núcleos Arm (10 X925 e 10 A725), 128 GB de memória LPDDR5x a 273 GB/s, SSD de 4 TB em PCIe 5.0 (32 GT/s, 4 linhas), rede 10 GbE e 2 portas QSFP (ConnectX-7, 200 Gb/s), formato de 150 × 150 mm, 1 litro e 1 200 g, fonte de alimentação de 240 W via USB-C, DGX OS 7.5.0
A configuração registrada por script em nossa unidade antes da primeira medição, complementada pela ficha da GIGABYTE quanto ao formato e às portas. A conexão PCIe 5.0 do SSD foi verificada (32 GT/s, 4 pistas). Cores: azul para o chip (GB10 e 20 núcleos Arm); verde para a memória (128 GB) e o armazenamento (SSD de 4 TB); cinza para a rede, o formato, a alimentação e o software. Ampliar ↗

A máquina é uma GIGABYTE AI TOP ATOM, referência ATAGB10-9000: chip NVIDIA GB10 (20 núcleos Arm e uma GPU Blackwell compartilhando 128 GB de memória anunciada a 273 GB/s), SSD de 4 TB em PCIe 5.0. Ela roda DGX OS 7.5.0, o sistema de NVIDIA baseado no Ubuntu (driver 580.159.03, CUDA 13.0).

Três softwares foram usados. O llama.cpp, um mecanismo open source muito difundido para executar modelos localmente, compilado no local para o chip GB10, fornece a tabela principal. Ollama 0.34.1 serve para a comparação com um MacBook Pro M5 Max medido com a mesma versão. O vLLM 26.09, um servidor projetado para responder a várias pessoas ao mesmo tempo, roda no contêiner fornecido por NVIDIA.

A caixa-preta do AI TOP ATOM em sua embalagem de transporte, apoiada por espuma, com as menções GIGABYTE AI TOP e Accelerated by NVIDIA.
A desembalagem: o AI TOP ATOM chega em sua caixa, apoiado por espuma. Nossa unidade foi recebida em 29 de setembro de 2026. Ampliar ↗

#Como medimos

As velocidades do llama.cpp vêm de cinco repetições, com um desvio padrão (a dispersão entre repetições) de no máximo 3%. Os tempos de carregamento, a leitura de um documento de 30 000 tokens e as margens de memória são medições únicas; os testes com vários usuários são repetidos três vezes. Antes da primeira medição, um teste de três minutos verificou se a GPU mantinha sua potência de cálculo.

Os arquivos dos 13 modelos têm uma impressão digital SHA-256 (uma assinatura digital do arquivo) idêntica à publicada pelo Hugging Face, o site que hospeda esses modelos. O protocolo, redigido em 5 de outubro, foi congelado no dia 6 às 13h30, antes da primeira medição.

Um adendo do mesmo dia, por volta das 16 h 50, antecipou para a noite a nova medição a frio e acrescentou os testes reproduzidos aqui: script oficial de Ollama, decodificação especulativa, carga contínua e Llama 3.3 70B em NVFP4. O método, as hashes dos arquivos e os dados das nossas tabelas estão publicados em nossa página de método.

Os números principais foram medidos novamente a frio na mesma noite, após 20 minutos de descanso e com o cache limpo: no máximo 2,6% de diferença, abaixo do limite de 3% do protocolo.

#A mesma velocidade de um DGX Spark, com diferença de alguns por cento

Até onde sabemos, as máquinas GB10 de 128 GB compartilham o mesmo chip NVIDIA e a mesma memória; a construção, o resfriamento e o armazenamento podem variar. Para situar o ATOM, refizemos dois benchmarks publicados para o DGX Spark de NVIDIA, com a mesma versão do software e as mesmas configurações.

Com o llama.cpp (build 7941, o da tabela publicada pelo projeto; nossa tabela principal usa o build 11430, mais recente), em seis modelos comuns, a leitura é idêntica com diferença de até 2,3%; a escrita é inferior em 2,8% na mediana e em 4,3% no máximo. Com o script oficial do Ollama (versão 0.12.6, a usada nas medições publicadas), nossas três medições ficam a até 2% de diferença, tanto na leitura quanto na escrita: gpt-oss 20B, gpt-oss 120B e Llama 3.1 70B.

Portanto, as velocidades deste guia devem valer, com uma diferença de alguns por cento, para as outras máquinas GB10 de 128 GB; medimos apenas a ATOM. Sua construção e seu comportamento sob carga (temperaturas, estabilidade por 1 h e 2 h) são detalhados no próximo guia da série, e seu consumo em um guia dedicado.

#13 modelos, de 4B a 235B: espaço ocupado e velocidade

→
Leitura, escrita, tokens e GB
A velocidade de leitura indica o ritmo em que a máquina absorve sua pergunta (o “prompt”) ou seu documento antes de responder; a velocidade de escrita indica o ritmo em que a resposta é exibida. A primeira importa para documentos longos, código e agentes; a segunda, para o conforto. Ambas são expressas em tokens por segundo (em francês, um token equivale a aproximadamente dois terços de uma palavra). As memórias são expressas em GB, como o Linux as exibe: 1 GB = 1 024 MB.

A tabela resume a campanha. “Memória ocupada” é a redução da memória disponível depois que o modelo é carregado com 32 768 tokens de contexto reservados. “Carregamento” é o tempo de carregamento a frio, com o cache do disco esvaziado. As velocidades vêm da ferramenta de medição llama-bench (llama.cpp, build 11430 de 5 de outubro de 2026), com o contexto vazio e depois com 32 768 tokens já presentes; as durações reais para um documento longo estão mais abaixo.

13 modelos medidos no AI TOP ATOM, 6 de outubro de 2026 (llama.cpp b11430, DGX OS 7.5.0, driver 580.159.03). Escrita e leitura em tokens por segundo.
ModeloTipoMemória ocupadaChargementEscrita (vazio → 32k)Leitura (vazio → 32k)Uso
Gemma 3 4B (Q4_0)dense4,6 GB3 s80,8 → 63,66 239 → 5 409muito fluido
Qwen2.5-Coder 7B (Q8_0)dense10,2 GB3 s30,0 → 23,33 746 → 2 138fluide
gpt-oss 20B (MXFP4)MoE, 3,6 bi ativos13,0 GB4 s81,4 → 62,54 950 → 3 316muito fluido
Qwen3.8 27B (Q4_K_XL)dense19,1 GB5 s11,8 → 10,6865 → 717correct
Qwen3.6 35B-A3B (Q4_K_XL)MoE, 3 bi ativos22,4 GB5 s66,0 → 55,62 987 → 2 429muito fluido
GLM-4.7-Flash (Q8_0)MoE, 3 bi ativos32,6 GB6 s51,4 → 35,52 392 → 608muito fluido
Qwen3-Coder 30B-A3B (Q8_0)MoE, 3,3 bi ativos34,3 GB6 s62,6 → 33,23 377 → 1 603muito fluido
Llama 3.3 70B (Q4_K_M)dense51,1 GB8 s4,8 → 3,9405 → 269ideal para processamento em lotes
gpt-oss 120B (MXFP4)MoE, 5,1 bi ativos61,7 GB10 s58,0 → 42,22 609 → 1 832muito fluido
Qwen3.5 122B-A10B (Q4_K_XL)MoE, 10 bi ativos74,5 GB12 s23,1 → 21,41 126 → 945fluide
Nemotron-3 Super 120B-A12B (Q4_K_XL)MoE, 12 bi ativos80,4 GB12 s16,9 → 16,5851 → 809correct
Qwen3.8-Flash-Next 125B (IQ4_XS)MoE, aproximadamente 6 bi ativos89,5 GB21 s27,3 → 25,21 073 → 917fluide
Qwen3-235B-A22B (Q2_K_XL)MoE, 22 bi ativos90,5 GB12 s17,7 → 11,8588 → 331correto; compressão forte (Q2)

Para ler a tabela: um modelo denso faz todos os seus parâmetros trabalharem a cada token; um modelo MoE (« mixture of experts »), apenas uma fração, indicada em bilhões (Md). A sigla entre parênteses designa a compressão dos pesos. Em nossos arquivos, Q8 ocupa 8,5 bits por parâmetro, os formatos Q4 e MXFP4, de 4,3 a 5,6 bits, e Q2_K_XL, 3 bits: é a compressão mais forte da tabela.

A coluna « Uso » aplica nossas referências à velocidade de escrita com contexto vazio: muito fluido acima de 40 tokens por segundo, fluido de 20 a 40, aceitável de 10 a 20. Abaixo disso, reservamos o modelo para processamento em lote.

Gráfico de barras da velocidade de escrita dos 13 modelos, com contexto vazio: de 81,4 tokens por segundo para gpt-oss 20B a 4,8 para Llama 3.3 70B; os modelos MoE em laranja, os modelos densos em azul
Velocidade de escrita em tokens por segundo, com o contexto vazio. Em laranja, com o pictograma de duas casas acesas: os modelos MoE, que ativam apenas parte de seus parâmetros para cada token. Em azul, com o pictograma cheio: os modelos densos. Com tamanho comparável, os MoE são muito mais rápidos. Ampliar ↗

Primeiro aprendizado: nada nesta tabela coloca a máquina em dificuldade; até o Qwen3-235B deixa 21 GB livres com 30 000 tokens de contexto. Segundo aprendizado, mais útil para escolher: o espaço quase nunca é um limite; é a escolha do modelo que determina a velocidade, de 4,8 a 81,4 tokens por segundo.

#O que determina a velocidade: os parâmetros ativos, não o tamanho

Para escrever cada token, o chip precisa reler na memória os pesos usados por esse token. Com 273 GB/s de largura de banda, a velocidade máxima é calculada de forma simples: 273 dividido pelo volume de pesos lidos a cada token. Um modelo denso lê todos os seus pesos todas as vezes; um modelo MoE lê apenas uma fração deles, os « especialistas » escolhidos para esse token.

É isso que explica o paradoxo da tabela. O arquivo de gpt-oss 120B pesa 59 GB, mas o modelo ativa apenas 5,1 bilhões de parâmetros por token: ele escreve a 58,0 tokens por segundo. O Qwen3.8 27B, cujo arquivo é mais de três vezes mais leve (16 GB), é um modelo denso: ativa seus 27 bilhões de parâmetros a cada token e escreve a 11,8 tokens por segundo. O modelo maior é quase cinco vezes mais rápido que o menor.

Velocidade de escrita medida em relação ao teto teórico (273 GB/s ÷ volume dos pesos ativos, ambos em unidades decimais: 1 GB = 1 bilhão de bytes), com o contexto vazio. Cálculo feito por nós, apenas como ordem de grandeza. Parâmetros ativos: fichas dos modelos para os MoE; número obtido pelo llama.cpp para os modelos densos. Percentuais calculados sobre os valores não arredondados.
ModeloParâmetros ativosLimite teóricaMedidoProporção do limite máximo
Qwen2.5-Coder 7B (denso)7,6 bi33,730,089 %
Llama 3.3 70B (denso)70,6 bi6,44,874 %
Qwen3.8 27B (denso)27,3 bi15,611,876 %
Qwen3-Coder 30B-A3B (MoE)3,3 bi77,862,681 %
gpt-oss 120B (MoE)5,1 bi98,758,059 %
Qwen3.6 35B-A3B (MoE)3 bi141,166,047 %

A tabela reúne seis modelos, aqueles cujo número de parâmetros ativos é publicado ou medido pelo llama.cpp. Os modelos densos chegam a 74 a 89% desse limite: a GB10 utiliza quase toda a sua memória.

Entre os treze modelos, os oito MoE fora o Qwen3.8-Flash-Next atingem de 47 a 81%, e seis deles ficam entre 52 e 62%; a escolha dos especialistas e os cálculos auxiliares provavelmente acrescentam um tempo fixo a cada token. O Qwen3.8-Flash-Next não entra nesse cálculo: ele conta com 51 bilhões de parâmetros de tabela de consulta além de seus 125 bilhões, o que torna a estimativa inadequada.

Em tamanho comparável, os MoE ainda são muito mais rápidos. Daí nossa principal recomendação: em uma máquina GB10, para um modelo grande, prefira um MoE. Um modelo denso pequeno como Gemma 3 4B também escreve muito rapidamente (80,8 tokens por segundo), mas é bem menor e serve para outros usos.

#Os modelos com mais de 100 bilhões de parâmetros

Essa é a razão de existir dos 128 GB. NVIDIA anuncia para a plataforma modelos de até 200 bilhões de parâmetros; nossas medições confirmam essa promessa, e um 235B comprimido a 3 bits cabe até mesmo com folga. Cinco modelos com mais de 100 bilhões de parâmetros cabem no ATOM, todos com pelo menos 20 GB de margem com 30.000 tokens de contexto.

gpt-oss 120B, o melhor equilíbrio entre velocidade e espaço
58,0 tokens por segundo, 61,7 GB ocupados com seu contexto, carregado em 10 segundos. A OpenAI o publica diretamente no formato MXFP4: ele cabe sem compressão adicional.
Qwen3.8-Flash-Next 125B, o mais rápido dos Qwen gigantes
27,3 tokens por segundo com aproximadamente 6 bilhões de parâmetros ativos, ocupando 89,5 GB em IQ4_XS. Sua versão Q4_K_XL, menos comprimida, também cabe, com uma margem estreita (veja mais abaixo).
Qwen3.5 122B-A10B
23,1 tokens por segundo, 74,5 GB; seus dez bilhões de parâmetros ativos o colocam atrás do gpt-oss.
Nemotron-3 Super 120B-A12B (NVIDIA)
16,9 tokens por segundo, 80,4 GB. Com doze bilhões de parâmetros ativos, ele escreve mais devagar que o gpt-oss, e é o modelo cuja escrita se mantém melhor à medida que o contexto aumenta: de 16,5 a 32 768 tokens, cerca de 3% a menos.
Qwen3-235B-A22B, à parte
Ele cabe em Q2_K_XL, a compressão mais forte da tabela (3 bits por parâmetro, em média): 17,7 tokens por segundo, 90,5 GB. Uma compressão tão forte geralmente reduz a qualidade das respostas; nós não a medimos.

#Onde a memória termina: cerca de 100 a 105 GB de pesos

O sistema detecta 121,7 GB de memória: parte dos 128 fica reservada desde a inicialização. Depois que a máquina foi iniciada, sem nada mais na memória, restavam de 108 a 113 GB disponíveis, conforme o momento. Para encontrar o limite, carregamos duas versões mais pesadas dos maiores modelos, com o mesmo contexto de 32.768 tokens e uma proteção que interrompe o carregamento se a memória livre cair abaixo de 3 GB.

As duas cargas mais pesadas, ambas concluídas com sucesso, 6 de outubro de 2026 (llama-server b11430, contexto de 32 768 tokens). Margem: memória ainda disponível depois de ler um documento de 30 000 tokens. “Apenas”: margem de 5 a 15 GB.
ModeloArquivoMemória ocupadaEspaço restanteEscrita (após 4 000 → 30 000 tokens lidos)Place
Qwen3.8-Flash-Next 125B (Q4_K_XL)103,7 GB107,0 GB6,0 GB24,9 → 21,9 tok/sapenas
Qwen3-235B-A22B (Q3_K_XL, 3,5 bits)97,0 GB104,7 GB8,2 GB13,9 → 10,4 tok/sapenas

Nenhum modelo falhou ao carregar, mas estes dois deixam uma margem estreita: quase não sobra espaço para um segundo modelo, um contexto muito mais longo ou um aplicativo exigente ao lado. Portanto, o limite prático fica em torno de 100 a 105 GB de pesos. Isso exclui, por exemplo, os pesos NVFP4 (um formato compactado de NVIDIA) do Qwen3.8-Flash-Next: cerca de 135 GB segundo o blog Kubesimplify (27 de agosto de 2026), que esclarece que, nesse caso, são necessárias duas máquinas.

A mesma publicação já mostrava o modelo em uma única máquina no formato GGUF (o formato do llama.cpp), mas naquela época só existia a versão mais comprimida. No ATOM, as versões IQ4_XS e Q4_K_XL funcionam, com 21 e 6 GB de margem.

→
O tamanho adequado para um uso confortável
Procure ficar em no máximo cerca de 90 GB com o seu contexto: assim restam cerca de vinte GB para o sistema, um segundo modelo pequeno ou um contexto mais longo. Nossos treze modelos respeitam esse parâmetro.

#O preço do contexto longo

Um documento longo, uma base de código ou uma conversa que se estende: cada token já presente no contexto torna o restante mais lento. Com 32.768 tokens na memória, a velocidade de escrita cai de 3 a 47%, dependendo do modelo. Também medimos o tempo real para ler de uma só vez um documento de 30.000 tokens, cerca de cinquenta páginas.

Tempo para ler de uma vez um documento de 30 000 tokens (llama-server b11430, 6 de outubro de 2026), seguido da velocidade de escrita da resposta.
ModeloLeitura de 30 000 tokensEscrita em seguida
Gemma 3 4B4,7 s60,8 tok/s
gpt-oss 20B8,1 s61,6 tok/s
Qwen2.5-Coder 7B12,7 s23,3 tok/s
Qwen3.6 35B-A3B14,2 s54,4 tok/s
Qwen3-Coder 30B-A3B17,4 s33,3 tok/s
gpt-oss 120B21,8 s42,8 tok/s
GLM-4.7-Flash32,7 s35,6 tok/s
Qwen3.8 27B39,4 s10,6 tok/s
Qwen3.8-Flash-Next 125B42,9 s23,0 tok/s
Qwen3.5 122B-A10B43,6 s21,2 tok/s
Nemotron-3 Super 120B-A12B55,4 s16,2 tok/s
Qwen3-235B-A22B1 min 33 s12,1 tok/s
Llama 3.3 70B1 min 44 s4,0 tok/s

Para a maioria dos modelos, esses tempos são mais longos do que sugere a coluna « Leitura » da primeira tabela. O motivo provável: llama-server, o servidor usado na prática, processa por padrão o texto em lotes de 512 tokens, contra 2 048 em nossa configuração do llama-bench.

Curvas da velocidade de escrita conforme o contexto já presente, de 0 a 32 768 tokens: uma cor por modelo: gpt-oss 120B de 58,0 a 42,2, Qwen3.6 35B-A3B de 66,0 a 55,6, Qwen3-Coder 30B-A3B de 62,6 a 33,2, Nemotron-3 Super 120B de 16,9 a 16,5, Qwen3.8 27B de 11,8 a 10,6, Llama 3.3 70B de 4,8 a 3,9
Velocidade de escrita em tokens por segundo conforme o contexto já presente, de 0 a 32 768 tokens (eixo horizontal em milhares de tokens). Uma cor por modelo, cujo nome está escrito à direita de cada curva; o pictograma de documento, com « → 32 768 », lembra o contexto máximo medido. Nemotron (−3%) e Qwen3.8 27B (−10%) mantêm quase toda a sua velocidade; com 32 768 tokens na memória, gpt-oss 120B ainda escreve 42 tokens por segundo e o Qwen3.6 35B-A3B, cerca de 56. Ampliar ↗

A leitura é um ponto forte da GB10: em comparação com o Mac analisado mais abaixo, ela lê gpt-oss 120B 31% mais rápido. Se você enviar um relatório de cerca de cinquenta páginas, a resposta começa 22 segundos depois com gpt-oss 120B, e 1 min 44 s depois com um 70B denso. Para análise de documentos e agentes de código, esse critério pesa muito.

#Até 16 usuários ao mesmo tempo: o que a máquina aguenta

Com o vLLM, simulamos 1, 8 e depois 16 usuários simultâneos. Cada um envia uma solicitação de 1 024 tokens e recebe uma resposta de 512 tokens; cada ponto é medido três vezes com solicitações diferentes, e publicamos a mediana.

Vários usuários simultâneos, vLLM 26.09 (contêiner NVIDIA), 6 de outubro de 2026. “Por pessoa”: velocidade de escrita depois que a resposta começa. “Total”: tokens escritos por segundo para todos os usuários, incluindo a espera pela primeira palavra. “Casos mais lentos”: percentil 99, o tempo abaixo do qual terminam 99 de 100 solicitações, calculado com 4 a 64 solicitações por série, portanto próximo do máximo observado.
ModeloUsuáriosTotalPor pessoaPrimeira palavra (média)Primeira palavra (casos mais lentos)
gpt-oss 120B135,6 tok/s36,4 tok/s0,34 s0,35 s
gpt-oss 120B8113,9 tok/s14,5 tok/s0,97 s1,62 s
gpt-oss 120B16160,3 tok/s10,2 tok/s1,07 s3,71 s
gpt-oss 20B149,1 tok/s50,0 tok/s0,16 s0,16 s
gpt-oss 20B8205,9 tok/s26,5 tok/s0,49 s0,81 s
gpt-oss 20B16322,4 tok/s20,7 tok/s0,52 s1,73 s
Curvas da vazão total e da vazão por pessoa para 1, 8 e 16 usuários simultâneos: gpt-oss 120B passa de 35,6 a 160,3 tokens por segundo no total, 10,2 por pessoa com 16; gpt-oss 20B passa de 49,1 a 322,4 no total, 20,7 por pessoa com 16
Taxa de tokens por segundo para 1, 8 e 16 usuários simultâneos (vLLM). Roxo: gpt-oss 20B; laranja: gpt-oss 120B. Sob o eixo horizontal, uma silhueta representa um usuário, e um grupo representa vários usuários. Linhas contínuas, pictograma de grupo: taxa total. Pontilhado, pictograma de pessoa: velocidade vista por cada pessoa. Com 16 usuários, gpt-oss 20B ultrapassa 320 tokens por segundo no total. Ampliar ↗

Entre 1 e 16 usuários, a vazão total é multiplicada por 4,5 com gpt-oss 120B e por 6,6 com gpt-oss 20B: quando várias solicitações compartilham a leitura dos mesmos pesos, o chip aproveita plenamente seu poder de computação.

Com 16 pessoas, cada uma ainda vê sua resposta sendo escrita a 10 tokens por segundo com gpt-oss 120B, e a 21 com gpt-oss 20B. Com o modelo de 120 bilhões, a primeira palavra chega em pouco mais de um segundo, em média, e em quase 4 segundos nos casos mais lentos.

Para uma pessoa sozinha, porém, o vLLM não é o mais rápido: sem nenhuma configuração específica de desempenho, ele escreve a 36,4 tokens por segundo em gpt-oss 120B, contra 54,4 do llama.cpp em respostas longas. Seus logs mostram que ele escolhe, na GB10, o kernel de computação Marlin para o formato MXFP4, o que provavelmente explica a diferença. O vLLM faz sentido assim que várias pessoas ou vários agentes compartilham a máquina.

#Sozinho diante da máquina: Ollama ou llama.cpp?

Ollama é a maneira mais simples de começar e funciona na GB10 sem ajustes. No gpt-oss, porém, não é o mais rápido. Em respostas longas, a versão 0.34.1 escreve a 42,3 tokens por segundo em gpt-oss 120B, contra 54,4 do llama.cpp no mesmo formato MXFP4, ou seja, 22% menos. Em gpt-oss 20B: 58,8 contra 78,8, ou seja, 25% menos.

Nos modelos Qwen, ocorre o inverso. No Qwen3.8 27B, Ollama escreve entre 22,9 e 30,5 tokens por segundo, dependendo do trecho, contra 11,8 do llama.cpp configurado com os valores padrão; no Qwen3.6 35B-A3B, entre 90,5 e 94,9, contra 66,0. O motivo provável: Ollama ativa por padrão uma decodificação especulativa, que propõe vários tokens antecipadamente e que o modelo valida de uma vez (a configuração draft_num_predict aparece na configuração desses modelos).

Nosso teste aponta nessa direção. No llama-server (seis textos de 400 tokens, prosa e código), a decodificação especulativa do llama.cpp (MTP, que prevê vários tokens de uma vez) faz o Qwen3.8 27B passar de 11,7 para 21,5 tokens por segundo em prosa, e de 11,6 para 27,2 em código.

→
Ollama abre contextos longos por padrão
Sem nenhum ajuste de nossa parte, Ollama 0.34.1 abriu contextos de 131 072 tokens para gpt-oss e de 262 144 para Qwen e Gemma, embora sua documentação indique 4 096 por padrão. A memória anunciada por ele continua próxima das nossas medições. Para manter espaço para um segundo modelo, reduza o contexto com a variável OLLAMA_CONTEXT_LENGTH.

Na prática: Ollama para começar e para os modelos Qwen, que ele acelera por padrão; llama.cpp para extrair o máximo do gpt-oss ou do Qwen3.8 ativando sua decodificação especulativa. A melhor escolha depende mais das configurações do que da máquina.

#Diante do MacBook Pro M5 Max de 128 GB

Um leitor mediu seu MacBook Pro M5 Max de 128 GB (GPU de 40 núcleos) em 16 de setembro com Ollama 0.34.1, em uma única passagem por modelo; suas medições estão publicadas em nosso guia dedicado. Repetimos as mesmas séries no ATOM, em duas passagens: mesma versão de Ollama, mesmos modelos, mesmo prompt.

Mesma versão do Ollama (0.34.1), mesmos modelos, mesmo prompt. Escrita em tokens por segundo; leitura de um documento de cerca de 17 000 tokens para a última linha. Mac: uma passagem, medida por um leitor em 16 de setembro de 2026. ATOM: duas passagens, em 6 de outubro de 2026.
MediçãoATOM, 1ª passagemATOM, 2ª passagemMacBook Pro M5 MaxDiferença
Escrita, gemma4:12b45,954,158,1Mac +7 a +27 %
Escrita, qwen3.8:27b30,522,936,6Mac +20 a +59 %
Escrita, gpt-oss:20b58,158,8113,4Mac +93 a +95 %
Escrita, gpt-oss:120b42,242,379,1Mac +87 %
Leitura, gpt-oss:120b1 816—1 388ATOM +31%

O Mac escreve mais rápido nos quatro modelos, quase duas vezes mais rápido nos dois gpt-oss, cujas passagens são concordantes: seu chip dispõe de 614 GB/s de largura de banda, mais que o dobro da GB10. Em gemma4 e qwen3.8, a diferença varia de uma passagem para outra; a decodificação especulativa, cujo ganho depende do texto gerado, é uma possível explicação.

O ATOM lê mais rápido, provavelmente graças ao poder de processamento de sua GPU, em textos semelhantes, mas não idênticos (16.850 e 16.689 tokens). Com llama.cpp, a diferença de escrita diminui: 54,4 tokens por segundo no gpt-oss 120B, contra 79,1 no Mac com Ollama.

#Para quem o ATOM é a escolha certa

O que segue vem de nossas medições no ATOM.

O ATOM é a escolha certa se você quer modelos grandes em casa
Cinco modelos com mais de 100 bilhões de parâmetros cabem com folga. Até onde sabemos, nenhuma placa de vídeo para o consumidor se aproxima desses 128 GB.
… se você trabalhar com documentos longos ou código
30.000 tokens lidos em 22 segundos com gpt-oss 120B.
… se várias pessoas ou agentes a compartilharem
160 tokens por segundo no total para 16 usuários no gpt-oss 120B.
… se você quer o ecossistema NVIDIA
CUDA 13, vLLM no contêiner de NVIDIA e llama.cpp compilado para o chip GB10 funcionaram conosco no DGX OS 7.5.0.
Se você está sozinho e prioriza a velocidade de escrita
Compare com o MacBook Pro M5 Max: graças aos seus 614 GB/s, ele escreve mais rápido no gpt-oss, enquanto o ATOM lê um documento longo 31% mais rápido no gpt-oss 120B. Compare também os preços.
Se seus modelos permanecerem abaixo de 35 GB
A versão de 64 GB do ATOM, anunciada para 23 de outubro de 2026, deve ser suficiente (cálculo baseado em nossas medições, não medido nessa versão).

#64 ou 128 GB?

Em 2 de outubro de 2026, NVIDIA anunciou DGX Spark de 64 GB para modelos de até 100 bilhões de parâmetros, disponíveis em 23 de outubro na Acer, ASUS, Dell, GIGABYTE, HP e MSI, a partir de 4 999 dólares. A GIGABYTE confirmou em 5 de outubro uma AI TOP ATOM de 64 GB com o mesmo design. Nós não a medimos.

Nossas medições permitem fazer um cálculo. Os modelos até Qwen3-Coder 30B-A3B ocupam menos de 35 GB com 32 768 tokens de contexto e caberiam; o Llama 3.3 70B (51 GB) ficaria no limite. gpt-oss 120B (62 GB) e os modelos maiores não caberiam. Com a mesma largura de banda, algo que será preciso verificar, as velocidades devem ser próximas.

Para um modelo com mais de 100 bilhões de parâmetros em uma única máquina, a versão de 128 GB é indispensável. Segundo NVIDIA, duas máquinas de 64 GB conectadas também combinam sua memória; não testamos isso.

#Os preços registrados

Em 8 de outubro de 2026, a versão de 4 TB em PCIe 4.0 (ATAGB10-9001, mesmo chip GB10 e os mesmos 128 GB) era exibida por 6 346,27 € com impostos incluídos na loja oficial da AORUS, esgotada; estava em estoque na Amazon.fr, vendida pela Amazon UK (uma unidade). A versão testada, de 4 TB em PCIe 5.0 (ATAGB10-9000), custava 7 999,95 € na LDLC e na Materiel.net, esgotada.

Os preços e os estoques dessas máquinas mudam rapidamente: verifique-os antes de comprar.

#Nosso julgamento

O ATOM é uma excelente escolha para executar em casa um modelo de 120 bilhões de parâmetros, compartilhá-lo com uma equipe ou ler rapidamente documentos longos. Ele nos proporcionou o desempenho de referência da plataforma, sem limitação térmica registrada em nossas medições, inclusive durante uma hora de carga contínua com 16 usuários. Se o orçamento for importante, sua versão PCIe 4.0 mantém o mesmo chip e a mesma memória.

#O que não medimos

A qualidade das respostas
Este guia mede o que cabe e em que velocidade, não o valor de cada modelo.
As temperaturas, o ruído e o consumo
O próximo guia da série detalha as temperaturas sob carga prolongada; o consumo tem seu próprio guia, medido no chip (somente a GPU). Quanto ao ruído, citamos as medições da Hardware & Co.
Contextos além de 32 768 tokens
Vários modelos aceitam contextos bem mais longos; este guia para em 32 768 tokens, e o tutorial de 70B da série chega a 131 072 tokens para Llama 3.3 70B e gpt-oss 120B.
As outras máquinas GB10 e a versão de 64 GB
Nossos números coincidem com os publicados para o DGX Spark da NVIDIA, mas medimos apenas o ATOM 128 GB.

Atualizações e correções: esta página será revisada se uma nova versão do DGX OS, do llama.cpp ou de Ollama alterar estes resultados; cada correção será datada.

#FAQ

FAQ
Qual é o maior modelo que podemos executar em uma máquina GB10 de 128 GB?+
Em nosso AI TOP ATOM, o maior modelo testado é o Qwen3-235B-A22B: 90,5 GB ocupados em Q2_K_XL (3 bits por parâmetro) e 21 GB de margem com 30.000 tokens de contexto. A versão Q3_K_XL também cabe, com 8 GB de margem. Não medimos a qualidade das respostas: com 3 bits, um modelo se afasta mais de sua versão original do que com 4 ou 5 bits, mas isso não indica qual responde melhor.
Um modelo 70B pode ser usado no dia a dia em uma GB10?+
Ele cabe sem dificuldade (51 GB ocupados) e gera 4,8 tokens por segundo; lê 30.000 tokens em 1 min 44 s. É ideal para processamento em lote: na versão NVFP4 sob vLLM, oito solicitações simultâneas totalizam 37,7 tokens por segundo, e cada resposta, depois de começar, é gerada a 5,0 tokens por segundo. Um pequeno modelo de rascunho o leva a 12 tokens por segundo (veja nosso tutorial de 70B). Em conversas, gpt-oss 120B é muito mais agradável.
As velocidades deste guia valem para um DGX Spark de NVIDIA ou de outra marca?+
Muito provavelmente, com uma margem de alguns por cento, mas medimos apenas o ATOM. Até onde sabemos, as máquinas GB10 de 128 GB compartilham o mesmo chip e a mesma memória. Ao reproduzir duas referências publicadas para o DGX Spark, com llama.cpp e com Ollama, nossas velocidades de leitura diferem em até 2,3% e nossas velocidades de escrita são no máximo 4,3% inferiores.
É melhor escolher a versão de 64 GB ou de 128 GB?+
Se seus modelos ocuparem menos de 35 GB com o contexto, como gpt-oss 20B ou Qwen3.6 35B-A3B em nossas medições, a versão de 64 GB deverá ser suficiente; é um cálculo, nós não a medimos. Para um modelo com mais de 100 bilhões de parâmetros em uma única máquina, como gpt-oss 120B (62 GB), a versão de 128 GB é necessária.
Ollama é a melhor escolha em uma máquina GB10?+
Para começar, sim: ele funciona sem ajustes. No gpt-oss 120B, porém, o llama.cpp escreve mais rápido (54,4 contra 42,3 tokens por segundo em respostas longas). Nos modelos Qwen, Ollama vence com suas configurações padrão, provavelmente graças à decodificação especulativa que ativa; o llama.cpp se aproxima dele quando ativamos a sua. Portanto, a melhor escolha depende principalmente das configurações.
Na mesma série
A máquinaA ficha do GIGABYTE AI TOP ATOM
Guide 2 · em breveAI TOP ATOM vs DGX Spark
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.