Iniciante 8 minOllama

Ollama Cloud: preços, avaliações e limitações (2026)

Ollama Cloud oferece algo simples: executar modelos grandes demais para a sua máquina nos servidores do Ollama — com 120B, 480B, 671B parâmetros — com a mesma CLI da versão local. Isso é prático. Mas isso muda duas coisas fundamentais: seus prompts saem do seu computador e você paga pelo uso. Este guia explica exatamente o que é, quanto custa e por que, na maioria dos casos, a hospedagem própria continua sendo preferível.

Por Mohamed Meguedmi·Atualização 2026-09-05·Testado no Windows, macOS e Linux
i
Em resumo
O Ollama Cloud executa nos servidores do Ollama modelos grandes demais para a sua máquina (120B, 480B, 671B), com a mesma CLI usada localmente. · A oferta fica entre um plano mensal com uma cota em horas e uma cobrança pelo tempo de inferência para uso intensivo — verifique os preços em ollama.com/cloud, pois eles mudam. · Diferentemente da execução local, seus prompts saem da sua máquina e passam por servidores majoritariamente localizados nos Estados Unidos. · Para uso recorrente ou dados sensíveis, a hospedagem própria continua sendo muito preferível.

#O que é Ollama Cloud

Desde 2025, o Ollama oferece uma opção paga chamada Ollama Cloud, que permite chamar modelos hospedados em sua infraestrutura de GPU, mantendo exatamente os mesmos comandos usados para um modelo local. A promessa: rodar modelos massivos com pesos abertos (centenas de bilhões de parâmetros) sem precisar de um Mac Studio Ultra ou de um cluster H100.

Na prática, você instala o Ollama como de costume, se autentica e baixa um modelo marcado como "cloud" (por exemplo, gpt-oss:120b-cloud). A inferência deixa de ocorrer na sua GPU e passa a ocorrer nos servidores do Ollama — sua máquina envia apenas os tokens do prompt e recebe os tokens de resposta.

Exemplo de chamada em nuvem (sintaxe geral)
# Authentification (une seule fois)
ollama signin

# Lancer un modèle hébergé
ollama run gpt-oss:120b-cloud
i
Não é uma "nuvem local"
Ollama Cloud não é um modo híbrido que executa parte do modelo em sua máquina. É apenas inferência remota: seus prompts saem pela internet, como com a API OpenAI ou Anthropic. A única coisa "local" é a CLI.

#Quais modelos rodam na nuvem

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

O catálogo na nuvem se concentra precisamente no que roda mal localmente. Ele evolui, mas a lógica continua a mesma: modelos com pesos abertos ou abertos, de tamanho muito grande, ou multimodais que exigem muita VRAM.

Modelos com 100 bilhões de parâmetros ou mais
Como gpt-oss:120b, qwen3-coder:480b, kimi-k2 — que exigem de 60 a 250 GB de VRAM em Q4, fora do alcance de uma estação de trabalho individual.
Modelos de fronteira MoE
DeepSeek V3/V4, Llama 4 Maverick: as versões completas, não as distilações 7B/32B que instalamos localmente.
Modelos especializados pesados
Modelos gigantes para programação, modelos de raciocínio ("thinking") com contexto longo, modelos de visão de alta resolução.

Os modelos "normais" (Mistral 7B, Llama 3.1 8B, Qwen 14B, Phi-4, etc.) continuam recomendados para uso local: cabem em uma RTX 3060 de 12 GB ou em um MacBook Air, e não há benefício em transferir sua execução para a nuvem.

#Preços e limites

O Ollama Cloud se posiciona entre uma assinatura mensal de preço fixo (com uma cota de requisições por hora) e um modelo de cobrança por uso para usos intensivos. Os preços exatos mudam — confira em ollama.com/cloud antes de se comprometer —, mas algumas constantes merecem ser destacadas.

Cotas por hora
Os planos básicos limitam o número de requisições por hora ou por dia. Esses limites são confortáveis para uma pessoa usando o chat, mas são atingidos rapidamente por um script que percorre 10.000 documentos.
Faturamento por duração de inferência
Modelos muito grandes às vezes são cobrados pelo tempo de GPU consumido. Uma requisição com contexto longo (32k tokens, raciocínio profundo) naturalmente custa mais do que um "olá".
Não há preço por token exibido por padrão
Diferentemente da OpenAI ou da Anthropic, no Ollama Cloud a API não cobra sistematicamente por token. Isso torna a previsão de custos menos precisa.
Sem SLA para o público geral
A oferta é recente e não há (no momento em que estas linhas são escritas) garantia de disponibilidade comparável às dos grandes provedores de nuvem.
!
A armadilha do 'quase grátis'
Uma cota gratuita ou um plano básico barato dá vontade de passar tudo pela nuvem. Mas, assim que você automatiza (processamento em lote, agente em loop, RAG sobre 100.000 chunks), a fatura sobe rapidamente e a latência de rede se soma a cada chamada.

#Confidencialidade: o que realmente muda

É aqui que a diferença em relação à hospedagem própria se torna estrutural, não anedótica. Quando você usa Ollama localmente, seus prompts nunca saem da porta 11434 no localhost — isso pode ser verificado no firewall. Na nuvem, eles transitam pela Internet e são processados em uma infraestrutura de terceiros.

Seus prompts saem do seu ambiente local
Todo dado enviado — trecho de contrato, código-fonte proprietário, prontuário de paciente, e-mail — sai da sua máquina. Para um escritório de advocacia, um médico, um departamento de RH ou um laboratório de pesquisa e desenvolvimento, isso é inaceitável.
Política de retenção
O Ollama afirma que não treina seus modelos com seus prompts. Mas a retenção para depuração, detecção de abuso ou logs varia conforme os planos. Leia os Termos de Uso antes de enviar dados sensíveis.
RGPD e hospedagem
Os servidores do Ollama Cloud estão majoritariamente nos Estados Unidos. Para dados pessoais europeus, isso levanta questões de transferência para fora da UE que a auto-hospedagem elimina de uma vez.
Não é possível auditar a infraestrutura
Localmente, você pode usar o tcpdump para monitorar a porta 11434 e comprovar que nenhum dado sai. Na nuvem, é preciso confiar no provedor: não há um meio técnico de verificar o que é registrado.
→
Teste do tcpdump
Para uma instalação auto-hospedada do Ollama, execute `sudo tcpdump -i any port 443` enquanto usa o modelo. Nenhum pacote de saída deve aparecer. Com Ollama Cloud, você verá tráfego para os servidores ollama.com. A prova de confidencialidade é binária e observável.

#Alternativas auto-hospedadas para cada modelo na nuvem

Para quase todos os modelos oferecidos na nuvem, existe uma alternativa local, seja equivalente (modelo menor da mesma família), seja aceitável (outro modelo com pesos abertos comparável). Veja as correspondências úteis.

gpt-oss:120b-cloud → llama3.1:8b ou qwen2.5:14b executados localmente
Para 90 % dos usos conversacionais, um 8B-14B Q4 em uma RTX 3060 de 12 GB é suficiente. A diferença é percebida principalmente em tarefas de raciocínio longo ou de conhecimento enciclopédico.
qwen3-coder:480b-cloud → qwen2.5-coder:14b ou 32b
O modelo de 32B em Q4 (≈19 GB de VRAM) funciona em uma RTX 4090 ou em um Mac M-Max. Para autocompletar código em um IDE, isso é mais do que suficiente — ver o guia sobre o Continue.dev.
deepseek-v3:671b-cloud → deepseek-r1:32b ou 70b destilado
As versões distiladas do DeepSeek R1 reproduzem 80-90 % do raciocínio do modelo completo em benchmarks comuns, localmente em uma 4090 ou em um Mac Studio.
Modelos de visão gigantes → qwen2.5-vl:7b ou llama3.2-vision:11b
Para OCR, etiquetagem de imagens e descrição, esses dois modelos rodam com 8 a 12 GB de VRAM. Veja o guia sobre LLMs multimodais de visão executados localmente.
Contexto longo 1M tokens → modelos 128k locais + chunking
Pouquíssimos usos reais exigem 1M de tokens de uma só vez. Um bom pipeline RAG com chunking + reranker processa grandes conjuntos de documentos com um modelo local de contexto de 32k.
i
A diferença de qualidade diminui a cada trimestre
Um modelo de 14B de 2026 supera um modelo de 70B de 2024 na maioria dos benchmarks. O raciocínio "preciso de um 400B" torna-se cada vez mais raro. Antes de pagar por um serviço na nuvem, teste de verdade se um modelo local de 14B não basta — você muitas vezes vai se surpreender.

#Tabela de decisão

Para decidir entre Ollama Cloud e auto-hospedagem, responda a estas cinco perguntas na ordem. A primeira que responder "auto-hospedagem" encerra a discussão.

1. As informações são sensíveis?
Código proprietário, dados de clientes, saúde, jurídico, RH, P&D → auto-hospedagem, ponto final.
2. Você está sujeito ao RGPD ou a uma regulamentação setorial?
Hospital, banco, setor público, dados europeus → hospedagem própria ou nuvem soberana dedicada (não Ollama Cloud).
3. O volume é previsível e alto?
Mais de alguns milhares de chamadas por dia → uma GPU de 1.500 € se amortiza em poucos meses em comparação com uma fatura variável de serviços na nuvem.
4. Você precisa trabalhar offline?
Local sem conexão confiável, demonstrações em campo, conformidade com requisitos de isolamento de rede (air-gap) → hospedagem própria obrigatória.
5. Você precisa mesmo de um modelo de 100B ou mais?
Se sim, e apenas se sim, e após testar um 32B local: Ollama Cloud passa a ser uma opção a considerar.
→
Regra prática
Se você tiver dúvidas, comece localmente com um modelo 14B Q4. Você perceberá rapidamente se suas limitações realmente impedem o seu uso — em 80% dos casos, não. A nuvem continua sendo a exceção, não a regra.

#Quando usar um, quando usar o outro

#Os poucos casos em que o Ollama Cloud é uma boa opção

Avaliação pontual de um modelo gigante
Você quer testar em 10 minutos se um modelo de programação de 480B vale a pena antes de investir em uma máquina — a nuvem evita a compra por impulso.
Demonstração para um cliente sem hardware no local
Um vendedor que mostra um POC no seu laptop sem levar um Mac Studio.
Tarefa única muito exigente
Um relatório de 500 páginas para resumir uma vez por trimestre, com contexto longo e sem nenhum dado confidencial nele.
Aprendizado e exploração
Descobrir o que um modelo de 670B sabe fazer, para depois voltar ao uso local sabendo o que buscar.

#Casos em que a hospedagem própria leva vantagem

Uso recorrente em qualquer situação
Assistente de programação no dia a dia, chat interno da equipe, RAG com documentos da empresa — a estabilidade da fatura conta.
Todo uso com dados sensíveis
Não há discussão: dados jurídicos, de saúde, de RH, de finanças, de P&D e código proprietário ficam na máquina local.
Qualquer uso automatizado
Pipelines em lote, agentes que executam em loop, n8n, scripts ETL: as cotas da nuvem são rapidamente excedidas, e os custos tornam-se imprevisíveis.
Qualquer uso offline ou edge
Raspberry Pi na oficina, notebook em deslocamento, local sem internet confiável.
Qualquer necessidade de personalização
Fine-tuning, Modelfile personalizado, prompts de sistema da equipe, integração profunda com suas ferramentas — a nuvem não permite isso.
!
A armadilha da dependência
Uma vez que uma equipe se acostuma a chamar um modelo específico na nuvem, deixar de usá-lo é doloroso: prompts calibrados, formatos de saída, comportamentos particulares. Investir em hospedagem própria desde o início evita essa dependência — e gera economia quando os preços sobem.

#Para se aprofundar

Se você concluir que a auto-hospedagem é o caminho certo para o seu caso (o que é provável), estes guias ajudam você a começar com o pé direito:

Escolher a GPU adequada
O guia Escolher sua GPU para IA local detalha os compromissos entre VRAM, orçamento e desempenho, da RTX 3060 de 12 GB ao Mac Studio Ultra.
Entender a quantização
O guia Escolher a quantização (Q4, Q5, Q8, FP16) explica como fazer um modelo 32B caber em uma GPU de 16 GB sem degradar a qualidade.
Confidencialidade operacional
O Checklist de privacidade lista as verificações concretas para garantir que nenhum pacote saia da sua máquina — uma comprovação baseada em fatos.
Perguntas frequentes sobre o Ollama Cloud
O Ollama Cloud é gratuito?+
Existe um plano gratuito, mas com limites de uso bastante restritos (poucos modelos simultâneos, cotas que se renovam por sessão e por semana). Para um uso mais intenso, Ollama oferece planos pagos por assinatura mensal, com acesso a mais modelos simultâneos e cotas maiores. Os preços exatos mudam: verifique sempre a página oficial ollama.com/pricing antes de se comprometer, em vez de confiar em um valor fixo.
Como usar o Ollama sem passar pela nuvem?+
Nada muda: a instalação local clássica do Ollama funciona exatamente como antes, sem conta nem assinatura. A nuvem é uma funcionalidade opcional ativada apenas quando você escolhe explicitamente um modelo marcado "cloud" e se autentica. Enquanto você usa modelos padrão (Llama, Mistral, Qwen, etc.), tudo funciona localmente, sem necessidade de conexão após o download do modelo.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.