Ollama Cloud: preços, avaliações e limitações (2026)
Ollama Cloud oferece algo simples: executar modelos grandes demais para a sua máquina nos servidores do Ollama — com 120B, 480B, 671B parâmetros — com a mesma CLI da versão local. Isso é prático. Mas isso muda duas coisas fundamentais: seus prompts saem do seu computador e você paga pelo uso. Este guia explica exatamente o que é, quanto custa e por que, na maioria dos casos, a hospedagem própria continua sendo preferível.
#O que é Ollama Cloud
Desde 2025, o Ollama oferece uma opção paga chamada Ollama Cloud, que permite chamar modelos hospedados em sua infraestrutura de GPU, mantendo exatamente os mesmos comandos usados para um modelo local. A promessa: rodar modelos massivos com pesos abertos (centenas de bilhões de parâmetros) sem precisar de um Mac Studio Ultra ou de um cluster H100.
Na prática, você instala o Ollama como de costume, se autentica e baixa um modelo marcado como "cloud" (por exemplo, gpt-oss:120b-cloud). A inferência deixa de ocorrer na sua GPU e passa a ocorrer nos servidores do Ollama — sua máquina envia apenas os tokens do prompt e recebe os tokens de resposta.
#Quais modelos rodam na nuvem
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
O catálogo na nuvem se concentra precisamente no que roda mal localmente. Ele evolui, mas a lógica continua a mesma: modelos com pesos abertos ou abertos, de tamanho muito grande, ou multimodais que exigem muita VRAM.
- Modelos com 100 bilhões de parâmetros ou mais
- Como gpt-oss:120b, qwen3-coder:480b, kimi-k2 — que exigem de 60 a 250 GB de VRAM em Q4, fora do alcance de uma estação de trabalho individual.
- Modelos de fronteira MoE
- DeepSeek V3/V4, Llama 4 Maverick: as versões completas, não as distilações 7B/32B que instalamos localmente.
- Modelos especializados pesados
- Modelos gigantes para programação, modelos de raciocínio ("thinking") com contexto longo, modelos de visão de alta resolução.
Os modelos "normais" (Mistral 7B, Llama 3.1 8B, Qwen 14B, Phi-4, etc.) continuam recomendados para uso local: cabem em uma RTX 3060 de 12 GB ou em um MacBook Air, e não há benefício em transferir sua execução para a nuvem.
#Preços e limites
O Ollama Cloud se posiciona entre uma assinatura mensal de preço fixo (com uma cota de requisições por hora) e um modelo de cobrança por uso para usos intensivos. Os preços exatos mudam — confira em ollama.com/cloud antes de se comprometer —, mas algumas constantes merecem ser destacadas.
- Cotas por hora
- Os planos básicos limitam o número de requisições por hora ou por dia. Esses limites são confortáveis para uma pessoa usando o chat, mas são atingidos rapidamente por um script que percorre 10.000 documentos.
- Faturamento por duração de inferência
- Modelos muito grandes às vezes são cobrados pelo tempo de GPU consumido. Uma requisição com contexto longo (32k tokens, raciocínio profundo) naturalmente custa mais do que um "olá".
- Não há preço por token exibido por padrão
- Diferentemente da OpenAI ou da Anthropic, no Ollama Cloud a API não cobra sistematicamente por token. Isso torna a previsão de custos menos precisa.
- Sem SLA para o público geral
- A oferta é recente e não há (no momento em que estas linhas são escritas) garantia de disponibilidade comparável às dos grandes provedores de nuvem.
#Confidencialidade: o que realmente muda
É aqui que a diferença em relação à hospedagem própria se torna estrutural, não anedótica. Quando você usa Ollama localmente, seus prompts nunca saem da porta 11434 no localhost — isso pode ser verificado no firewall. Na nuvem, eles transitam pela Internet e são processados em uma infraestrutura de terceiros.
- Seus prompts saem do seu ambiente local
- Todo dado enviado — trecho de contrato, código-fonte proprietário, prontuário de paciente, e-mail — sai da sua máquina. Para um escritório de advocacia, um médico, um departamento de RH ou um laboratório de pesquisa e desenvolvimento, isso é inaceitável.
- Política de retenção
- O Ollama afirma que não treina seus modelos com seus prompts. Mas a retenção para depuração, detecção de abuso ou logs varia conforme os planos. Leia os Termos de Uso antes de enviar dados sensíveis.
- RGPD e hospedagem
- Os servidores do Ollama Cloud estão majoritariamente nos Estados Unidos. Para dados pessoais europeus, isso levanta questões de transferência para fora da UE que a auto-hospedagem elimina de uma vez.
- Não é possível auditar a infraestrutura
- Localmente, você pode usar o tcpdump para monitorar a porta 11434 e comprovar que nenhum dado sai. Na nuvem, é preciso confiar no provedor: não há um meio técnico de verificar o que é registrado.
#Alternativas auto-hospedadas para cada modelo na nuvem
Para quase todos os modelos oferecidos na nuvem, existe uma alternativa local, seja equivalente (modelo menor da mesma família), seja aceitável (outro modelo com pesos abertos comparável). Veja as correspondências úteis.
- gpt-oss:120b-cloud → llama3.1:8b ou qwen2.5:14b executados localmente
- Para 90 % dos usos conversacionais, um 8B-14B Q4 em uma RTX 3060 de 12 GB é suficiente. A diferença é percebida principalmente em tarefas de raciocínio longo ou de conhecimento enciclopédico.
- qwen3-coder:480b-cloud → qwen2.5-coder:14b ou 32b
- O modelo de 32B em Q4 (≈19 GB de VRAM) funciona em uma RTX 4090 ou em um Mac M-Max. Para autocompletar código em um IDE, isso é mais do que suficiente — ver o guia sobre o Continue.dev.
- deepseek-v3:671b-cloud → deepseek-r1:32b ou 70b destilado
- As versões distiladas do DeepSeek R1 reproduzem 80-90 % do raciocínio do modelo completo em benchmarks comuns, localmente em uma 4090 ou em um Mac Studio.
- Modelos de visão gigantes → qwen2.5-vl:7b ou llama3.2-vision:11b
- Para OCR, etiquetagem de imagens e descrição, esses dois modelos rodam com 8 a 12 GB de VRAM. Veja o guia sobre LLMs multimodais de visão executados localmente.
- Contexto longo 1M tokens → modelos 128k locais + chunking
- Pouquíssimos usos reais exigem 1M de tokens de uma só vez. Um bom pipeline RAG com chunking + reranker processa grandes conjuntos de documentos com um modelo local de contexto de 32k.
#Tabela de decisão
Para decidir entre Ollama Cloud e auto-hospedagem, responda a estas cinco perguntas na ordem. A primeira que responder "auto-hospedagem" encerra a discussão.
- 1. As informações são sensíveis?
- Código proprietário, dados de clientes, saúde, jurídico, RH, P&D → auto-hospedagem, ponto final.
- 2. Você está sujeito ao RGPD ou a uma regulamentação setorial?
- Hospital, banco, setor público, dados europeus → hospedagem própria ou nuvem soberana dedicada (não Ollama Cloud).
- 3. O volume é previsível e alto?
- Mais de alguns milhares de chamadas por dia → uma GPU de 1.500 € se amortiza em poucos meses em comparação com uma fatura variável de serviços na nuvem.
- 4. Você precisa trabalhar offline?
- Local sem conexão confiável, demonstrações em campo, conformidade com requisitos de isolamento de rede (air-gap) → hospedagem própria obrigatória.
- 5. Você precisa mesmo de um modelo de 100B ou mais?
- Se sim, e apenas se sim, e após testar um 32B local: Ollama Cloud passa a ser uma opção a considerar.
#Quando usar um, quando usar o outro
#Os poucos casos em que o Ollama Cloud é uma boa opção
- Avaliação pontual de um modelo gigante
- Você quer testar em 10 minutos se um modelo de programação de 480B vale a pena antes de investir em uma máquina — a nuvem evita a compra por impulso.
- Demonstração para um cliente sem hardware no local
- Um vendedor que mostra um POC no seu laptop sem levar um Mac Studio.
- Tarefa única muito exigente
- Um relatório de 500 páginas para resumir uma vez por trimestre, com contexto longo e sem nenhum dado confidencial nele.
- Aprendizado e exploração
- Descobrir o que um modelo de 670B sabe fazer, para depois voltar ao uso local sabendo o que buscar.
#Casos em que a hospedagem própria leva vantagem
- Uso recorrente em qualquer situação
- Assistente de programação no dia a dia, chat interno da equipe, RAG com documentos da empresa — a estabilidade da fatura conta.
- Todo uso com dados sensíveis
- Não há discussão: dados jurídicos, de saúde, de RH, de finanças, de P&D e código proprietário ficam na máquina local.
- Qualquer uso automatizado
- Pipelines em lote, agentes que executam em loop, n8n, scripts ETL: as cotas da nuvem são rapidamente excedidas, e os custos tornam-se imprevisíveis.
- Qualquer uso offline ou edge
- Raspberry Pi na oficina, notebook em deslocamento, local sem internet confiável.
- Qualquer necessidade de personalização
- Fine-tuning, Modelfile personalizado, prompts de sistema da equipe, integração profunda com suas ferramentas — a nuvem não permite isso.
#Para se aprofundar
Se você concluir que a auto-hospedagem é o caminho certo para o seu caso (o que é provável), estes guias ajudam você a começar com o pé direito:
- Escolher a GPU adequada
- O guia Escolher sua GPU para IA local detalha os compromissos entre VRAM, orçamento e desempenho, da RTX 3060 de 12 GB ao Mac Studio Ultra.
- Entender a quantização
- O guia Escolher a quantização (Q4, Q5, Q8, FP16) explica como fazer um modelo 32B caber em uma GPU de 16 GB sem degradar a qualidade.
- Confidencialidade operacional
- O Checklist de privacidade lista as verificações concretas para garantir que nenhum pacote saia da sua máquina — uma comprovação baseada em fatos.
O Ollama Cloud é gratuito?+
Como usar o Ollama sem passar pela nuvem?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.