Intermediário 11 minImagem

Gerar imagens localmente: Ollama, Stable Difusão

A busca por "ollama image generation" é recorrente, e a resposta cabe em uma frase: Ollama não gera imagens, ele disponibiliza modelos de texto e de visão para uso. Mas gerar imagens localmente, sem nuvem nem assinatura, é totalmente possível — com outras ferramentas. Este guia apresenta um panorama verificado do que Ollama consegue e não consegue fazer e, em seguida, lista as opções reais (Stable Diffusion, ComfyUI, Draw Things no Mac), a VRAM realmente necessária, a instalação mais simples de acordo com seu sistema e o que esperar em termos de qualidade em comparação com Midjourney ou DALL-E.

Por Mohamed Meguedmi·Atualização 2026-09-08·Testado no Windows, macOS e Linux

#Ollama e a imagem: o que ele sabe e o que não sabe fazer

Vamos começar esclarecendo a confusão mais comum por trás da busca « ollama image generation ». Ollama é um runtime para grandes modelos de linguagem: ele baixa e executa modelos no formato GGUF, expõe uma API compatível com a OpenAI em http://localhost:11434 e gerencia o carregamento e descarregamento na memória. Seu domínio é o texto — e, desde a chegada dos modelos multimodais, a leitura de imagens fornecidas como entrada.

A distinção que importa é entre entender uma imagem e criar uma imagem. Ollama faz a primeira usando modelos de visão como Qwen VL, Gemma ou Llama Vision: você envia uma foto, o modelo a descreve, faz OCR ou responde a perguntas sobre ela. Isso é geração de texto a partir de uma imagem. A geração de imagem — produzir um arquivo PNG a partir de um prompt — se baseia em uma arquitetura totalmente diferente (modelos de difusão, não transformadores de linguagem), que Ollama não executa.

!
Não procure um modelo de imagem no ollama.com
Não existe um « ollama run stable-diffusion ». A biblioteca Ollama contém apenas LLMs e modelos de linguagem-vision. Todo tutorial que afirma gerar imagens diretamente com a comando ollama run se engana o usuário. Para gerar imagens, é necessário um motor de difusão dedicado.

Resumindo: mantenha o Ollama para texto e análise de imagens e adicione uma ferramenta de difusão para a criação. Os dois coexistem muito bem na mesma máquina e podem até compartilhar a GPU, desde que você não os use ao mesmo tempo.


#Por que gerar suas imagens localmente

O kit de Imagens com IA

Sua primeira imagem foi gerada na sua máquina. O kit Imagens IA dá continuidade: um fluxo texto→imagem que você domina (cap. 5), caber na sua memória de vídeo e ganhar velocidade (cap. 7), depois treinar seu próprio estilo (cap. 11).

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Gerar localmente exige um pouco mais de esforço do que abrir o Midjourney, mas as razões para isso são concretas e se acumulam rapidamente a partir do momento em que se passa do uso ocasional.

Sem custo de uso
após o hardware e os modelos estarem prontos, você gera tantas imagens quanto quiser, sem créditos nem assinatura. Sem cota mensal, sem cobrança por imagem.
Confidencialidade total
Seus prompts e suas imagens nunca saem da máquina. Decisivo para imagens de produtos ainda não anunciados, conteúdo de clientes sob NDA ou dados sensíveis.
Nenhuma censura do lado do servidor
Os filtros de conteúdo dos serviços na nuvem são frequentemente amplos e opacos. Localmente, é sua máquina, suas regras — dentro do marco legal que continua se aplicando a você.
Controle e reprodutibilidade
seed fixo, configurações exatas, modelos e LoRA escolhidos: você reproduz uma imagem pixel a pixel, algo que os serviços em nuvem não garantem de uma atualização para outra.
Offline
depois que os modelos são baixados, tudo funciona sem conexão. Prático em deslocamentos ou em um computador isolado.

#As verdadeiras opções locais para gerar imagens

Como o Ollama está fora da disputa para a criação, estas são as ferramentas sérias que realmente geram imagens localmente em 2026. Todas se baseiam em modelos de difusão (família Stable Diffusion, SDXL ou arquiteturas recentes como FLUX). O que muda de uma ferramenta para outra é a interface e o público-alvo.

AUTOMATIC1111 (Stable Diffusion WebUI)
A interface web histórica, rica e documentada. Abas txt2img / img2img, extensões em abundância, comunidade enorme. Um pouco desatualizada, mas ainda a referência para aprender.
ComfyUI
uma interface baseada em um grafo de nós: você conecta o pipeline (modelo → sampler → VAE → saída) visualmente. Curva de aprendizado mais íngreme, mas controle total e o melhor suporte a modelos recentes como FLUX.
Fooocus
Desenvolvido para a simplicidade no estilo do Midjourney: um campo de prompt, presets e a ferramenta cuida do resto. Ideal para começar sem entender o funcionamento interno da difusão.
Draw Things (macOS / iOS)
aplicativo nativo para Apple Silicon, gratuito, otimizado para Metal e memória unificada. De longe, a opção mais simples no Mac: tudo está integrado, incluindo o download dos modelos.
SD.Next
Um fork de AUTOMATIC1111 mais ativamente mantido, com melhor suporte multi-backend (CUDA, ROCm, Intel). Uma boa alternativa se você estiver usando GPU não-NVIDIA.
→
Qual ferramenta para quem
Iniciante no Windows/Linux → Fooocus. No Mac → Draw Things. Você quer aprender e experimentar → AUTOMATIC1111. Você quer o controle máximo e os modelos mais recentes → ComfyUI. Os modelos (.safetensors) são compartilhados entre essas ferramentas: nada impede que você experimente várias delas.

#VRAM necessária de acordo com o modelo de difusão

A geração de imagens consome muita VRAM, mas esse consumo é menos linear do que nos LLMs: o que importa é o modelo de difusão escolhido e a resolução desejada. Aqui estão referências realistas para gerar imagens confortavelmente em 2026.

Stable Diffusion 1.5 — 4 GB de VRAM
o modelo mais leve. Roda mesmo em uma placa modesta, com imagens nativas em 512×512. Antigo, mas rápido e pouco exigente em termos de hardware.
SDXL — 8 a 12 GB de VRAM
O padrão de qualidade/acessibilidade. Imagens nativas 1024×1024, bom nível de detalhe. Uma RTX 3060 de 12 GB é mais do que suficiente, uma RTX 4070 é confortável.
FLUX (dev / schnell) — 12 a 24 GB de VRAM
a geração recente, com qualidade fotorrealista e fidelidade ao prompt claramente superiores. As versões quantizadas (GGUF, fp8) reduzem o uso de memória, mas 16 a 24 GB ainda são necessários para um uso realmente confortável.
Mac Apple Silicon — memória unificada
Um M4 Pro de 24 a 48 GB compartilha sua memória entre CPU e GPU: SDXL roda sem problemas, FLUX também com um pouco de paciência. Mais lento que uma RTX de alto desempenho, mas silencioso e econômico.
i
Sem GPU dedicado, é possível mas lento
A geração usando apenas a CPU funciona (o modo --use-cpu do AUTOMATIC1111, ou Draw Things em um Mac de entrada), mas espere levar vários minutos por imagem, contra alguns segundos na GPU. Para uso regular, uma placa com pelo menos 8 GB de VRAM muda tudo.

#Instalação mais simples de acordo com seu sistema operacional

O caminho mais curto varia de acordo com a máquina. Aqui está a opção menos trabalhosa para cada sistema, sem pretender cobrir todas as possibilidades.

#macOS (Apple Silicon): Draw Things

No Mac, não há necessidade de tocar em Python ou em uma linha de comando. Draw Things é um aplicativo nativo disponível para download no Mac App Store: ele cuida da instalação dos modelos, da otimização do Metal e da interface em um único pacote.

  1. 01
    1. Instalar o aplicativo
    Procure “Draw Things” na Mac App Store e instale o aplicativo. Ele é gratuito.
  2. 02
    2. Baixar um modelo
    Na primeira execução, o aplicativo propõe baixar um modelo base (SDXL é um bom ponto de partida). O download é feito pela interface.
  3. 03
    3. Gerar
    Digite um prompt, deixe as configurações padrão, clique em Generate. A primeira imagem sai em algumas dezenas de segundos, dependendo do chip.

#Windows / Linux com GPU NVIDIA : Fooocus ou ComfyUI

Em um PC com uma placa NVIDIA, o Fooocus é o mais rápido de colocar em funcionamento. Ele baixa seu modelo padrão na primeira execução e oferece pouquíssimos ajustes para configurar.

Terminal — instalar Fooocus
# Prérequis : Python 3.10+ et un GPU NVIDIA avec pilotes récents
git clone https://github.com/lllyasviel/Fooocus.git
cd Fooocus
python -m venv venv
source venv/bin/activate    # Windows : venv\Scripts\activate
pip install -r requirements_versions.txt
python entry_with_update.py

Ao iniciar, Fooocus baixa automaticamente um modelo SDXL e depois abre uma interface web no navegador (por padrão, em http://127.0.0.1:7865). Você digita um prompt e gera a imagem — é só isso.

Se você prefere o controle por nós e os modelos mais recentes, o ComfyUI pode ser iniciado de forma semelhante:

Terminal — instalar ComfyUI
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python -m venv venv
source venv/bin/activate
pip install -r requirements.txt
# Placez vos modèles .safetensors dans models/checkpoints/
python main.py
# Interface : http://127.0.0.1:8188
!
GPU AMD no Windows: mais delicado
O suporte ROCm no Windows continua desigual. Em GPUs AMD, prefira Linux com ROCm ou uma variante DirectML/SD.Next no Windows. Prepare-se para um pouco de configuração — a mesma lógica para rodar um LLM em GPU AMD.

#Seus primeiros resultados em 30 minutos

Depois de instalar a ferramenta, siga este passo a passo para obter imagens de qualidade satisfatória rapidamente, em vez de começar pelos ajustes avançados.

  1. 01
    1. Comece com um modelo SDXL
    É o melhor equilíbrio entre qualidade, VRAM e velocidade para começar. Reserve o FLUX para depois, quando quiser mais realismo e conhecer os limites da sua GPU.
  2. 02
    2. Escreva um prompt descritivo
    Modelos de difusão gostam de descrições concretas: assunto, estilo, enquadramento, iluminação. Por exemplo: 'uma raposa ruiva dormindo em uma floresta de bétulas, luz dourada da manhã, fotografia, baixa profundidade de campo'.
  3. 03
    3. Deixe as configurações no padrão
    Steps em torno de 25-30, guidance (CFG) em torno de 7 para SDXL. Não altere mais nada nos seus primeiros testes: os valores padrão da ferramenta são razoáveis.
  4. 04
    4. Defina um seed para iterar
    Manter o mesmo seed e modificar ligeiramente o prompt permite ver o efeito de uma palavra. Esse é o verdadeiro ciclo de trabalho: mudar um detalhe de cada vez.
  5. 05
    5. Mude para img2img para aprimorar
    Reutilize uma imagem gerada como base e gere novamente com um "denoising" parcial para corrigir sem começar do zero.
→
O prompt negativo faz metade do trabalho
A maioria das ferramentas oferece um campo de prompt negativo: liste nele o que você não quer (« desfoque, mãos deformadas, texto, marca-d'água, baixa resolução »). No SD 1.5 e no SDXL, isso geralmente é o que separa uma imagem malfeita de uma imagem sem defeitos.

#Qualidade esperada em comparação com Midjourney e DALL-E

Vamos ser diretos: em termos de qualidade bruta « em um clique », o Midjourney continua à frente. Suas imagens são esteticamente agradáveis por padrão, sem esforço de ajuste. O DALL-E, integrado ao ChatGPT, se destaca por seguir prompts complexos e pelo texto nas imagens. Esse é o resultado de modelos enormes treinados e ajustados por equipes dedicadas, servidos a partir da nuvem.

Mas a diferença já não é aquela que imaginamos. O FLUX em execução local gera imagens fotorrealistas que rivalizam com o Midjourney em muitos temas, e o SDXL com prompts bem formulados atende com folga à maioria dos usos. Acima de tudo, a execução local oferece vantagens que a nuvem não pode oferecer.

Controle preciso
ControlNet (impor uma pose, uma profundidade, contornos), inpainting preciso, LoRA especializados: a execução local oferece um nível de controle que Midjourney e DALL-E não disponibilizam.
Personalização
milhares de modelos e LoRAs da comunidade (estilos, personagens, estéticas) podem ser baixados livremente. Você adapta o modelo à sua necessidade específica.
Volume e custo
Gerar mil variantes custa apenas energia elétrica. Na nuvem, todas essas gerações consomem créditos.
Esforço inicial
esse é o verdadeiro trade-off: o Midjourney oferece um resultado bonito de imediato, enquanto a geração local exige aprender a escrever prompts e fazer ajustes. O retorno desse esforço é o controle e a gratuidade de uso.

A perspectiva adequada: a geração local não substitui o Midjourney para criar uma imagem bonita de vez em quando, sem precisar pensar muito. Ela supera o Midjourney assim que você precisa de confidencialidade, volume, reprodutibilidade ou controle preciso — e sua qualidade de ponta, com FLUX, já está longe de ser insignificante.


#Solução de problemas comuns

« CUDA out of memory »
O modelo ou a resolução ultrapassam sua VRAM. Reduza a resolução, ative o modo « medvram » / « lowvram » do utilitário ou mude para um modelo mais leve (SDXL → SD 1.5, ou FLUX quantizado).
Imagens borradas ou distorcidas
Aumente ligeiramente o número de steps, ajuste o CFG e, principalmente, reforce o prompt negativo. No SDXL, confirme que você está gerando em 1024×1024 e não em 512.
Geração muito lenta
Confirme que a GPU está sendo usada (e não a CPU por padrão). Se você usa NVIDIA, verifique os drivers e a versão do PyTorch compilada para CUDA; o instalador do Fooocus/ComfyUI normalmente cuida disso.
Mãos e rostos mal gerados
fraqueza clássica dos modelos de difusão. Use um módulo de restauração de rosto, o inpainting na área afetada ou um modelo/LoRA conhecido por lidar melhor com a anatomia.

#Para se aprofundar

A geração de imagens coexiste naturalmente com o restante da pilha de IA local. Esses guias do site complementam o que você acabou de implementar:

Analisar imagens em vez de criá-las
“LLM multimodal com visão rodando localmente: analisar imagens com Ollama” aborda a outra metade do tema das imagens — a leitura e o OCR com um modelo de visão.
Entender a VRAM e a escolha da placa de vídeo
Os indicadores de memória deste guia seguem a mesma lógica do artigo 'Escolher a quantização (Q4, Q5, Q8, FP16)', útil para dimensionar sua placa.
O restante da pilha de texto
“Instalar o Ollama em 5 minutos” continua sendo a base para a parte de linguagem, que deve rodar junto com seu mecanismo de difusão na mesma máquina.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.