Intermediário 12 minVisão

Moondream: o modelo de visão que cabe partout

Resposta direta

Moondream é uma família de modelos abertos de visão-linguagem que descrevem uma imagem, respondem a uma pergunta, detectam, apontam e segmentam. O Moondream 2 (1,9 bilhão de parâmetros, Apache 2.0) requer cerca de 2 GB de VRAM em int4; a versão 0,5B, 816 MiB. As gerações 3 e 3.1 (9 bilhões no total, 2 ativos) requerem cerca de 10 GB de VRAM e uma licença que proíbe apenas a revenda do próprio Moondream como serviço hospedado.

Os modelos multimodais impressionantes pesam dezenas de gigabytes e ocupam uma placa de vídeo inteira. O Moondream aborda o problema pelo outro extremo: uma família de modelos de visão compactos, cuja menor versão cabe em menos de um gigabyte, para descrever uma imagem, responder a uma pergunta ou localizar um objeto em um computador comum. Este guia, atualizado até 28 de setembro de 2026, diferencia as quatro variantes, quantifica seu consumo segundo o desenvolvedor, explica as licenças e diz o que não se deve pedir ao Moondream.

Por Mohamed Meguedmi·Atualização 2026-09-29·Testado no Windows, macOS e Linux

#Uma família, não um modelo

Moondream é publicado pela M87 Labs. Seu criador original, Vikhyat Korrapati, o descreve no repositório GitHub como “a tiny vision language model that kicks ass and runs anywhere”. O nome Moondream designa hoje quatro variantes com características muito diferentes, e guias mais antigos frequentemente as confundem.

Variantes do Moondream, segundo M87 Labs e Hugging Face
VarianteArquiteturaPeso e memóriaContextoLicença
Moondream 2 (0,5B)500 milhões de parâmetros, projetado como alvo de distilação para uso embarcadoint4: download de 375 MiB, 816 MiB na memóriaNão indicadoLicença Apache 2.0 para o repositório de código (licença do modelo não especificada)
Moondream 2Modelo denso, 1,9 bilhão de parâmetros, atualizado desde março de 2024Arquivo de 3,85 GB; int8: 2 624 MiB de VRAM; int4: 2 002 MiB2.000 tokensApache 2.0
Moondream 3 PreviewMistura de especialistas, 9 bilhões ao todo, 2 bilhões ativos por token; 64 especialistas, 8 ativosAproximadamente 18,5 GB em BF16, ou 10,51 GB em FP832.000 tokensBusiness Source License 1.1 com a cláusula « No Third-Party Service »
Moondream 3.1 9B A2BMistura de especialistas, 9,0 bilhões ao todo, 2,0 ativos; 8 especialistas, 2 ativados, 1 compartilhadoEspecialistas em FP8, pelo menos 10 GB de VRAM de acordo com a ficha32 768 tokensMoondream Model License 1.0, em vigor desde 7 de julho de 2026

A diferença de escala muda a natureza dos usos. Um modelo com 2 bilhões de parâmetros pode rodar em um notebook sem placa dedicada ou em uma máquina embarcada. Um modelo com 9 bilhões de parâmetros, mesmo ativo apenas 2 por token, deve manter todos os pesos na memória: é por isso que a geração 3 exige dezenas de gigabytes, com um arquivo FP8 de 10,51 GB para a Preview. A documentação do Moondream especifica que um Mac mini M4 de base com 16 GB acolhe o Moondream 2, mas que os pesos do Moondream 3 ultrapassam sua memória unificada.

i
Aviso sobre a versão 3.1
A ficha do modelo da versão 3.1 traz a indicação « PRELIMINARY » para seus resultados de benchmark, que podem mudar antes da publicação pública. Este guia, portanto, não inclui nenhum desses resultados. Os valores de memória citados mais adiante vêm da documentação técnica e dos tamanhos de arquivos publicados.

#O que ele sabe fazer

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Os modelos Moondream oferecem habilidades nativas, com saídas estruturadas em vez de texto livre a interpretar. Segundo a ficha da versão 3.1, cada habilidade tem um contrato de saída fixo.

Query (responder a uma pergunta)
Pergunta em linguagem natural sobre a imagem, resposta livre. É a opção de uso geral. A ficha do modelo esclarece que não há uma medida de confiança calibrada: formule perguntas verificáveis.
Caption (descrever)
Legendas em três comprimentos: short, normal ou long. A ficha do modelo alerta que uma legenda longa troca recall por um maior risco de alucinação e que ela não deve ser analisada para extrair contagens nem coordenadas.
Detect (detectar)
Caixas delimitadoras para qualquer expressão, com coordenadas normalizadas entre 0 e 1 a partir do canto superior esquerdo. Até 200 caixas por chamada, limiar padrão de 0,30.
Point (apontar)
O centro de cada instância, até 64 pontos: mais econômico que uma caixa e adequado à contagem.
Segment (segmentar)
Uma máscara por objeto correspondente, até 50 instâncias; as pontuações de confiança não são fornecidas para as máscaras.

O Moondream 2 adquiriu essas capacidades em etapas. Seu registro de alterações, publicado pelo autor, menciona em março de 2025 a geração de legendas longas, a rotulagem com vocabulário aberto e uma contagem aprimorada (CountBenchQA de 80 para 86,4). Em abril de 2025, a leitura de documentos e gráficos avança (ChartQA de 74,8 para 77,5). Em junho de 2025, chega um modo de raciocínio ancorado, ativado por reasoning=True na habilidade query, que troca velocidade por precisão, além de uma geração de texto 20 a 40% mais rápida, segundo o autor. Esses números são do próprio autor, com base em suas próprias avaliações: use-os para situar a evolução, não para comparar com outro modelo.

Um detalhe de uso: o Moondream não trabalha com a imagem inteira, ele a divide em blocos. De acordo com sua FAQ, ele redimensiona a imagem para que uma grade de blocos de aproximadamente 378 × 378 pixels a cubra, com no máximo 12 blocos locais mais uma visão global, totalizando cerca de 1,7 milhão de pixels para os blocos locais. A ficha da versão 3.1 confirma uma divisão adaptativa em no máximo 12 blocos, para imagens PNG, JPEG ou WebP com até 4.096 pixels no lado maior. Uma foto de 12 megapixels é, portanto, bastante reduzida antes da análise: para ler um detalhe, recorte primeiro a área.

#O que consome

Memória e velocidade anunciadas por M87 Labs para as versões pequenas
MediçãoMoondream 2 (0,5B)Moondream 2 (1,9B)
Memória durante a execução, int8996 MiB2624 MiB
Memória em tempo de execução, int4816 MiB2002 MiB
Download, int4375 MiBNão indicado
Velocidade, RTX 3090, int4 com compile()Não informada184 tokens por segundo

Esses números são os da página dos modelos do Moondream: o contexto importa, pois se trata de uma placa RTX 3090, com int4 e compile(), e da velocidade de geração de texto, não do tempo por imagem. O tempo por imagem depende do tamanho da saída e do número de tiles. A mesma página afirma que a quantização int4 reduz o uso de memória em 42% com perda de precisão de 0,6%, sem especificar a avaliação; considere isso uma declaração do desenvolvedor.

Para a geração 3.1, o hardware compatível com o motor Photon é uma placa NVIDIA Ampere ou mais recente com Linux ou Windows, ou um Mac Apple Silicon com macOS 13 ou posterior, com Python 3.10 a 3.14. A ficha do modelo também indica NVIDIA SM75 ou superior, com pelo menos 10 GB de VRAM, uma versão GGUF para processadores x86 ou ARM e MLX para Apple Silicon. Por fim, a documentação lista placas Jetson, incluindo a Jetson Orin Nano de 8 GB, entre as plataformas compatíveis.

#Três formas de iniciá-lo

  1. 01
    Com a biblioteca moondream e Photon
    Instale o pacote, depois carregue o modelo: os pesos são baixados do Hugging Face na primeira chamada, e nenhuma chave de API é necessária para os modelos de base, de acordo com a documentação. O Photon funciona apenas em GPU NVIDIA Ampere ou mais recente, ou em Mac com Apple Silicon.
  2. 02
    Com Transformers
    O repositório vikhyatk/moondream2 é carregado com AutoModelForCausalLM. Especifique a revisão: o autor alerta que o modelo é atualizado frequentemente e recomenda fixar a versão em produção. A opção trust_remote_code=True executa código fornecido pelo repositório: ative-a apenas se você confiar na fonte.
  3. 03
    Com Ollama
    A página do moondream no Ollama indica 1,7 GB, um contexto de 2 000 tokens e uma última atualização há dois anos, portanto anterior às versões de 2025 do Moondream 2. Ela não abrange as gerações 3. Verifique se oferece os recursos de que você precisa antes de adotá-la.
Python, de acordo com a documentação do Moondream
# pip install --upgrade moondream
import moondream as md
from PIL import Image

model = md.photon("moondream2")   # ou "moondream3.1-9B-A2B" avec une carte de 10 Go ou plus
image = Image.open("photo.jpg")

print(model.caption(image, length="short")["caption"])
print(model.query(image, "Combien de personnes sont visibles ?")["answer"])
for obj in model.detect(image, "casque")["objects"]:
    print(obj)

Lembre-se de que a habilidade detect retorna coordenadas normalizadas: multiplique-as pela largura e pela altura da imagem original para obter coordenadas em pixels.

#Os casos em que ele se destaca

  1. 01
    Indexar uma biblioteca de fotos
    Gerar uma legenda por imagem para tornar um acervo de fotos pesquisável por texto. O custo por imagem determina a viabilidade, e é nesse ponto que um modelo pequeno leva vantagem. Use legendas curtas: as longas podem inventar detalhes.
  2. 02
    Filtrar antes de enviar a um modelo grande
    Fazer uma triagem inicial para enviar ao modelo caro apenas as imagens que valem a pena. A capacidade point serve para contar, e a capacidade detect, para recortar automaticamente a área a ser analisada em seguida.
  3. 03
    Descrever imagens para acessibilidade
    Produzir textos alternativos em lote em um site existente, localmente e sem enviar as imagens a um serviço de terceiros. Revise uma amostra: uma legenda continua sendo uma hipótese.
  4. 04
    Monitorar um fluxo
    Fazer uma pergunta fechada sobre imagens sucessivas, em uma máquina modesta que funciona continuamente. O modelo de 0,5B foi projetado para receber ajuste fino para uma tarefa específica, o que melhora significativamente sua precisão segundo a M87 Labs.

Uma boa prática emerge da ficha da versão 3.1: faça perguntas fechadas e precisas. Um modelo pequeno responde bem a "há um capacete na cabeça da pessoa?" e se dispersa em "analise esta cena".

#O que não se deve pedir a ele

A ficha da versão 3.1 dedica uma seção inteira às suas limitações, o que é raro e precioso. Ela descreve os erros mais comuns na avaliação e os limiares que ela fornece servem de referência para os modelos da mesma família.

textos pequenos
Textos com tamanho inferior a cerca de 10 pixels na resolução do bloco de imagem costumam ser lidos incorretamente ou ignorados: primeiro recorte e amplie a área.
Pequenos objetos
Objetos com menos de 12 pixels no lado maior não são detectados por detect: use point em uma região recortada da imagem.
Cenas com muitos elementos
Acima de aproximadamente 50 instâncias, o recall cai e objetos adjacentes idênticos se fundem. Contagens acima de 50 são pouco confiáveis.
Leitura de texto desfocado
Em texto desfocado, estilizado ou parcialmente oculto, o modelo pode gerar uma sequência plausível, mas incorreta, sem sinal de baixa confiança. Para um documento completo, um motor de OCR é mais seguro.
Usos de alto impacto
Interpretação médica e decisões jurídicas ou financeiras com base em documentos, sem revisão humana, são declaradas fora do escopo. A saída de um modelo pequeno deve ser verificada.

#Licenças: o que você pode fazer

Licenças dos modelos Moondream, conforme suas fichas e licenças
ModeloLicençaO que ela permite, resumidamente
Moondream 2Apache 2.0Uso livre, inclusive comercial, com as condições habituais da licença Apache 2.0
Moondream 3 PreviewBusiness Source License 1.1 com a cláusula « No Third-Party Service »Uso pessoal, pesquisa e a maioria dos usos comerciais; não é permitido oferecer um produto ou serviço pago que concorra com a M87 Labs, incluindo acesso hospedado ou um SDK pago que incorpore os pesos
Moondream 3.1Moondream Model License 1.0, com código-fonte disponível, em vigor em 7 de julho de 2026Uso comercial, ajuste fino, quantização e redistribuição são permitidos; é necessária uma licença separada para oferecer o próprio Moondream como um serviço hospedado de uso geral

Para indexar sua própria coleção de fotos ou descrever as imagens do seu site, nenhuma dessas licenças apresenta problema: o uso interno ou como componente de um produto é autorizado. A limitação se aplica apenas a quem quiser vender acesso ao próprio Moondream, por exemplo, por meio de uma API de visão de uso geral hospedada. Em caso de dúvida sobre uso comercial, o que prevalece é a licença, não este resumo.

#Moondream ou um grande modelo de visão

A pergunta a se fazer não é «qual é o melhor», mas «quantas imagens e para qual decisão». Poucas imagens por dia e perguntas abertas: use o maior modelo que sua placa suporta. Milhares de imagens e uma pergunta fechada repetida: um modelo pequeno torna o projeto possível.

Uma arquitetura em cascata combina os dois: o modelo pequeno processa tudo e sinaliza os casos interessantes, e o modelo grande intervém apenas nesses casos. Em um acervo grande, esse esquema oferece a melhor relação entre qualidade e tempo de processamento. A capacidade de detecção do Moondream atua então como filtro: ela recorta o objeto, e o modelo grande analisa a área recortada.

#FAQ

FAQ
Moondream é gratuito?+
Sim, para execução local. Moondream 2 está sob licença Apache 2.0, e as versões 3 e 3.1 estão sob licenças source-available que permitem uso comercial. Não há custo de uso local, e nenhuma chave de API é necessária para os modelos de base com Photon. Apenas a oferta de um serviço hospedado de uso geral baseado no Moondream exige uma licença comercial separada.
É necessária uma placa de vídeo?+
Não necessariamente para as versões menores: a versão 0,5B informa 816 MiB de memória em int4, e o Moondream 2 funciona em GPU, processador, dispositivos móveis e Raspberry Pi, segundo a M87 Labs. Já o mecanismo Photon exige uma placa NVIDIA Ampere ou um Mac com Apple Silicon. Para a geração 3.1, considere mais de 10 GB de VRAM.
Ele sabe ler um documento escaneado?+
Ele lê textos curtos, placas e rótulos, e vem melhorando na leitura de documentos. Mas, para uma página densa, um motor de OCR é mais seguro: a ficha da versão 3.1 alerta que o modelo pode gerar uma sequência de caracteres plausível, mas falsa, ao ler texto desfocado, sem sinal de alerta. Ele não inventa menos valores do que um grande modelo, e textos com menos de 10 pixels são frequentemente mal lidos.
Moondream ou um modelo de visão maior?+
Para algumas imagens e perguntas abertas, use o maior modelo que sua placa suporta. Para milhares de imagens e uma pergunta fechada repetida, o Moondream torna o projeto viável. Uma cascata combina os dois: o modelo pequeno faz a triagem e recorta as imagens, o modelo grande intervém apenas nos casos interessantes.
É possível usá-lo em muitas imagens sequencialmente?+
É nesse tipo de tarefa que ele se destaca. O motor Photon anuncia processamento automático em lotes e gerenciamento do cache de prefixos. Tenha em mente que cada imagem é reduzida a cerca de 1,7 milhão de pixels de blocos locais: para detalhes finos, recorte primeiro. Teste em uma amostra antes de processar milhares de imagens.
É possível fazer um ajuste fino nele para uma tarefa específica?+
Sim. A licença 3.1 permite o ajuste fino, a quantização e a redistribuição, e a M87 Labs apresenta a versão 0,5B como uma base para ajuste fino em uma tarefa bem delimitada, com ganho de precisão segundo a desenvolvedora. Para uso comum, comece com o modelo base: o ajuste fino exige dados anotados e um protocolo de teste antes de justificar seu custo.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.