Intermediário 12 minEdge

MiniCPM localmente (Ollama): o multimodal compact

Resposta direta

MiniCPM-V é a série de modelos compactos de visão e linguagem do OpenBMB, sob licença Apache 2.0. No Ollama, a tag minicpm-v ainda carrega a versão 2.6 (8 bilhões, 5,5 GB), minicpm-v4.5 uma versão de 8 bilhões de 6,1 GB e minicpm-v4.6 um modelo com cerca de 1,3 bilhão de parâmetros de 1,6 GB. Comece pelo 4.6 em uma máquina pequena, depois compare usando suas imagens.

MiniCPM é a família de modelos compactos do OpenBMB, com modelos de visão-linguagem projetados para rodar onde os grandes modelos não conseguem. A família evoluiu bastante: a versão carregada pela tag histórica do Ollama já não é a mais recente, e agora existe um modelo com 1,3 bilhão de parâmetros. Esta página explica qual tag instalar, quanto valem os números anunciados e quais são os limites do OCR de um modelo generalista.

Por Samir K.·Atualização 2026-09-29·Testado no Windows, macOS e Linux

#Qual versão do MiniCPM instalar em 2026

MiniCPM-V é a série de modelos compactos de visão e linguagem do OpenBMB, desenvolvida por THUNLP (Universidade Tsinghua) e ModelBest, cujos pesos e código são publicados sob a licença Apache 2.0. No Ollama, três tags coexistem e geram confusão. A tag minicpm-v, sem sufixo, ainda corresponde ao MiniCPM-V 2.6, um modelo de 8 bilhões de parâmetros que ocupa 5,5 GB e tem 32K de contexto. A tag minicpm-v4.5 carrega uma versão mais recente de 8 bilhões de parâmetros (6,1 GB, 40K de contexto). A tag minicpm-v4.6, incluída na biblioteca oficial do Ollama em 25 de junho de 2026 segundo o repositório do projeto, ocupa 1,6 GB e tem aproximadamente 1,3 bilhão de parâmetros. Para conhecer a visão local em uma máquina pequena, comece pelo 4.6; mantenha o 4.5 para comparar nos seus documentos densos, pois nada garante que um modelo de 1,3 bilhão leia tão bem quanto um de 8 bilhões quando o texto é muito compacto.

As tags Ollama da família MiniCPM (páginas da biblioteca, setembro de 2026)
Tag OllamaVersãoParâmetrosDownloadContexto anunciadoPara lembrar
minicpm-vMiniCPM-V 2.68 bilhões5,5 GB32KVersão de 2024: suporte a múltiplas imagens e vídeo; é essa versão que a tag sem sufixo carrega
minicpm-v4.5MiniCPM-V 4.58 bilhões6,1 GB40KConstruído com Qwen3-8B e SigLIP2-400M; vídeo com alta taxa de quadros; a empresa responsável anuncia 77,0 no OpenCompass
minicpm-v4.6MiniCPM-V 4.6cerca de 1,3 bilhão1,6 GB256KO mais leve e recente; compressão de tokens visuais; versões móveis
openbmb/minicpm-o4.5MiniCPM-o 4.59 bilhões6,1 GB40KVersão omni (voz, fluxo em tempo real); a ficha do Ollama indica apenas texto e imagem como entradas
i
Três nomes para não confundir
MiniCPM-V refere-se aos modelos de visão, MiniCPM-o aos modelos omni que adicionam voz e fluxo em tempo real, e MiniCPM 5 à nova série de modelos de texto puro para dispositivos (MiniCPM5-1B e MiniCPM5-2B, este último com aproximadamente 2,5 bilhões de parâmetros, disponíveis pela OpenBMB no Ollama). Para análise de imagens e OCR, é do MiniCPM-V que você precisa.

#O que a série traz, e o que é necessário relativizar

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

A série busca a melhor relação entre capacidade e tamanho. De acordo com o repositório do OpenBMB, o MiniCPM-V 4.5 atinge 77,0 no OpenCompass e supera, com 8 bilhões de parâmetros, o GPT-4o-latest, o Gemini 2.0 Pro e o Qwen2.5-VL 72B. Para a versão 4.6, o projeto indica um codificador visual cuja demanda computacional cai mais de 50%, compressão dos tokens visuais com fator à escolha (4 vezes ou 16 vezes) e uma taxa de tokens de aproximadamente 1,5 vez a do Qwen3.5-0.8B. A ficha do mesmo modelo no Ollama anuncia 2,4 vezes: os dois números vêm do projeto, e nenhum protocolo de medição é detalhado nessas páginas. São anúncios, não medições independentes: cronometre no seu hardware.

Multimodal compacto
Texto e imagem, várias imagens ao mesmo tempo e vídeo. A versão 4.5 compacta até 6 imagens de vídeo em 64 tokens de acordo com o repositório, permitindo ler mais imagens sem custo adicional para o modelo de linguagem.
OCR de alta resolução
O 4.5 processa imagens de qualquer proporção com até 1,8 milhão de pixels (por exemplo, 1344 x 1344). A empresa responsável afirma que ele lidera no OCRBench e na análise de PDF (OmniDocBench) entre os modelos multimodais de uso geral; segundo as informações divulgadas, o 4.6 atinge o nível do Qwen3.5 2B em vários benchmarks, incluindo o OCRBench.
Licença permissiva
O repositório informa que os pesos e o código estão sob a licença Apache 2.0, e as fichas das versões 4.5 e 4.6 no Hugging Face trazem a mesma indicação. Verifique a licença exata da versão específica que você baixa.
Vários formatos
O projeto oferece variantes GGUF, BNB, AWQ e GPTQ, e compatibilidade anunciada com SGLang, vLLM, llama.cpp e Ollama.

#Quanta memória, de fato

Memória anunciada por OpenBMB e peso exibido por Ollama
Modelo e formatoMemória anunciadaFonte
MiniCPM-V 4.6, Transformers (GPU)4 GBTabela de modelos do repositório
MiniCPM-V 4.6, GGUF (CPU)2 GBTabela de modelos do repositório
MiniCPM-V 4.6, BNB, AWQ ou GPTQ (GPU)3 GBTabela de modelos do repositório
MiniCPM-o 4.5, GGUF10 GBTabela de modelos do repositório
MiniCPM-o 4.5, GPU19 GBTabela de modelos do repositório
minicpm-v4.6 no Ollama1,6 GB de downloadFicha do Ollama
minicpm-v4.5 em Ollama6,1 GB de downloadFicha do Ollama

Esses números descrevem os pesos e a execução básica: o contexto e as imagens exigem mais memória. As imagens são convertidas em tokens visuais que ocupam a janela de contexto, e a documentação do Ollama especifica que ele usa, por padrão, 4.000 tokens de contexto quando há menos de 24 GiB de VRAM; aumentar esse valor aumenta a memória necessária. O contexto anunciado de 256K para a versão 4.6 não é, portanto, alocado por padrão. Por fim, a tabela do repositório indica execução em CPU para a versão GGUF da 4.6, sem divulgar a velocidade: meça antes de prometer tempo real.

→
A transferência de parte do processamento para a CPU
Se o Ollama distribui o modelo entre GPU e CPU, o comando ollama ps exibe a distribuição na coluna PROCESSOR. O culpado é geralmente a imagem ou o contexto, não os pesos: reduza a resolução da imagem ou o valor de num_ctx antes de passar para uma quantização de menor precisão.

#Instalar MiniCPM-V com Ollama

O Ollama gerencia o download, o projetor visual e o servidor de API: não há mais nada para instalar. Comece atualizando o Ollama, pois a versão 4.6 é recente na biblioteca. A página da tag minicpm-v já menciona que ela exigia o Ollama 0.3.10 ou superior.

  1. 01
    Baixar o modelo
    ollama pull minicpm-v4.6 baixa os pesos do modelo de linguagem e o projetor visual, cerca de 1,6 GB. Para o 4.5, use minicpm-v4.5 (6,1 GB).
  2. 02
    Iniciar um primeiro chat
    ollama run minicpm-v4.6 abre uma sessão interativa. Faça uma pergunta de texto antes de testar a visão.
  3. 03
    Enviar uma imagem
    A documentação do Ollama mostra o caminho do arquivo colocado antes da pergunta, por exemplo: ollama run minicpm-v4.6 ./photo.jpg seguido de "Descreva esta imagem".
  4. 04
    Conectar uma interface
    Após ser baixado, o modelo aparece em Open WebUI ou em qualquer cliente que aponte para a porta 11434.
Terminal
# Le plus léger (1,6 Go)
ollama pull minicpm-v4.6

# La version 8 milliards, pour comparer
ollama pull minicpm-v4.5

# Vérifier ce qui est installé, puis discuter
ollama list
ollama run minicpm-v4.6 ./photo.jpg Décris cette image

#Visão e OCR no dia a dia

MiniCPM-V se sai bem em tarefas documentais: ler uma fatura, transcrever uma captura de tela, extrair as linhas de uma tabela, descrever uma foto. As imagens de alta resolução são muito importantes no OCR, porque um texto com traços finos, ilegível em uma miniatura, torna-se utilizável em resolução completa. Formule prompts precisos: “Descreva esta imagem” dá uma descrição geral, enquanto “Transcreva fielmente todo o texto visível, preservando a disposição na página” dá um resultado muito mais limpo. Para extrair dados, solicite um formato explícito: JSON, Markdown ou tabela.

API do Ollama: extrair os campos de uma fatura
import base64, requests

with open("facture.png", "rb") as f:
    img = base64.b64encode(f.read()).decode()

r = requests.post("http://localhost:11434/api/generate", json={
    "model": "minicpm-v4.6",
    "prompt": "Extrais le total, la date et le numéro de facture en JSON.",
    "images": [img],
    "stream": False,
})
print(r.json()["response"])

A API REST do Ollama espera a imagem codificada em base64 no campo images, como lembra sua documentação; os SDKs também aceitam um caminho de arquivo. Se você usar Transformers em vez de Ollama, o repositório documenta uma configuração útil para a versão 4.6: o parâmetro downsample_mode tem valor padrão de 16x, e 4x preserva quatro vezes mais tokens visuais para captar detalhes mais finos. É a configuração a experimentar quando um texto muito pequeno é lido incorretamente.

!
Verifique sempre o OCR
Nenhum modelo de visão compacto é 100% confiável ao lidar com dados críticos: valores, referências, datas. Um modelo de visão pode gerar um valor bem formatado que não está na página. Para uso contábil ou jurídico, mantenha uma revisão humana ou uma verificação de consistência dos campos sensíveis.

Quando preferir um motor de OCR especializado? Se você processa milhares de páginas e a rastreabilidade é prioridade, um motor especializado gera erros visíveis em vez de valores plausíveis. O PaddleOCR-VL, um modelo com menos de um bilhão de parâmetros, apresenta 96,33% no OmniDocBench v1.6 segundo seu desenvolvedor, e o Tesseract continua sendo a escolha leve para texto limpo. O MiniCPM-V mantém a vantagem quando você quer também descrever a imagem ou responder a uma pergunta sobre ela.

#Em comparação com Qwen3-VL e os outros modelos compactos

O concorrente direto do MiniCPM-V na categoria de modelos de visão compactos é o Qwen3-VL, disponível em Ollama especialmente em 2, 4 e 8 bilhões de parâmetros. Os dois abrangem o mesmo território: descrição de imagem, OCR, perguntas sobre documentos. O README do OpenBMB afirma que o MiniCPM-V 4.6 supera em desempenho um modelo maior, Gemma4-E2B-it, e se mostra mais eficiente que o Qwen3.5-0.8B: são comparações publicadas pelo editor, com base em suas próprias avaliações.

Modelos de visão compactos disponíveis no Ollama
ModeloTamanho exibidoO que se pode dizerGuia do site
minicpm-v4.61,6 GBO desenvolvedor afirma que ele está no mesmo nível do Qwen3.5 2B em vários benchmarks visuais, incluindo o OCRBenchEsta página
qwen3-vl:2b1,9 GBMesma classe de tamanho, contexto de 256K exibidoQwen3-VL local
qwen3-vl:8b6,1 GBEquivalente em tamanho ao minicpm-v4.5Qwen3-VL local
MoondreamVeja o guiaModelo leve de visão, tratado em um guia dedicado do siteMoondream

A escolha depende mais das suas imagens do que de uma ficha técnica. As duas famílias rodam no mesmo Ollama e usam a mesma API: passar de uma para a outra equivale a mudar o nome do modelo na requisição; nada impede que você mantenha as duas e encaminhe as requisições conforme a tarefa.

Comparar usando a mesma imagem
ollama run minicpm-v4.6 ./ticket.jpg Transcris le texte de ce ticket
ollama run qwen3-vl:2b ./ticket.jpg Transcris le texte de ce ticket

#Edge, móvel e servidor: o que o projeto documenta

O MiniCPM foi projetado para rodar no dispositivo. O repositório indica que o MiniCPM-V 4.6 pode ser implantado em iOS, Android e HarmonyOS, com o código de adaptação aberto, e apresenta gravações brutas de tela em um iPhone 17 Pro Max, um Redmi K70 e um HUAWEI nova 14. Um repositório de aplicativos oferece o download e o guia de implantação. Para atender vários usuários, o projeto anuncia compatibilidade com vLLM e SGLang, além de llama.cpp e Ollama.

  1. 01
    Digitalização local de documentos
    Um mini-PC ou um NAS com uma placa de vídeo de entrada transforma uma pasta de documentos digitalizados em texto pesquisável, sem enviar um documento sensível para a nuvem.
  2. 02
    Assistente offline
    Em um notebook Apple Silicon ou com uma placa modesta, a versão 4.6 lê a tela e responde com base em capturas de tela, mesmo sem conexão.
  3. 03
    Pré-processamento de um pipeline
    Antes de um sistema mais pesado, ele faz a triagem: tipo de documento, campos evidentes. Apenas os casos difíceis são encaminhados para um modelo maior.
  4. 04
    Texto alternativo em massa
    Gerar descrições de imagens para um site ou biblioteca digital, em lote, sem custo por chamada após a amortização do equipamento.
i
MiniCPM-o 4.5: a voz exige outra pilha de software
MiniCPM-o 4.5 adiciona conversação por voz e streaming simultâneo de vídeo e áudio, mas a ficha no Ollama anuncia apenas texto e imagem como entradas. Para usar voz, o repositório indica Transformers ou llama.cpp-omni, e suas limitações documentadas são reais: pronúncia às vezes incorreta no modo omni e respostas que às vezes misturam inglês e chinês.

#Solução de problemas

O modelo ignora a imagem
Verifique o caminho do arquivo e seu acesso a partir do local onde Ollama está rodando. Na API, a imagem deve estar em base64 no campo images.
OCR malfeito ou truncado
A imagem provavelmente está comprimida demais ou tem uma resolução muito baixa. Forneça uma versão nítida e maior e peça explicitamente uma transcrição fiel que preserve o layout. Com Transformers, tente downsample_mode 4x.
Respostas lentas
Ao usar apenas a CPU, isso é esperado. Ao usar a GPU, verifique com ollama ps se parte do modelo foi transferida para a RAM por causa de um contexto ou de uma imagem grandes demais.
Saída não estruturada
Para um JSON confiável, exija o esquema no prompt e, se o cliente permitir, utilize o formato estruturado de Ollama.
Versão inesperada
A tag minicpm-v sem sufixo ainda aponta para a versão 2.6. Especifique explicitamente minicpm-v4.6 ou minicpm-v4.5 para obter um comportamento reprodutível.

#Para se aprofundar

FAQ
Qual tag Ollama instalar para MiniCPM-V?+
Para uma máquina pequena, minicpm-v4.6: cerca de 1,6 GB e um modelo com cerca de 1,3 bilhão de parâmetros. Para comparação com um de 8 bilhões, minicpm-v4.5 pesa 6,1 GB. Cuidado: a tag minicpm-v sem sufixo carrega ainda a versão 2.6. Sempre nomeie a versão, caso contrário, você não saberá o que está testando.
O MiniCPM-V é gratuito, inclusive para uso comercial?+
O repositório anuncia pesos e código sob licença Apache 2.0, e as fichas do Hugging Face das versões 4.5 e 4.6 mencionam isso. A licença Apache 2.0 permite uso comercial. Releia, no entanto, a licença da versão exata que você está baixando, pois uma versão mais antiga pode ter tido condições diferentes.
Quanta VRAM é realmente necessária?+
A tabela do repositório informa 4 GB de memória de GPU para o 4.6 em Transformers e 2 GB para sua versão GGUF na CPU; o 4.5 pesa 6,1 GB no Ollama. Acrescente o contexto e as imagens: o Ollama aloca por padrão 4.000 tokens quando a VRAM é inferior a 24 GiB. Verifique com ollama ps.
O MiniCPM-V lê bem o texto dos documentos?+
O desenvolvedor anuncia pontuações muito boas em OCR, com imagens de até 1,8 milhão de pixels para a versão 4.5. Essas são avaliações feitas por ele próprio. Como qualquer modelo de visão, ele pode gerar um valor plausível que não aparece na página: mantenha a revisão dos números críticos ou use um mecanismo de OCR dedicado para grandes volumes.
É possível usá-lo em um telefone?+
Sim, o repositório indica que o MiniCPM-V 4.6 pode ser implantado no iOS, no Android e no HarmonyOS, com código de adaptação aberto e um repositório de aplicativos. As demonstrações publicadas são gravações de tela. Espere tarefas pontuais em vez de um fluxo contínuo de imagens e meça a latência no seu dispositivo.
O MiniCPM-o permite falar com um modelo no Ollama?+
Não, segundo a página do modelo no Ollama, que informa apenas texto e imagem como entradas para minicpm-o4.5. A conversa por voz e o fluxo simultâneo de áudio e vídeo passam por Transformers ou por llama.cpp-omni, segundo o repositório. Ele também exige muito mais memória: 19 GB na GPU, 10 GB em GGUF.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.