MiniCPM localmente (Ollama): o multimodal compact
MiniCPM-V é a série de modelos compactos de visão e linguagem do OpenBMB, sob licença Apache 2.0. No Ollama, a tag minicpm-v ainda carrega a versão 2.6 (8 bilhões, 5,5 GB), minicpm-v4.5 uma versão de 8 bilhões de 6,1 GB e minicpm-v4.6 um modelo com cerca de 1,3 bilhão de parâmetros de 1,6 GB. Comece pelo 4.6 em uma máquina pequena, depois compare usando suas imagens.
MiniCPM é a família de modelos compactos do OpenBMB, com modelos de visão-linguagem projetados para rodar onde os grandes modelos não conseguem. A família evoluiu bastante: a versão carregada pela tag histórica do Ollama já não é a mais recente, e agora existe um modelo com 1,3 bilhão de parâmetros. Esta página explica qual tag instalar, quanto valem os números anunciados e quais são os limites do OCR de um modelo generalista.
#Qual versão do MiniCPM instalar em 2026
MiniCPM-V é a série de modelos compactos de visão e linguagem do OpenBMB, desenvolvida por THUNLP (Universidade Tsinghua) e ModelBest, cujos pesos e código são publicados sob a licença Apache 2.0. No Ollama, três tags coexistem e geram confusão. A tag minicpm-v, sem sufixo, ainda corresponde ao MiniCPM-V 2.6, um modelo de 8 bilhões de parâmetros que ocupa 5,5 GB e tem 32K de contexto. A tag minicpm-v4.5 carrega uma versão mais recente de 8 bilhões de parâmetros (6,1 GB, 40K de contexto). A tag minicpm-v4.6, incluída na biblioteca oficial do Ollama em 25 de junho de 2026 segundo o repositório do projeto, ocupa 1,6 GB e tem aproximadamente 1,3 bilhão de parâmetros. Para conhecer a visão local em uma máquina pequena, comece pelo 4.6; mantenha o 4.5 para comparar nos seus documentos densos, pois nada garante que um modelo de 1,3 bilhão leia tão bem quanto um de 8 bilhões quando o texto é muito compacto.
| Tag Ollama | Versão | Parâmetros | Download | Contexto anunciado | Para lembrar |
|---|---|---|---|---|---|
| minicpm-v | MiniCPM-V 2.6 | 8 bilhões | 5,5 GB | 32K | Versão de 2024: suporte a múltiplas imagens e vídeo; é essa versão que a tag sem sufixo carrega |
| minicpm-v4.5 | MiniCPM-V 4.5 | 8 bilhões | 6,1 GB | 40K | Construído com Qwen3-8B e SigLIP2-400M; vídeo com alta taxa de quadros; a empresa responsável anuncia 77,0 no OpenCompass |
| minicpm-v4.6 | MiniCPM-V 4.6 | cerca de 1,3 bilhão | 1,6 GB | 256K | O mais leve e recente; compressão de tokens visuais; versões móveis |
| openbmb/minicpm-o4.5 | MiniCPM-o 4.5 | 9 bilhões | 6,1 GB | 40K | Versão omni (voz, fluxo em tempo real); a ficha do Ollama indica apenas texto e imagem como entradas |
#O que a série traz, e o que é necessário relativizar
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
A série busca a melhor relação entre capacidade e tamanho. De acordo com o repositório do OpenBMB, o MiniCPM-V 4.5 atinge 77,0 no OpenCompass e supera, com 8 bilhões de parâmetros, o GPT-4o-latest, o Gemini 2.0 Pro e o Qwen2.5-VL 72B. Para a versão 4.6, o projeto indica um codificador visual cuja demanda computacional cai mais de 50%, compressão dos tokens visuais com fator à escolha (4 vezes ou 16 vezes) e uma taxa de tokens de aproximadamente 1,5 vez a do Qwen3.5-0.8B. A ficha do mesmo modelo no Ollama anuncia 2,4 vezes: os dois números vêm do projeto, e nenhum protocolo de medição é detalhado nessas páginas. São anúncios, não medições independentes: cronometre no seu hardware.
- Multimodal compacto
- Texto e imagem, várias imagens ao mesmo tempo e vídeo. A versão 4.5 compacta até 6 imagens de vídeo em 64 tokens de acordo com o repositório, permitindo ler mais imagens sem custo adicional para o modelo de linguagem.
- OCR de alta resolução
- O 4.5 processa imagens de qualquer proporção com até 1,8 milhão de pixels (por exemplo, 1344 x 1344). A empresa responsável afirma que ele lidera no OCRBench e na análise de PDF (OmniDocBench) entre os modelos multimodais de uso geral; segundo as informações divulgadas, o 4.6 atinge o nível do Qwen3.5 2B em vários benchmarks, incluindo o OCRBench.
- Licença permissiva
- O repositório informa que os pesos e o código estão sob a licença Apache 2.0, e as fichas das versões 4.5 e 4.6 no Hugging Face trazem a mesma indicação. Verifique a licença exata da versão específica que você baixa.
- Vários formatos
- O projeto oferece variantes GGUF, BNB, AWQ e GPTQ, e compatibilidade anunciada com SGLang, vLLM, llama.cpp e Ollama.
#Quanta memória, de fato
| Modelo e formato | Memória anunciada | Fonte |
|---|---|---|
| MiniCPM-V 4.6, Transformers (GPU) | 4 GB | Tabela de modelos do repositório |
| MiniCPM-V 4.6, GGUF (CPU) | 2 GB | Tabela de modelos do repositório |
| MiniCPM-V 4.6, BNB, AWQ ou GPTQ (GPU) | 3 GB | Tabela de modelos do repositório |
| MiniCPM-o 4.5, GGUF | 10 GB | Tabela de modelos do repositório |
| MiniCPM-o 4.5, GPU | 19 GB | Tabela de modelos do repositório |
| minicpm-v4.6 no Ollama | 1,6 GB de download | Ficha do Ollama |
| minicpm-v4.5 em Ollama | 6,1 GB de download | Ficha do Ollama |
Esses números descrevem os pesos e a execução básica: o contexto e as imagens exigem mais memória. As imagens são convertidas em tokens visuais que ocupam a janela de contexto, e a documentação do Ollama especifica que ele usa, por padrão, 4.000 tokens de contexto quando há menos de 24 GiB de VRAM; aumentar esse valor aumenta a memória necessária. O contexto anunciado de 256K para a versão 4.6 não é, portanto, alocado por padrão. Por fim, a tabela do repositório indica execução em CPU para a versão GGUF da 4.6, sem divulgar a velocidade: meça antes de prometer tempo real.
#Instalar MiniCPM-V com Ollama
O Ollama gerencia o download, o projetor visual e o servidor de API: não há mais nada para instalar. Comece atualizando o Ollama, pois a versão 4.6 é recente na biblioteca. A página da tag minicpm-v já menciona que ela exigia o Ollama 0.3.10 ou superior.
- 01Baixar o modeloollama pull minicpm-v4.6 baixa os pesos do modelo de linguagem e o projetor visual, cerca de 1,6 GB. Para o 4.5, use minicpm-v4.5 (6,1 GB).
- 02Iniciar um primeiro chatollama run minicpm-v4.6 abre uma sessão interativa. Faça uma pergunta de texto antes de testar a visão.
- 03Enviar uma imagemA documentação do Ollama mostra o caminho do arquivo colocado antes da pergunta, por exemplo: ollama run minicpm-v4.6 ./photo.jpg seguido de "Descreva esta imagem".
- 04Conectar uma interfaceApós ser baixado, o modelo aparece em Open WebUI ou em qualquer cliente que aponte para a porta 11434.
#Visão e OCR no dia a dia
MiniCPM-V se sai bem em tarefas documentais: ler uma fatura, transcrever uma captura de tela, extrair as linhas de uma tabela, descrever uma foto. As imagens de alta resolução são muito importantes no OCR, porque um texto com traços finos, ilegível em uma miniatura, torna-se utilizável em resolução completa. Formule prompts precisos: “Descreva esta imagem” dá uma descrição geral, enquanto “Transcreva fielmente todo o texto visível, preservando a disposição na página” dá um resultado muito mais limpo. Para extrair dados, solicite um formato explícito: JSON, Markdown ou tabela.
A API REST do Ollama espera a imagem codificada em base64 no campo images, como lembra sua documentação; os SDKs também aceitam um caminho de arquivo. Se você usar Transformers em vez de Ollama, o repositório documenta uma configuração útil para a versão 4.6: o parâmetro downsample_mode tem valor padrão de 16x, e 4x preserva quatro vezes mais tokens visuais para captar detalhes mais finos. É a configuração a experimentar quando um texto muito pequeno é lido incorretamente.
Quando preferir um motor de OCR especializado? Se você processa milhares de páginas e a rastreabilidade é prioridade, um motor especializado gera erros visíveis em vez de valores plausíveis. O PaddleOCR-VL, um modelo com menos de um bilhão de parâmetros, apresenta 96,33% no OmniDocBench v1.6 segundo seu desenvolvedor, e o Tesseract continua sendo a escolha leve para texto limpo. O MiniCPM-V mantém a vantagem quando você quer também descrever a imagem ou responder a uma pergunta sobre ela.
- PaddleOCR: o OCR que entende a página
- Tesseract OCR: ler um documento digitalizado localmente
- Extrair os dados de uma fatura de ponta a ponta
#Em comparação com Qwen3-VL e os outros modelos compactos
O concorrente direto do MiniCPM-V na categoria de modelos de visão compactos é o Qwen3-VL, disponível em Ollama especialmente em 2, 4 e 8 bilhões de parâmetros. Os dois abrangem o mesmo território: descrição de imagem, OCR, perguntas sobre documentos. O README do OpenBMB afirma que o MiniCPM-V 4.6 supera em desempenho um modelo maior, Gemma4-E2B-it, e se mostra mais eficiente que o Qwen3.5-0.8B: são comparações publicadas pelo editor, com base em suas próprias avaliações.
| Modelo | Tamanho exibido | O que se pode dizer | Guia do site |
|---|---|---|---|
| minicpm-v4.6 | 1,6 GB | O desenvolvedor afirma que ele está no mesmo nível do Qwen3.5 2B em vários benchmarks visuais, incluindo o OCRBench | Esta página |
| qwen3-vl:2b | 1,9 GB | Mesma classe de tamanho, contexto de 256K exibido | Qwen3-VL local |
| qwen3-vl:8b | 6,1 GB | Equivalente em tamanho ao minicpm-v4.5 | Qwen3-VL local |
| Moondream | Veja o guia | Modelo leve de visão, tratado em um guia dedicado do site | Moondream |
A escolha depende mais das suas imagens do que de uma ficha técnica. As duas famílias rodam no mesmo Ollama e usam a mesma API: passar de uma para a outra equivale a mudar o nome do modelo na requisição; nada impede que você mantenha as duas e encaminhe as requisições conforme a tarefa.
- Qwen3-VL local: o modelo de visão de referência
- Moondream: o modelo de visão que cabe em qualquer lugar
#Edge, móvel e servidor: o que o projeto documenta
O MiniCPM foi projetado para rodar no dispositivo. O repositório indica que o MiniCPM-V 4.6 pode ser implantado em iOS, Android e HarmonyOS, com o código de adaptação aberto, e apresenta gravações brutas de tela em um iPhone 17 Pro Max, um Redmi K70 e um HUAWEI nova 14. Um repositório de aplicativos oferece o download e o guia de implantação. Para atender vários usuários, o projeto anuncia compatibilidade com vLLM e SGLang, além de llama.cpp e Ollama.
- 01Digitalização local de documentosUm mini-PC ou um NAS com uma placa de vídeo de entrada transforma uma pasta de documentos digitalizados em texto pesquisável, sem enviar um documento sensível para a nuvem.
- 02Assistente offlineEm um notebook Apple Silicon ou com uma placa modesta, a versão 4.6 lê a tela e responde com base em capturas de tela, mesmo sem conexão.
- 03Pré-processamento de um pipelineAntes de um sistema mais pesado, ele faz a triagem: tipo de documento, campos evidentes. Apenas os casos difíceis são encaminhados para um modelo maior.
- 04Texto alternativo em massaGerar descrições de imagens para um site ou biblioteca digital, em lote, sem custo por chamada após a amortização do equipamento.
#Solução de problemas
- O modelo ignora a imagem
- Verifique o caminho do arquivo e seu acesso a partir do local onde Ollama está rodando. Na API, a imagem deve estar em base64 no campo images.
- OCR malfeito ou truncado
- A imagem provavelmente está comprimida demais ou tem uma resolução muito baixa. Forneça uma versão nítida e maior e peça explicitamente uma transcrição fiel que preserve o layout. Com Transformers, tente downsample_mode 4x.
- Respostas lentas
- Ao usar apenas a CPU, isso é esperado. Ao usar a GPU, verifique com ollama ps se parte do modelo foi transferida para a RAM por causa de um contexto ou de uma imagem grandes demais.
- Saída não estruturada
- Para um JSON confiável, exija o esquema no prompt e, se o cliente permitir, utilize o formato estruturado de Ollama.
- Versão inesperada
- A tag minicpm-v sem sufixo ainda aponta para a versão 2.6. Especifique explicitamente minicpm-v4.6 ou minicpm-v4.5 para obter um comportamento reprodutível.
#Para se aprofundar
- Instalar Ollama em 5 minutos
- LLM multimodal com visão em execução local com Ollama
- Escolher sua quantização
- Open WebUI com Ollama
- Fonte: repositório oficial MiniCPM-V do OpenBMB
- Fonte: ficha Ollama do minicpm-v4.6
- Fonte: ficha do MiniCPM-V 4.6 no Hugging Face
- Fonte: documentação de Ollama sobre visão
Qual tag Ollama instalar para MiniCPM-V?+
O MiniCPM-V é gratuito, inclusive para uso comercial?+
Quanta VRAM é realmente necessária?+
O MiniCPM-V lê bem o texto dos documentos?+
É possível usá-lo em um telefone?+
O MiniCPM-o permite falar com um modelo no Ollama?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.