Lar
O ataque de redução de dimensões do modelo 1.3B do MiniCPM-V 4.6 redefine a tecnologia multimodal de ponta
Em 11 de maio, a Mingshi Intelligence uniu forças com a Universidade de Tsinghua e a comunidade de código aberto OpenBMB para apresentar o novo modelo multimodal de grande porte para a borda, o MiniCPM-V4.6. Apesar de seu tamanho compacto — com apenas 1,3 bilhão de parâmetros —, esse modelo leve ultrapassa os limites dos modelos maiores graças à sua excepcional densidade de inteligência e adaptabilidade entre plataformas, acelerando a implantação da IA na borda no mundo real.

1. Desempenho máximo: 1,3 bilhão de parâmetros proporcionam resultados excepcionais
O MiniCPM-V4.6 está disponível em duas versões — Instruct e Thinking —, ambas demonstrando raciocínio e compreensão impressionantes em vários benchmarks quando comparadas a modelos de tamanho semelhante.
Liderança global: no ranking da Artificial Analysis (AA), o MiniCPM-V4.6 obteve impressionantes 13 pontos, superando de longe rivais de tamanho semelhante (por exemplo, o Qwen3.5-0.8B do Alibaba e o Gemma4-E2B-it do Google), ao mesmo tempo em que quase igualou o desempenho de modelos maiores, como o Qwen3.5-2B. Isso estabelece um novo padrão de referência para modelos com 1 bilhão de parâmetros.
Recursos avançados: Desde a compreensão geral de imagem-texto e o raciocínio matemático complexo em STEM até o exigente reconhecimento óptico de caracteres (OCR) em documentos e a compreensão temporal de vídeos, o modelo demonstra forte inteligência. A versão “Thinking”, em particular, se destaca no raciocínio com múltiplas imagens e na supressão de alucinações.
2. Avanço em eficiência: densidade inteligente extrema na borda
Para lidar com as restrições de memória na implantação na borda, o MiniCPM-V4.6 foi profundamente otimizado para velocidade de inferência e eficiência de recursos.
Baixo consumo de memória: os requisitos de memória caem para apenas 6 GB, permitindo uma operação suave em smartphones comuns, PCs e dispositivos domésticos inteligentes.
Eficiência de inferência: Com tecnologia vLLM, a taxa de processamento de inferência é 1,5 vez maior que a dos concorrentes. Ao processar uma imagem de ultra-alta definição de 3136² na borda, a latência da primeira resposta é de apenas 75,7 ms— 2,2 vezes mais rápida que os modelos concorrentes.
Taxa de processamento: uma única GPU gera texto a uma taxa de 7.013 tokens por segundo e pode processar imagens de 1.344² a uma taxa de 54,79 imagens por segundo, demonstrando eficiência notável.
3. Tecnologia central: LLaVA-UHD v4 minimiza a sobrecarga
O design leve do modelo é possibilitado pelo LLaVA-UHD v4, desenvolvido em conjunto pela Mingshi Intelligence e pela Universidade de Tsinghua.
Reestruturação da codificação: Por meio de um módulo renovado de codificação de imagem ViT e de compressão superficial, a sobrecarga da codificação de imagem é reduzida em 50% e as operações de ponto flutuante de alta resolução em 55,8%.
Compressão híbrida: introduz uma compressão híbrida de tokens 4×/16× que permite a alternância flexível entre os modos “desempenho em primeiro lugar” e “velocidade em primeiro lugar”. Essa tecnologia foi validada no modelo de recomendação OneRec da Kuaishou, que lida com tráfego massivo.
4. Implantação no ecossistema: do laboratório à indústria
O lançamento do MiniCPM-V4.6 como código aberto marca um marco tanto técnico quanto para o ecossistema.
Fácil desenvolvimento: integra-se perfeitamente a frameworks de ajuste fino, como ms-swift e LLaMA-Factory, permitindo o ajuste fino em escala real em uma única GPU RTX 4090.
Suporte multiplataforma: Compatível com vLLM, Ollama e outras estruturas importantes, oferece versões de teste para iOS, Android e HarmonyOS, levando a IA a uma gama mais ampla de hardware.
Impacto no mundo real: a série de modelos já está implantada nos setores automotivo, de PCs, de casas inteligentes e de inspeção industrial, com parceiros como Lenovo, Geely, SAIC Volkswagen, Xiaomi e OPPO.
Artigo relacionado
Equipe de Li Feifei revela método para gerar campos de treinamento infinitos para robôs a partir de um único vídeo
Na inteligência incorporada, superar a lacuna entre a simulação e a realidade — conhecida como “Sim2Real” — tem sido, há muito tempo, um obstáculo persistente. As configurações de simulação são caras,
Relatório da Adobe Creator: 80% afirmam que a IA impulsiona o crescimento da base de fãs e dos negócios
À medida que a inteligência artificial acelera sua expansão global, o setor de criação de conteúdo passa por uma transformação fundamental. As ferramentas criativas de IA não são mais apenas facilitad
O Google declara-se um grande jogador no design de IA
Na sua conferência anual I/O na terça-feira, a Google apresentou o Pics, uma nova ferramenta de design e criação de imagens impulsionada por IA para o Google Workspace. A empresa afirma que o aplicativo foi desenvolvido para ser acessível, atendendo
Recomendações de tópicos especiais relacionados
Comentários (0)
Em 11 de maio, a Mingshi Intelligence uniu forças com a Universidade de Tsinghua e a comunidade de código aberto OpenBMB para apresentar o novo modelo multimodal de grande porte para a borda, o MiniCPM-V4.6. Apesar de seu tamanho compacto — com apenas 1,3 bilhão de parâmetros —, esse modelo leve ultrapassa os limites dos modelos maiores graças à sua excepcional densidade de inteligência e adaptabilidade entre plataformas, acelerando a implantação da IA na borda no mundo real.

1. Desempenho máximo: 1,3 bilhão de parâmetros proporcionam resultados excepcionais
O MiniCPM-V4.6 está disponível em duas versões — Instruct e Thinking —, ambas demonstrando raciocínio e compreensão impressionantes em vários benchmarks quando comparadas a modelos de tamanho semelhante.
Liderança global: no ranking da Artificial Analysis (AA), o MiniCPM-V4.6 obteve impressionantes 13 pontos, superando de longe rivais de tamanho semelhante (por exemplo, o Qwen3.5-0.8B do Alibaba e o Gemma4-E2B-it do Google), ao mesmo tempo em que quase igualou o desempenho de modelos maiores, como o Qwen3.5-2B. Isso estabelece um novo padrão de referência para modelos com 1 bilhão de parâmetros.
Recursos avançados: Desde a compreensão geral de imagem-texto e o raciocínio matemático complexo em STEM até o exigente reconhecimento óptico de caracteres (OCR) em documentos e a compreensão temporal de vídeos, o modelo demonstra forte inteligência. A versão “Thinking”, em particular, se destaca no raciocínio com múltiplas imagens e na supressão de alucinações.
2. Avanço em eficiência: densidade inteligente extrema na borda
Para lidar com as restrições de memória na implantação na borda, o MiniCPM-V4.6 foi profundamente otimizado para velocidade de inferência e eficiência de recursos.
Baixo consumo de memória: os requisitos de memória caem para apenas 6 GB, permitindo uma operação suave em smartphones comuns, PCs e dispositivos domésticos inteligentes.
Eficiência de inferência: Com tecnologia vLLM, a taxa de processamento de inferência é 1,5 vez maior que a dos concorrentes. Ao processar uma imagem de ultra-alta definição de 3136² na borda, a latência da primeira resposta é de apenas 75,7 ms— 2,2 vezes mais rápida que os modelos concorrentes.
Taxa de processamento: uma única GPU gera texto a uma taxa de 7.013 tokens por segundo e pode processar imagens de 1.344² a uma taxa de 54,79 imagens por segundo, demonstrando eficiência notável.
3. Tecnologia central: LLaVA-UHD v4 minimiza a sobrecarga
O design leve do modelo é possibilitado pelo LLaVA-UHD v4, desenvolvido em conjunto pela Mingshi Intelligence e pela Universidade de Tsinghua.
Reestruturação da codificação: Por meio de um módulo renovado de codificação de imagem ViT e de compressão superficial, a sobrecarga da codificação de imagem é reduzida em 50% e as operações de ponto flutuante de alta resolução em 55,8%.
Compressão híbrida: introduz uma compressão híbrida de tokens 4×/16× que permite a alternância flexível entre os modos “desempenho em primeiro lugar” e “velocidade em primeiro lugar”. Essa tecnologia foi validada no modelo de recomendação OneRec da Kuaishou, que lida com tráfego massivo.
4. Implantação no ecossistema: do laboratório à indústria
O lançamento do MiniCPM-V4.6 como código aberto marca um marco tanto técnico quanto para o ecossistema.
Fácil desenvolvimento: integra-se perfeitamente a frameworks de ajuste fino, como ms-swift e LLaMA-Factory, permitindo o ajuste fino em escala real em uma única GPU RTX 4090.
Suporte multiplataforma: Compatível com vLLM, Ollama e outras estruturas importantes, oferece versões de teste para iOS, Android e HarmonyOS, levando a IA a uma gama mais ampla de hardware.
Impacto no mundo real: a série de modelos já está implantada nos setores automotivo, de PCs, de casas inteligentes e de inspeção industrial, com parceiros como Lenovo, Geely, SAIC Volkswagen, Xiaomi e OPPO.
Equipe de Li Feifei revela método para gerar campos de treinamento infinitos para robôs a partir de um único vídeo
Na inteligência incorporada, superar a lacuna entre a simulação e a realidade — conhecida como “Sim2Real” — tem sido, há muito tempo, um obstáculo persistente. As configurações de simulação são caras,
Relatório da Adobe Creator: 80% afirmam que a IA impulsiona o crescimento da base de fãs e dos negócios
À medida que a inteligência artificial acelera sua expansão global, o setor de criação de conteúdo passa por uma transformação fundamental. As ferramentas criativas de IA não são mais apenas facilitad
O Google declara-se um grande jogador no design de IA
Na sua conferência anual I/O na terça-feira, a Google apresentou o Pics, uma nova ferramenta de design e criação de imagens impulsionada por IA para o Google Workspace. A empresa afirma que o aplicativo foi desenvolvido para ser acessível, atendendo











