Hogar
El ataque de reducción de dimensiones del modelo 1.3B de MiniCPM-V 4.6 redefine la tecnología multimodal de vanguardia
El 11 de mayo, Mingshi Intelligence se asoció con la Universidad de Tsinghua y la comunidad de código abierto OpenBMB para presentar el nuevo modelo multimodal de gran tamaño para el borde de red MiniCPM-V4.6. A pesar de su tamaño compacto —solo 1.3 mil millones de parámetros—, este modelo ligero supera los límites de los modelos más grandes gracias a su excepcional densidad inteligente y su adaptabilidad multiplataforma, lo que acelera la implantación en el mundo real de la IA en el borde de la red.

1. Rendimiento máximo: 1.3B de parámetros ofrecen resultados excepcionales
MiniCPM-V4.6 está disponible en dos versiones —Instruct y Thinking—; ambas demuestran una capacidad de razonamiento y comprensión impresionantes en diversas pruebas de rendimiento en comparación con modelos de tamaño similar.
Liderazgo mundial: en la clasificación de Artificial Analysis (AA), MiniCPM-V4.6 obtuvo una impresionante puntuación de 13 puntos, superando con creces a rivales de tamaño similar (por ejemplo, el Qwen3.5-0.8B de Alibaba y el Gemma4-E2B-it de Google), al tiempo que casi igualaba el rendimiento de modelos más grandes como el Qwen3.5-2B. Esto establece un nuevo punto de referencia para los modelos de 1B de parámetros.
Capacidades avanzadas: Desde la comprensión general de imágenes y texto y el razonamiento matemático complejo en el ámbito de las ciencias, la tecnología y las matemáticas (STEM), hasta el exigente reconocimiento óptico de caracteres (OCR) en documentos y la comprensión temporal de vídeos, el modelo muestra una gran inteligencia. La versión «Thinking», en particular, destaca en el razonamiento con múltiples imágenes y la supresión de alucinaciones.
2. Avance en eficiencia: densidad inteligente extrema en el borde
Para hacer frente a las limitaciones de memoria en el despliegue en el borde, MiniCPM-V4.6 se ha optimizado en profundidad para mejorar la velocidad de inferencia y la eficiencia de los recursos.
Bajo consumo de memoria: los requisitos de memoria se reducen a tan solo 6 GB, lo que permite un funcionamiento fluido en smartphones, ordenadores personales y dispositivos domésticos inteligentes convencionales.
Eficiencia en la inferencia: gracias a la tecnología vLLM, el rendimiento de la inferencia es 1,5 veces superior al de la competencia. Al procesar una imagen de ultra alta definición de 3136² en el borde, la latencia de la primera respuesta es de tan solo 75,7 ms, lo que supone una velocidad 2,2 veces superior a la de los modelos de la competencia.
Rendimiento: una sola GPU genera texto a un ritmo de 7 013 tokens por segundo y puede procesar imágenes de 1 344² a una velocidad de 54,79 imágenes por segundo, lo que demuestra una eficiencia extraordinaria.
3. Tecnología principal: LLaVA-UHD v4 minimiza la sobrecarga
El diseño ligero del modelo es posible gracias a LLaVA-UHD v4, desarrollado conjuntamente por Mingshi Intelligence y la Universidad de Tsinghua.
Rediseño de la codificación: gracias a un módulo renovado de codificación de imágenes ViT y de compresión superficial, la sobrecarga de la codificación de imágenes se reduce en un 50 % y las operaciones de punto flotante de alta resolución, en un 55,8 %.
Compresión híbrida: introduce una compresión híbrida de tokens 4×/16× que permite alternar de forma flexible entre los modos «rendimiento primero» y «velocidad primero». Esta tecnología ha sido validada en el modelo de recomendación OneRec de Kuaishou, que gestiona un tráfico masivo.
4. Implantación en el ecosistema: del laboratorio a la industria
El lanzamiento en código abierto de MiniCPM-V4.6 supone un hito tanto técnico como para el ecosistema.
Fácil desarrollo: Se integra a la perfección con marcos de ajuste fino como ms-swift y LLaMA-Factory, lo que permite un ajuste fino a gran escala en una sola GPU RTX 4090.
Compatibilidad multiplataforma: compatible con vLLM, Ollama y otros marcos importantes, ofrece versiones de prueba para iOS, Android y HarmonyOS, lo que lleva la IA a una gama más amplia de hardware.
Impacto en el mundo real: La serie de modelos ya se ha implementado en los sectores de la automoción, los ordenadores personales, los hogares inteligentes y la inspección industrial, con socios como Lenovo, Geely, SAIC Volkswagen, Xiaomi y OPPO.
Artículo relacionado
El equipo de Li Feifei presenta un método para generar campos de entrenamiento infinitos para robots a partir de un único vídeo
En el ámbito de la inteligencia incorporada, salvar la brecha entre la simulación y la realidad —lo que se conoce como «Sim2Real»— ha sido durante mucho tiempo un obstáculo persistente. Los entornos d
Informe de Adobe Creator: el 80 % afirma que la IA impulsa el crecimiento de la base de seguidores y del negocio
A medida que la inteligencia artificial acelera su expansión global, el sector de la creación de contenidos está experimentando un cambio fundamental. Las herramientas creativas de IA ya no son solo h
Google se declara un actor principal en el diseño de IA
En su conferencia anual I/O del martes, Google presentó Pics, una nueva herramienta de diseño y creación de imágenes impulsada por inteligencia artificial para Google Workspace. La empresa afirma que la aplicación está diseñada para ser accesible, di
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
El 11 de mayo, Mingshi Intelligence se asoció con la Universidad de Tsinghua y la comunidad de código abierto OpenBMB para presentar el nuevo modelo multimodal de gran tamaño para el borde de red MiniCPM-V4.6. A pesar de su tamaño compacto —solo 1.3 mil millones de parámetros—, este modelo ligero supera los límites de los modelos más grandes gracias a su excepcional densidad inteligente y su adaptabilidad multiplataforma, lo que acelera la implantación en el mundo real de la IA en el borde de la red.

1. Rendimiento máximo: 1.3B de parámetros ofrecen resultados excepcionales
MiniCPM-V4.6 está disponible en dos versiones —Instruct y Thinking—; ambas demuestran una capacidad de razonamiento y comprensión impresionantes en diversas pruebas de rendimiento en comparación con modelos de tamaño similar.
Liderazgo mundial: en la clasificación de Artificial Analysis (AA), MiniCPM-V4.6 obtuvo una impresionante puntuación de 13 puntos, superando con creces a rivales de tamaño similar (por ejemplo, el Qwen3.5-0.8B de Alibaba y el Gemma4-E2B-it de Google), al tiempo que casi igualaba el rendimiento de modelos más grandes como el Qwen3.5-2B. Esto establece un nuevo punto de referencia para los modelos de 1B de parámetros.
Capacidades avanzadas: Desde la comprensión general de imágenes y texto y el razonamiento matemático complejo en el ámbito de las ciencias, la tecnología y las matemáticas (STEM), hasta el exigente reconocimiento óptico de caracteres (OCR) en documentos y la comprensión temporal de vídeos, el modelo muestra una gran inteligencia. La versión «Thinking», en particular, destaca en el razonamiento con múltiples imágenes y la supresión de alucinaciones.
2. Avance en eficiencia: densidad inteligente extrema en el borde
Para hacer frente a las limitaciones de memoria en el despliegue en el borde, MiniCPM-V4.6 se ha optimizado en profundidad para mejorar la velocidad de inferencia y la eficiencia de los recursos.
Bajo consumo de memoria: los requisitos de memoria se reducen a tan solo 6 GB, lo que permite un funcionamiento fluido en smartphones, ordenadores personales y dispositivos domésticos inteligentes convencionales.
Eficiencia en la inferencia: gracias a la tecnología vLLM, el rendimiento de la inferencia es 1,5 veces superior al de la competencia. Al procesar una imagen de ultra alta definición de 3136² en el borde, la latencia de la primera respuesta es de tan solo 75,7 ms, lo que supone una velocidad 2,2 veces superior a la de los modelos de la competencia.
Rendimiento: una sola GPU genera texto a un ritmo de 7 013 tokens por segundo y puede procesar imágenes de 1 344² a una velocidad de 54,79 imágenes por segundo, lo que demuestra una eficiencia extraordinaria.
3. Tecnología principal: LLaVA-UHD v4 minimiza la sobrecarga
El diseño ligero del modelo es posible gracias a LLaVA-UHD v4, desarrollado conjuntamente por Mingshi Intelligence y la Universidad de Tsinghua.
Rediseño de la codificación: gracias a un módulo renovado de codificación de imágenes ViT y de compresión superficial, la sobrecarga de la codificación de imágenes se reduce en un 50 % y las operaciones de punto flotante de alta resolución, en un 55,8 %.
Compresión híbrida: introduce una compresión híbrida de tokens 4×/16× que permite alternar de forma flexible entre los modos «rendimiento primero» y «velocidad primero». Esta tecnología ha sido validada en el modelo de recomendación OneRec de Kuaishou, que gestiona un tráfico masivo.
4. Implantación en el ecosistema: del laboratorio a la industria
El lanzamiento en código abierto de MiniCPM-V4.6 supone un hito tanto técnico como para el ecosistema.
Fácil desarrollo: Se integra a la perfección con marcos de ajuste fino como ms-swift y LLaMA-Factory, lo que permite un ajuste fino a gran escala en una sola GPU RTX 4090.
Compatibilidad multiplataforma: compatible con vLLM, Ollama y otros marcos importantes, ofrece versiones de prueba para iOS, Android y HarmonyOS, lo que lleva la IA a una gama más amplia de hardware.
Impacto en el mundo real: La serie de modelos ya se ha implementado en los sectores de la automoción, los ordenadores personales, los hogares inteligentes y la inspección industrial, con socios como Lenovo, Geely, SAIC Volkswagen, Xiaomi y OPPO.
El equipo de Li Feifei presenta un método para generar campos de entrenamiento infinitos para robots a partir de un único vídeo
En el ámbito de la inteligencia incorporada, salvar la brecha entre la simulación y la realidad —lo que se conoce como «Sim2Real»— ha sido durante mucho tiempo un obstáculo persistente. Los entornos d
Informe de Adobe Creator: el 80 % afirma que la IA impulsa el crecimiento de la base de seguidores y del negocio
A medida que la inteligencia artificial acelera su expansión global, el sector de la creación de contenidos está experimentando un cambio fundamental. Las herramientas creativas de IA ya no son solo h
Google se declara un actor principal en el diseño de IA
En su conferencia anual I/O del martes, Google presentó Pics, una nueva herramienta de diseño y creación de imágenes impulsada por inteligencia artificial para Google Workspace. La empresa afirma que la aplicación está diseñada para ser accesible, di











