Heim
Der „1.3B Model Dimension Reduction Attack“ von MiniCPM-V 4.6 setzt neue Maßstäbe in der multimodalen Edge-Technologie
Am 11. Mai stellte Mingshi Intelligence gemeinsam mit der Tsinghua-Universität und der Open-Source-Community OpenBMB das neue multimodale Großmodell MiniCPM-V4.6 für den Einsatz am Edge vor. Trotz seiner kompakten Größe – nur 1,3 Milliarden Parameter – setzt dieses schlanke Modell durch seine außergewöhnliche intelligente Dichte und plattformübergreifende Anpassungsfähigkeit neue Maßstäbe für größere Modelle und beschleunigt so den praktischen Einsatz von Edge-KI.

1. Spitzenleistung: 1,3 Milliarden Parameter liefern außergewöhnliche Ergebnisse
MiniCPM-V4.6 ist in zwei Versionen erhältlich – „Instruct“ und „Thinking“ –, die im Vergleich zu Modellen ähnlicher Größe in verschiedenen Benchmarks beeindruckende Schlussfolgerungs- und Verständnisfähigkeiten zeigen.
Weltweite Spitzenposition: Auf der Rangliste von Artificial Analysis (AA) erzielte MiniCPM-V4.6 beeindruckende 13 Punkte und übertraf damit Konkurrenten ähnlicher Größe (z. B. Alibabas Qwen3.5-0.8B und Googles Gemma4-E2B-it) bei weitem, während es fast an die Leistung größerer Modelle wie Qwen3.5-2B heranreichte. Damit wird ein neuer Maßstab für Modelle mit 1 Milliarde Parametern gesetzt.
Fortschrittliche Fähigkeiten: Vom allgemeinen Bild-Text-Verständnis über komplexes mathematisches Schlussfolgern im MINT-Bereich bis hin zu anspruchsvoller Dokumenten-OCR und dem zeitlichen Verständnis von Videos zeigt das Modell eine hohe Intelligenz. Insbesondere die „Thinking“-Version zeichnet sich durch hervorragendes Schlussfolgern bei mehreren Bildern und die Unterdrückung von Halluzinationen aus.
2. Durchbruch bei der Effizienz: Extreme intelligente Dichte am Edge
Um Speicherengpässe beim Edge-Einsatz zu bewältigen, wurde MiniCPM-V4.6 umfassend hinsichtlich Inferenzgeschwindigkeit und Ressourceneffizienz optimiert.
Geringer Speicherbedarf: Der Speicherbedarf sinkt auf nur 6 GB, was einen reibungslosen Betrieb auf gängigen Smartphones, PCs und Smart-Home-Geräten ermöglicht.
Inferenz-Effizienz: Dank vLLM beträgt der Inferenz-Durchsatz das 1,5-Fache des Wertes bei Mitbewerbern. Bei der Verarbeitung eines ultrahochauflösenden Bildes mit einer Größe von 3136² am Edge beträgt die Latenz der ersten Antwort nur 75,7 ms– das ist 2,2-mal schneller als bei Konkurrenzmodellen.
Durchsatz: Eine einzelne GPU liefert eine Textgenerierung von 7.013 Tokens pro Sekunde und kann 1.344² Bilder mit einer Geschwindigkeit von 54,79 Bildern pro Sekunde verarbeiten, was eine bemerkenswerte Effizienz demonstriert.
3. Kerntechnologie: LLaVA-UHD v4 minimiert den Overhead
Das schlanke Design des Modells wird durch LLaVA-UHD v4 ermöglicht, das gemeinsam von Mingshi Intelligence und der Tsinghua-Universität entwickelt wurde.
Neugestaltung der Kodierung: Durch ein überarbeitetes ViT-Bildkodierungs- und flaches Kompressionsmodul wird der Overhead bei der Bildkodierung um 50 % und bei hochauflösenden Gleitkommaoperationen um 55,8 % reduziert .
Hybride Kompression: Es wird eine 4×/16×-Hybrid-Token-Kompression eingeführt, die einen flexiblen Wechsel zwischen den Modi „Performance-First“ und „Speed-First“ ermöglicht. Diese Technologie wurde im Empfehlungsmodell OneRec von Kuaishou validiert, das enormen Datenverkehr bewältigt.
4. Einsatz im Ökosystem: Vom Labor in die Industrie
Die Open-Source-Veröffentlichung von MiniCPM-V4.6 markiert sowohl einen technischen als auch einen Meilenstein für das Ökosystem.
Einfache Entwicklung: Es lässt sich nahtlos in Fine-Tuning-Frameworks wie ms-swift und LLaMA-Factory integrieren und ermöglicht so ein umfassendes Fine-Tuning auf einer einzigen RTX 4090-GPU.
Plattformübergreifende Unterstützung: Kompatibel mit vLLM, Ollama und anderen wichtigen Frameworks bietet es Testversionen für iOS, Android und HarmonyOS und macht KI damit für eine breitere Palette an Hardware zugänglich.
Praktische Auswirkungen: Die Modellreihe wird bereits in den Bereichen Automobil, PC, Smart Home und industrielle Inspektion eingesetzt, unter anderem bei Partnern wie Lenovo, Geely, SAIC Volkswagen, Xiaomi und OPPO.
Verwandter Artikel
Li Feifeis Team stellt eine Methode vor, mit der sich aus einem einzigen Video unendlich viele Trainingsumgebungen für Roboter generieren lassen
Im Bereich der verkörperten Intelligenz stellt die Überbrückung der Kluft zwischen Simulation und Realität – bekannt als „Sim2Real“ – seit langem eine hartnäckige Hürde dar. Simulationsumgebungen sind
Adobe Creator-Bericht: 80 % geben an, dass KI das Wachstum der Fangemeinde und des Unternehmens vorantreibt
Da sich die weltweite Verbreitung künstlicher Intelligenz immer weiter beschleunigt, erlebt die Branche der Inhaltserstellung einen grundlegenden Wandel. Kreative KI-Tools dienen nicht mehr nur der Op
Google bezeichnet sich als wichtigen Akteur im Bereich des KI-Designs
Auf seiner jährlichen I/O-Konferenz am Dienstag stellte Google Pics vor, ein neues KI-gestütztes Design- und Bildcreation-Tool für Google Workspace. Das Unternehmen gibt an, dass die App für Barrierefreiheit entwickelt wurde und sich an alle richtet,
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Am 11. Mai stellte Mingshi Intelligence gemeinsam mit der Tsinghua-Universität und der Open-Source-Community OpenBMB das neue multimodale Großmodell MiniCPM-V4.6 für den Einsatz am Edge vor. Trotz seiner kompakten Größe – nur 1,3 Milliarden Parameter – setzt dieses schlanke Modell durch seine außergewöhnliche intelligente Dichte und plattformübergreifende Anpassungsfähigkeit neue Maßstäbe für größere Modelle und beschleunigt so den praktischen Einsatz von Edge-KI.

1. Spitzenleistung: 1,3 Milliarden Parameter liefern außergewöhnliche Ergebnisse
MiniCPM-V4.6 ist in zwei Versionen erhältlich – „Instruct“ und „Thinking“ –, die im Vergleich zu Modellen ähnlicher Größe in verschiedenen Benchmarks beeindruckende Schlussfolgerungs- und Verständnisfähigkeiten zeigen.
Weltweite Spitzenposition: Auf der Rangliste von Artificial Analysis (AA) erzielte MiniCPM-V4.6 beeindruckende 13 Punkte und übertraf damit Konkurrenten ähnlicher Größe (z. B. Alibabas Qwen3.5-0.8B und Googles Gemma4-E2B-it) bei weitem, während es fast an die Leistung größerer Modelle wie Qwen3.5-2B heranreichte. Damit wird ein neuer Maßstab für Modelle mit 1 Milliarde Parametern gesetzt.
Fortschrittliche Fähigkeiten: Vom allgemeinen Bild-Text-Verständnis über komplexes mathematisches Schlussfolgern im MINT-Bereich bis hin zu anspruchsvoller Dokumenten-OCR und dem zeitlichen Verständnis von Videos zeigt das Modell eine hohe Intelligenz. Insbesondere die „Thinking“-Version zeichnet sich durch hervorragendes Schlussfolgern bei mehreren Bildern und die Unterdrückung von Halluzinationen aus.
2. Durchbruch bei der Effizienz: Extreme intelligente Dichte am Edge
Um Speicherengpässe beim Edge-Einsatz zu bewältigen, wurde MiniCPM-V4.6 umfassend hinsichtlich Inferenzgeschwindigkeit und Ressourceneffizienz optimiert.
Geringer Speicherbedarf: Der Speicherbedarf sinkt auf nur 6 GB, was einen reibungslosen Betrieb auf gängigen Smartphones, PCs und Smart-Home-Geräten ermöglicht.
Inferenz-Effizienz: Dank vLLM beträgt der Inferenz-Durchsatz das 1,5-Fache des Wertes bei Mitbewerbern. Bei der Verarbeitung eines ultrahochauflösenden Bildes mit einer Größe von 3136² am Edge beträgt die Latenz der ersten Antwort nur 75,7 ms– das ist 2,2-mal schneller als bei Konkurrenzmodellen.
Durchsatz: Eine einzelne GPU liefert eine Textgenerierung von 7.013 Tokens pro Sekunde und kann 1.344² Bilder mit einer Geschwindigkeit von 54,79 Bildern pro Sekunde verarbeiten, was eine bemerkenswerte Effizienz demonstriert.
3. Kerntechnologie: LLaVA-UHD v4 minimiert den Overhead
Das schlanke Design des Modells wird durch LLaVA-UHD v4 ermöglicht, das gemeinsam von Mingshi Intelligence und der Tsinghua-Universität entwickelt wurde.
Neugestaltung der Kodierung: Durch ein überarbeitetes ViT-Bildkodierungs- und flaches Kompressionsmodul wird der Overhead bei der Bildkodierung um 50 % und bei hochauflösenden Gleitkommaoperationen um 55,8 % reduziert .
Hybride Kompression: Es wird eine 4×/16×-Hybrid-Token-Kompression eingeführt, die einen flexiblen Wechsel zwischen den Modi „Performance-First“ und „Speed-First“ ermöglicht. Diese Technologie wurde im Empfehlungsmodell OneRec von Kuaishou validiert, das enormen Datenverkehr bewältigt.
4. Einsatz im Ökosystem: Vom Labor in die Industrie
Die Open-Source-Veröffentlichung von MiniCPM-V4.6 markiert sowohl einen technischen als auch einen Meilenstein für das Ökosystem.
Einfache Entwicklung: Es lässt sich nahtlos in Fine-Tuning-Frameworks wie ms-swift und LLaMA-Factory integrieren und ermöglicht so ein umfassendes Fine-Tuning auf einer einzigen RTX 4090-GPU.
Plattformübergreifende Unterstützung: Kompatibel mit vLLM, Ollama und anderen wichtigen Frameworks bietet es Testversionen für iOS, Android und HarmonyOS und macht KI damit für eine breitere Palette an Hardware zugänglich.
Praktische Auswirkungen: Die Modellreihe wird bereits in den Bereichen Automobil, PC, Smart Home und industrielle Inspektion eingesetzt, unter anderem bei Partnern wie Lenovo, Geely, SAIC Volkswagen, Xiaomi und OPPO.
Li Feifeis Team stellt eine Methode vor, mit der sich aus einem einzigen Video unendlich viele Trainingsumgebungen für Roboter generieren lassen
Im Bereich der verkörperten Intelligenz stellt die Überbrückung der Kluft zwischen Simulation und Realität – bekannt als „Sim2Real“ – seit langem eine hartnäckige Hürde dar. Simulationsumgebungen sind
Adobe Creator-Bericht: 80 % geben an, dass KI das Wachstum der Fangemeinde und des Unternehmens vorantreibt
Da sich die weltweite Verbreitung künstlicher Intelligenz immer weiter beschleunigt, erlebt die Branche der Inhaltserstellung einen grundlegenden Wandel. Kreative KI-Tools dienen nicht mehr nur der Op
Google bezeichnet sich als wichtigen Akteur im Bereich des KI-Designs
Auf seiner jährlichen I/O-Konferenz am Dienstag stellte Google Pics vor, ein neues KI-gestütztes Design- und Bildcreation-Tool für Google Workspace. Das Unternehmen gibt an, dass die App für Barrierefreiheit entwickelt wurde und sich an alle richtet,











