Heim
AntGroup stellt Ling-3.0-flash-VL vor, ein nativer multimodaler Großmodell mit 124 Milliarden Parametern

Das Ant Open Source Team hat offiziell Ling-3.0-flash-VL veröffentlicht, das erste native multimodale Großmodell der Bailing-Serie. Basierend auf der MoE-Architektur von Ling-3.0-flash verfügt dieses Modell über 124 Milliarden Gesamtparameter, wobei pro Inferenz nur 5,5 Milliarden aktiviert werden. Es unterstützt nativ Bild-, Text- und Videoeingaben innerhalb eines Kontextfensters von 256K Token.
Während der Entwicklung legte das Team besonderen Wert auf die Verbesserung der Zuverlässigkeit und Effizienz von Großmodellen in realen Aufgaben. Angesichts der in der Branche geäußerten Bedenken, dass die Hinzufügung visueller Fähigkeiten die Textintelligenz verschlechtern könnte, widerlegten die Trainingsergebnis dies: Das native multimodale gemeinsame Training erweiterte nicht nur die Anwendungsgrenzen, sondern steigerte auch die Textintelligenz weiter.
Um eine präzise Ausführung sicherzustellen, führt Ling-3.0-flash-VL einen innovativen visuellen Feedbackmechanismus ein. Durch die Implementierung eines geschlossenen Kreislaufs aus Beobachten der Ergebnisse, Vergleichen mit den Zielen, Identifizieren von Abweichungen und kontinuierlicher Korrektur wechselt das Modell von statischer Generierung zu dynamischer Selbstkorrektur, was die Zuverlässigkeit der Ergebnisse erheblich verbessert.
Darüber hinaus behält das Modell die Kernstärke von Ling-3.0-flash als effizienten Ausführungsknoten in Agent-Workflows bei. Innerhalb visueller Feedbackschleifen balanciert es Output-Qualität und Ausführungseffizienz perfekt aus, wodurch komplexe Aufgaben schneller und zu geringeren Kosten abgeschlossen werden können.
Verwandter Artikel
OpenAI verschiebt Börsengang auf 2027 angesichts Börsenwert von 1,2 Billionen Dollar
OpenAI, der Pionier der künstlichen Intelligenz, verhandelt derzeit mit Investoren über eine private Finanzierung, um eine beeindruckende Bewertung von 1,2 Billionen US-Dollar zu erreichen. Diese Zahl markiert einen dramatischen Sprung von der Bewert
Microsoft Classic Outlook integriert Copilot-KI zum Verfassen von E-Mails unter Windows 10 und 11
Windows Latest berichtet, dass Microsoft beabsichtigt, das Copilot-Update bis Ende 2026 für das klassische Outlook unter Windows 10 und 11 bereitzustellen und dabei eine Funktion zum „Entwerfen von E-
Die „Seedance“-KI von Volcano Engine verlagert ihren Schwerpunkt vom Urheberrechtsschutz auf die Vermarktung geistigen Eigentums
Yule Capital berichtet, dass die „Huoshan Engine“ von ByteDance mehrere Urheberrechtsinhaber eingeladen hat, ihre neue „KI-Plattform für das Urheberrechtsmanagement“ im Rahmen eines Beta-Tests zu test
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

Das Ant Open Source Team hat offiziell Ling-3.0-flash-VL veröffentlicht, das erste native multimodale Großmodell der Bailing-Serie. Basierend auf der MoE-Architektur von Ling-3.0-flash verfügt dieses Modell über 124 Milliarden Gesamtparameter, wobei pro Inferenz nur 5,5 Milliarden aktiviert werden. Es unterstützt nativ Bild-, Text- und Videoeingaben innerhalb eines Kontextfensters von 256K Token.
Während der Entwicklung legte das Team besonderen Wert auf die Verbesserung der Zuverlässigkeit und Effizienz von Großmodellen in realen Aufgaben. Angesichts der in der Branche geäußerten Bedenken, dass die Hinzufügung visueller Fähigkeiten die Textintelligenz verschlechtern könnte, widerlegten die Trainingsergebnis dies: Das native multimodale gemeinsame Training erweiterte nicht nur die Anwendungsgrenzen, sondern steigerte auch die Textintelligenz weiter.
Um eine präzise Ausführung sicherzustellen, führt Ling-3.0-flash-VL einen innovativen visuellen Feedbackmechanismus ein. Durch die Implementierung eines geschlossenen Kreislaufs aus Beobachten der Ergebnisse, Vergleichen mit den Zielen, Identifizieren von Abweichungen und kontinuierlicher Korrektur wechselt das Modell von statischer Generierung zu dynamischer Selbstkorrektur, was die Zuverlässigkeit der Ergebnisse erheblich verbessert.
Darüber hinaus behält das Modell die Kernstärke von Ling-3.0-flash als effizienten Ausführungsknoten in Agent-Workflows bei. Innerhalb visueller Feedbackschleifen balanciert es Output-Qualität und Ausführungseffizienz perfekt aus, wodurch komplexe Aufgaben schneller und zu geringeren Kosten abgeschlossen werden können.
OpenAI verschiebt Börsengang auf 2027 angesichts Börsenwert von 1,2 Billionen Dollar
OpenAI, der Pionier der künstlichen Intelligenz, verhandelt derzeit mit Investoren über eine private Finanzierung, um eine beeindruckende Bewertung von 1,2 Billionen US-Dollar zu erreichen. Diese Zahl markiert einen dramatischen Sprung von der Bewert
Microsoft Classic Outlook integriert Copilot-KI zum Verfassen von E-Mails unter Windows 10 und 11
Windows Latest berichtet, dass Microsoft beabsichtigt, das Copilot-Update bis Ende 2026 für das klassische Outlook unter Windows 10 und 11 bereitzustellen und dabei eine Funktion zum „Entwerfen von E-
Die „Seedance“-KI von Volcano Engine verlagert ihren Schwerpunkt vom Urheberrechtsschutz auf die Vermarktung geistigen Eigentums
Yule Capital berichtet, dass die „Huoshan Engine“ von ByteDance mehrere Urheberrechtsinhaber eingeladen hat, ihre neue „KI-Plattform für das Urheberrechtsmanagement“ im Rahmen eines Beta-Tests zu test











