Heim
Die Ant Group stellt die Open-Source-Version „Ling-2.6-flash“ vor, ein neues Mitglied der Baoling-Modellfamilie
Die Baoling-Großmodellreihe der Ant Group hat heute ein umfangreiches Update erhalten: Ling-2.6-flash steht Entwicklern weltweit nun offiziell zur Verfügung. Um unterschiedlichen Hardwareumgebungen gerecht zu werden und die Einführungshürden zu senken, wurden mit diesem Modell auch mehrere Präzisionsversionen eingeführt, darunter BF16, FP8 und INT4, die Entwicklern flexiblere Inferenzoptionen bieten.
Als Instruct-Modell mit insgesamt 104 Milliarden Parametern und 7,4 Milliarden aktivierten Parametern wurde Ling-2.6-flash zuvor unter dem Codenamen „Elephant Alpha“ auf der OpenRouter-Plattform getestet. Während eines zweiwöchigen Tests sammelte das Entwicklungsteam umfangreiches Feedback aus der Praxis und nahm gezielte Optimierungen vor, wobei insbesondere die Flüssigkeit beim Wechsel zwischen chinesischem und englischem Code verbessert und die Kompatibilität mit gängigen Programmier-Frameworks erhöht wurde.

Technische Highlights: Hybride Architektur und überragende Effizienz
Die Kernstärkevon Ling-2.6-flash liegt in seiner einzigartigen Architektur und hohen Betriebseffizienz:
Hybride lineare Architektur: Durch rechnerische Optimierungen auf niedriger Ebene erreicht das Modell eine hervorragende Inferenzgeschwindigkeit. Mit 4 H20-Karten erreicht es bis zu 340 Token/s. Beim Prefill-Durchsatz liefert es das 2,2-Fache von Nemotron-3-Super und reduziert so die Antwortlatenz erheblich.
Bemerkenswerte Token-Effizienz: Das Team hat die Token-Effizienz während des Trainings sorgfältig kalibriert. Auswertungsdaten zeigen, dass Ling-2.6-flash für Aufgaben gleicher Qualität nur etwa 15 Millionen Token verbraucht – etwa ein Zehntel vergleichbarer Wettbewerber –, was die kommerziellen Kosten erheblich senkt.
Vertiefung der Szenarien: Gezielte Verbesserungen der Agentenfähigkeiten
Für Agentenszenarien – einen der häufigsten Anwendungsfälle für große Modelle – wurdeLing-2.6-flash speziell verbessert. Ob bei der Abwicklung komplexer Tool-Aufrufe, der mehrstufigen Planung oder der endgültigen Aufgabenausführung: Das Modell arbeitet zuverlässig. In mehreren branchenüblichen Bewertungen wie BFCL-V4 und SWE-bench weist Ling-2.6-flash selbst im Vergleich zu Modellen mit einer größeren Anzahl aktivierter Parameter eine vergleichbare oder sogar State-of-the-Art (SOTA)-Leistung auf.
Entwickler können nun über Hugging Face und ModelScope (Moba Community) auf die Open-Source-Ressourcen des Modells zugreifen, was eine weitere Erforschung seines Potenzials in verschiedenen industriellen Anwendungen ermöglicht.
Verwandter Artikel
DeepMind-CEO Hassabis: Ich schlafe sechs Stunden pro Tag und fühle mich normalerweise gegen 1 Uhr nachts energiegeladen.
Fortune hat kürzlich ein Interview mit Demis Hassabis, dem CEO von Google DeepMind, veröffentlicht, das seinen unkonventionellen Ansatz zu Erholung und Produktivität offenbart. Hassabis gab bekannt, dass er sehr wenig schläft und seine wachen Stunden
OpenAI und Anthropic kämpfen trotz Umsatzrückgängen um Marktanteile
Obwohl jüngste Berichte darauf hindeuten, dass OpenAI seine Umsatzziele verfehlt hat, was an diesem Dienstag Druck auf die Technologieaktien ausübte, zeigen sich private Investoren in KI-Labore weiter
Einhaltung der Vorschriften für autonome Fahrzeuge in Kalifornien: Eine neue Ära von Bußgeldern, Geofences und 1 Million Meilen
Guident betreibt einen AuveTech-Shuttle in Südflorida und verwaltet mithilfe seiner Fernüberwachungstechnologie eine vier Meilen lange Strecke in West Palm Beach sowie eine eine Meile lange Strecke in
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Die Baoling-Großmodellreihe der Ant Group hat heute ein umfangreiches Update erhalten:
Als Instruct-Modell mit insgesamt 104 Milliarden Parametern und 7,4 Milliarden aktivierten Parametern wurde

Technische Highlights: Hybride Architektur und überragende Effizienz
Die Kernstärke
Hybride lineare Architektur: Durch rechnerische Optimierungen auf niedriger Ebene erreicht das Modell eine hervorragende Inferenzgeschwindigkeit. Mit 4 H20-Karten erreicht es bis zu 340 Token/s. Beim Prefill-Durchsatz liefert es das 2,2-Fache von Nemotron-3-Super und reduziert so die Antwortlatenz erheblich.
Bemerkenswerte Token-Effizienz: Das Team hat die Token-Effizienz während des Trainings sorgfältig kalibriert. Auswertungsdaten zeigen, dass
Vertiefung der Szenarien: Gezielte Verbesserungen der Agentenfähigkeiten
Für Agentenszenarien – einen der häufigsten Anwendungsfälle für große Modelle – wurde
Entwickler können nun über Hugging Face und ModelScope (Moba Community) auf die Open-Source-Ressourcen des Modells zugreifen, was eine weitere Erforschung seines Potenzials in verschiedenen industriellen Anwendungen ermöglicht.
DeepMind-CEO Hassabis: Ich schlafe sechs Stunden pro Tag und fühle mich normalerweise gegen 1 Uhr nachts energiegeladen.
Fortune hat kürzlich ein Interview mit Demis Hassabis, dem CEO von Google DeepMind, veröffentlicht, das seinen unkonventionellen Ansatz zu Erholung und Produktivität offenbart. Hassabis gab bekannt, dass er sehr wenig schläft und seine wachen Stunden
OpenAI und Anthropic kämpfen trotz Umsatzrückgängen um Marktanteile
Obwohl jüngste Berichte darauf hindeuten, dass OpenAI seine Umsatzziele verfehlt hat, was an diesem Dienstag Druck auf die Technologieaktien ausübte, zeigen sich private Investoren in KI-Labore weiter











