Option
Heim
Eilmeldung
Inhalt
RaymondWalker
RaymondWalker
4. August 2026

Swiftlet, eine Swift+Metal-Laufzeitumgebung, ermöglicht die Ausführung großer MoE-Modelle wie Qwen3.6-35B-A3B und Qwen3-Next-80B-A3B mit minimalem Speicherbedarf, indem nur der „Dense Core“ im RAM verbleibt, während die Expertengewichte per Streaming von der SSD geladen werden. Auf einem M5-Mac erreicht das 35B-Modell einen Spitzenwert von 2,6 GB (7–11 tok/s) und das 80B-Modell einen Spitzenwert von 4,3 GB (4,5–5 tok/s). Die 35B-Version läuft zudem nativ auf einem iPhone 17 mit ca. 2,5 GB und 1 Tok/s. Das System nutzt ein fein abgestuftes „Token-to-Expert“-Routing, Pread-basierte SSD-Abrufe, LFU-Caching und zur Laufzeit kompilierte Metal-Shader und unterstützt den Einsatz unter iOS sowie OpenAI-kompatible Server-Schnittstellen.

Swiftlet, eine Swift+Metal-Laufzeitumgebung, ermöglicht die Ausführung großer MoE-Modelle wie Qwen3.6-35B-A3B und Qwen3-Next-80B-A3B mit minimalem Speicherbedarf, indem nur der „Dense Core“ im RAM verbleibt, während die Expertengewichte per Streaming von der SSD geladen werden. Auf einem M5-Mac erreicht das 35B-Modell einen Spitzenwert von 2,6 GB (7–11 tok/s) und das 80B-Modell einen Spitzenwert von 4,3 GB (4,5–5 tok/s). Die 35B-Version läuft zudem nativ auf einem iPhone 17 mit ca. 2,5 GB und 1 Tok/s. Das System nutzt ein fein abgestuftes „Token-to-Expert“-Routing, Pread-basierte SSD-Abrufe, LFU-Caching und zur Laufzeit kompilierte Metal-Shader und unterstützt den Einsatz unter iOS sowie OpenAI-kompatible Server-Schnittstellen.
Kommentare (0)
0/300
OR