Heim
Swiftlet-Packs 80B Qwen in Mac mit 4,3 GB Speicher; iPhone 17 soll 35B nativ ausführen
Ein zur Laufzeit kompiliertes Swift- und Metal-Laufzeitsystem namens Swiftlet definiert neu, „wo große Modelle ausgeführt werden können“. Es ist speziell auf die Familie der MoE-Modelle (Mixture of Experts) Qwen3-Next und Qwen3.5/3.6 zugeschnitten. Die Kernidee ist recht clever: Nur der kleine, dichte Kern des Modells verbleibt im Speicher, während der große Teil – die Routing-Expertengewichte – normalerweise auf der SSD gespeichert und bei Bedarf gestreamt wird.
Die Ergebnisse sind aus den Zahlen klar ersichtlich. Auf einem M5-Mac belegt die 4-Bit-Version von Qwen3.6-35B-A3B 18 GB auf der Festplatte, nutzt jedoch nur maximal 2,6 GB Speicher und decodiert mit 7 bis 11 Tok/s; noch beeindruckender ist die 4-Bit-Version von Qwen3-Next-80B-A3B, die 42 GB auf der Festplatte benötigt, aber nur maximal 4,3 GB Speicher beansprucht, mit einer Geschwindigkeit von 4,5 bis 5 Tok/s. Die 35B-Version kann nun auf einem iPhone 17 ausgeführt werden, mit etwa 2,5 GB Speicher und einer Geschwindigkeit von ca. 1 Tok/s – laut den Entwicklern ist dies das erste Mal, dass ein solches Modell nativ auf einem Telefon ausgeführt wird, ohne einen Server zu kontaktieren.

Das Projekt ist vollständig end-to-end nutzbar, und beide Modelle können verifizierte, korrekte Ausgaben erzeugen. Der Entwickler räumt auch einen Kompromiss ein: Jedes Token aktiviert tatsächlich etwa 3 Milliarden Parameter, daher verhalten sich diese Modelle während von Unterhaltungen und Schreibprozessen wie große Modelle, bleiben aber in Bezug auf faktisches Gedächtnis klein.
Sein Funktionsprinzip liegt in der feingranularen Planung. Jede Schicht leitet jedes Token an 10 von 512 Experten weiter (für die 80B-Version) oder an 8 von 256 Experten (für die 35B-Version). Swiftlet hält die dichten Gewichte – Aufmerksamkeit, DeltaNet-Projektionen, Router, gemeinsame Experten und Einbettungsvektoren – fest im Speicher, was etwa 1,3 GB (für 35B) oder 2,5 GB (für 80B) in 4-Bit-Darstellung belegt. Tausende von Routing-Experten werden in Datenblöcke mit festen Schritten umgepackt und in .qpack-Containern gespeichert. Um einen Experten abzurufen, ist nur eine pread-Operation auf der SSD erforderlich, kein mmap, und es wird der Seitencache nicht gestört. Beliebte Experten werden in einem begrenzten Pool unter Verwendung einer LFU-Strategie plus Aktualität zur Verdrängung zwischengespeichert; die Trefferquote liegt zwischen 43 % und 70 %, und die Cache-Größe hat fast keinen Einfluss auf die Geschwindigkeit, da Apples SSD die Überlastung durch Fehltritte bewältigen kann.
Der gesamte Vorwärtsdurchlauf läuft auf Metal unter Verwendung zur Laufzeit kompilierter Shader ab, sodass während des Baus keine Metal-Toolchain benötigt wird und derselbe Code direkt auf iOS bereitgestellt werden kann. Noch interessanter ist, dass 75 % der Schichten Gated DeltaNet-Linearaufmerksamkeit mit einem zyklischen Zustand fester Größe verwenden, was bedeutet, dass sich unabhängig von der Kontextlänge niemals ein erweiternder KV-Cache aufbaut – die versteckte Last langer Textunterhaltungen wird stillschweigend abgewälzt.
Swiftlet ist nicht nur ein Kommandozeilen-Spielzeug. Es hat vier Identitäten, die für sich selbst konzipiert wurden. Als Bibliothek kann SwiftletCore in jede macOS- oder iOS-App eingebettet werden und bietet Chat-Funktionen mit Streaming-Ausgabe inkrementeller Ergebnisse und Gesprächscaching; als Kommandozeilen-Tool behandeln swiftlet chat und swiftlet generate die lokale Ausführung und Benchmarking, während swiftlet-repack Container direkt aus MLX-Checkpoints erstellt und das Fortsetzen von Downloads von Hugging Face unterstützt. Als Server bietet swiftlet-server OpenAI-kompatible chat-completions-Schnittstellen auf einer Loopback-Adresse an, sodass jede OpenAI-kompatible Chat-Schnittstelle eine Verbindung zum lokalen Modell herstellen kann; als Anwendung integriert die iOS-Version von Priv AI SwiftletCore als Streaming-Modell-Engine und ermöglicht es normalen Nutzern, einfach durch Herunterladen des Programms mit dem Chat zu beginnen.
In Bezug auf die Korrektheit wird der Vorwärtsdurchlauf jeder Schicht schichtweise gegen die Referenzimplementierung von mlx-lm verglichen, wobei f32- und int4-Quantisierungsformen abgedeckt werden. Das inkrementelle Decodieren wird ebenfalls mit den Ergebnissen der vollständigen Sequenz verglichen, und die Metal-Kernel wurden wiederholt gegen präzise CPU-Referenzen verifiziert. Der Container kann auch eine Byte-Level-Verifikation gegen den ursprünglichen Checkpoint durchführen – ob Experten aus dem Cache oder der Festplatte gelesen werden, die Antworten sind exakt dieselben.
Sein Inspirationspfad ist klar erklärt: TurboFieldfare hat zunächst die Machbarkeit des Streamings von Experten für Gemma auf dem Mac validiert, und Swiftlet hat einige öffentlich verfügbare Design-Erfahrungen daraus übernommen, wie die Verwendung von pread zum Streamen von Experten in begrenzte Slot-Pools, die Nutzung von LFU plus Aktualität zur Verdrängung und die Verwendung einer paketweisen Aufteilung mit festen Schritten, sodass ein Lesevorgang einem Abruf entspricht. Der Rest wurde jedoch von Grund auf neu geschrieben, mit etwa 10.000 Zeilen Swift- und Metal-Code, die sich mit der völlig anderen Qwen-Mischarchitektur auseinandersetzen: Gated DeltaNet-Linearaufmerksamkeit, gated GQA und hoch-sparse MoE mit gemeinsamen Experten. Es implementiert sogar MLX-ähnliche int4/int8-Gruppenquantisierungsberechnungen in Metal, unter Verwendung byte-adressierbarer Kernel und 64-Bit-Offsets, um Gigabyte an Shards zu unterstützen.
Verwandter Artikel
Tencent schüttelt das Large-Model-Team um, während Yao Shunyu die Verantwortung für das Basismodell übernimmt
Das multimodale Team von Tencent Hunyuan hat kürzlich eine bedeutende Umstrukturierung und strategische Neuausrichtung abgeschlossen. Lu Xudong, der zuvor die multimodalen Verständnisarbeiten bei xAI geleitet hatte, ist zu Hunyuan gewechselt, um die
Tongyi Qianwen Open Platform wird gestartet und bringt Conversational-as-a-Service in den Alltag.
Die Tongyi Qianwen Open Platform ist offiziell gestartet und bietet Entwicklern Zugriff auf Dienste über mobile Geräte, PCs und KI-Brillen. Nutzer müssen nicht mehr zwischen Apps wechseln; sie können verschiedene tägliche Serviceoperationen direkt in
Krebskranker Gründer setzt KI im Gegenangriff ein
Conno Christou überlässt seine Gesundheit nicht dem Zufall. Er überwacht seinen Schlaf mit einem Whoop-Armband, kreuzreferenziert die Daten mit einem Oura-Ring und unterzieht sich jährlich fast 100 Biomarker-Tests. Vier Jahre lang folgte er den Blutt
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Ein zur Laufzeit kompiliertes Swift- und Metal-Laufzeitsystem namens Swiftlet definiert neu, „wo große Modelle ausgeführt werden können“. Es ist speziell auf die Familie der MoE-Modelle (Mixture of Experts) Qwen3-Next und Qwen3.5/3.6 zugeschnitten. Die Kernidee ist recht clever: Nur der kleine, dichte Kern des Modells verbleibt im Speicher, während der große Teil – die Routing-Expertengewichte – normalerweise auf der SSD gespeichert und bei Bedarf gestreamt wird.
Die Ergebnisse sind aus den Zahlen klar ersichtlich. Auf einem M5-Mac belegt die 4-Bit-Version von Qwen3.6-35B-A3B 18 GB auf der Festplatte, nutzt jedoch nur maximal 2,6 GB Speicher und decodiert mit 7 bis 11 Tok/s; noch beeindruckender ist die 4-Bit-Version von Qwen3-Next-80B-A3B, die 42 GB auf der Festplatte benötigt, aber nur maximal 4,3 GB Speicher beansprucht, mit einer Geschwindigkeit von 4,5 bis 5 Tok/s. Die 35B-Version kann nun auf einem iPhone 17 ausgeführt werden, mit etwa 2,5 GB Speicher und einer Geschwindigkeit von ca. 1 Tok/s – laut den Entwicklern ist dies das erste Mal, dass ein solches Modell nativ auf einem Telefon ausgeführt wird, ohne einen Server zu kontaktieren.

Das Projekt ist vollständig end-to-end nutzbar, und beide Modelle können verifizierte, korrekte Ausgaben erzeugen. Der Entwickler räumt auch einen Kompromiss ein: Jedes Token aktiviert tatsächlich etwa 3 Milliarden Parameter, daher verhalten sich diese Modelle während von Unterhaltungen und Schreibprozessen wie große Modelle, bleiben aber in Bezug auf faktisches Gedächtnis klein.
Sein Funktionsprinzip liegt in der feingranularen Planung. Jede Schicht leitet jedes Token an 10 von 512 Experten weiter (für die 80B-Version) oder an 8 von 256 Experten (für die 35B-Version). Swiftlet hält die dichten Gewichte – Aufmerksamkeit, DeltaNet-Projektionen, Router, gemeinsame Experten und Einbettungsvektoren – fest im Speicher, was etwa 1,3 GB (für 35B) oder 2,5 GB (für 80B) in 4-Bit-Darstellung belegt. Tausende von Routing-Experten werden in Datenblöcke mit festen Schritten umgepackt und in .qpack-Containern gespeichert. Um einen Experten abzurufen, ist nur eine pread-Operation auf der SSD erforderlich, kein mmap, und es wird der Seitencache nicht gestört. Beliebte Experten werden in einem begrenzten Pool unter Verwendung einer LFU-Strategie plus Aktualität zur Verdrängung zwischengespeichert; die Trefferquote liegt zwischen 43 % und 70 %, und die Cache-Größe hat fast keinen Einfluss auf die Geschwindigkeit, da Apples SSD die Überlastung durch Fehltritte bewältigen kann.
Der gesamte Vorwärtsdurchlauf läuft auf Metal unter Verwendung zur Laufzeit kompilierter Shader ab, sodass während des Baus keine Metal-Toolchain benötigt wird und derselbe Code direkt auf iOS bereitgestellt werden kann. Noch interessanter ist, dass 75 % der Schichten Gated DeltaNet-Linearaufmerksamkeit mit einem zyklischen Zustand fester Größe verwenden, was bedeutet, dass sich unabhängig von der Kontextlänge niemals ein erweiternder KV-Cache aufbaut – die versteckte Last langer Textunterhaltungen wird stillschweigend abgewälzt.
Swiftlet ist nicht nur ein Kommandozeilen-Spielzeug. Es hat vier Identitäten, die für sich selbst konzipiert wurden. Als Bibliothek kann SwiftletCore in jede macOS- oder iOS-App eingebettet werden und bietet Chat-Funktionen mit Streaming-Ausgabe inkrementeller Ergebnisse und Gesprächscaching; als Kommandozeilen-Tool behandeln swiftlet chat und swiftlet generate die lokale Ausführung und Benchmarking, während swiftlet-repack Container direkt aus MLX-Checkpoints erstellt und das Fortsetzen von Downloads von Hugging Face unterstützt. Als Server bietet swiftlet-server OpenAI-kompatible chat-completions-Schnittstellen auf einer Loopback-Adresse an, sodass jede OpenAI-kompatible Chat-Schnittstelle eine Verbindung zum lokalen Modell herstellen kann; als Anwendung integriert die iOS-Version von Priv AI SwiftletCore als Streaming-Modell-Engine und ermöglicht es normalen Nutzern, einfach durch Herunterladen des Programms mit dem Chat zu beginnen.
In Bezug auf die Korrektheit wird der Vorwärtsdurchlauf jeder Schicht schichtweise gegen die Referenzimplementierung von mlx-lm verglichen, wobei f32- und int4-Quantisierungsformen abgedeckt werden. Das inkrementelle Decodieren wird ebenfalls mit den Ergebnissen der vollständigen Sequenz verglichen, und die Metal-Kernel wurden wiederholt gegen präzise CPU-Referenzen verifiziert. Der Container kann auch eine Byte-Level-Verifikation gegen den ursprünglichen Checkpoint durchführen – ob Experten aus dem Cache oder der Festplatte gelesen werden, die Antworten sind exakt dieselben.
Sein Inspirationspfad ist klar erklärt: TurboFieldfare hat zunächst die Machbarkeit des Streamings von Experten für Gemma auf dem Mac validiert, und Swiftlet hat einige öffentlich verfügbare Design-Erfahrungen daraus übernommen, wie die Verwendung von pread zum Streamen von Experten in begrenzte Slot-Pools, die Nutzung von LFU plus Aktualität zur Verdrängung und die Verwendung einer paketweisen Aufteilung mit festen Schritten, sodass ein Lesevorgang einem Abruf entspricht. Der Rest wurde jedoch von Grund auf neu geschrieben, mit etwa 10.000 Zeilen Swift- und Metal-Code, die sich mit der völlig anderen Qwen-Mischarchitektur auseinandersetzen: Gated DeltaNet-Linearaufmerksamkeit, gated GQA und hoch-sparse MoE mit gemeinsamen Experten. Es implementiert sogar MLX-ähnliche int4/int8-Gruppenquantisierungsberechnungen in Metal, unter Verwendung byte-adressierbarer Kernel und 64-Bit-Offsets, um Gigabyte an Shards zu unterstützen.
Tencent schüttelt das Large-Model-Team um, während Yao Shunyu die Verantwortung für das Basismodell übernimmt
Das multimodale Team von Tencent Hunyuan hat kürzlich eine bedeutende Umstrukturierung und strategische Neuausrichtung abgeschlossen. Lu Xudong, der zuvor die multimodalen Verständnisarbeiten bei xAI geleitet hatte, ist zu Hunyuan gewechselt, um die
Tongyi Qianwen Open Platform wird gestartet und bringt Conversational-as-a-Service in den Alltag.
Die Tongyi Qianwen Open Platform ist offiziell gestartet und bietet Entwicklern Zugriff auf Dienste über mobile Geräte, PCs und KI-Brillen. Nutzer müssen nicht mehr zwischen Apps wechseln; sie können verschiedene tägliche Serviceoperationen direkt in
Krebskranker Gründer setzt KI im Gegenangriff ein
Conno Christou überlässt seine Gesundheit nicht dem Zufall. Er überwacht seinen Schlaf mit einem Whoop-Armband, kreuzreferenziert die Daten mit einem Oura-Ring und unterzieht sich jährlich fast 100 Biomarker-Tests. Vier Jahre lang folgte er den Blutt











