Maison
Paquets Swiftlet 80B Qwen dans Mac avec 4,3 Go de mémoire ; iPhone 17 exécutera nativement 35B
Un runtime Swift + Metal nommé Swiftlet redéfinit la notion de « là où les grands modèles peuvent s'exécuter ». Il est spécifiquement conçu pour la famille de modèles MoE (Mixture of Experts) Qwen3-Next et Qwen3.5/3.6. L'idée centrale est assez ingénieuse : seule la partie dense et réduite du modèle reste en mémoire, tandis que la partie volumineuse — les poids des experts de routage — réside normalement sur le SSD et est diffusée à la demande.
Les résultats sont clairs au regard des chiffres. Sur un Mac M5, la version 4 bits de Qwen3.6-35B-A3B occupe 18 Go sur le disque mais ne dépasse jamais 2,6 Go de mémoire, avec un débit de décodage de 7 à 10 tok/s ; encore plus impressionnant est la version 4 bits de Qwen3-Next-80B-A3B, qui nécessite 42 Go sur le disque mais ne dépasse que 4,3 Go de mémoire, avec une vitesse de 4,5 à 5 tok/s. La version 35B peut désormais s'exécuter sur un iPhone 17, avec environ 2,5 Go de mémoire et une vitesse d'environ 1 tok/s — selon les développeurs, il s'agit de la première fois qu'un tel modèle s'exécute nativement sur un téléphone sans faire appel à un serveur.

Le projet est entièrement utilisable de bout en bout, et les deux modèles peuvent produire des sorties vérifiées et correctes. Le développeur admet également un compromis : chaque token active environ 3 milliards de paramètres, de sorte que ces modèles se comportent comme de grands modèles lors des conversations et de la rédaction, mais agissent toujours comme de petits modèles en termes de mémoire factuelle.
Son principe de fonctionnement repose sur une planification fine. Chaque couche route chaque token vers 10 experts sur 512 (pour la version 80B) ou 8 experts sur 256 (pour la version 35B). Swiftlet conserve fermement les poids denses — attention, projections DeltaNet, routeurs, experts partagés et vecteurs d'intégration — en mémoire, occupant environ 1,3 Go (pour 35B) ou 2,5 Go (pour 80B) en 4 bits. Des milliers d'experts de routage sont reconditionnés en blocs de données à pas fixes, stockés dans des conteneurs .qpack. Pour récupérer un expert, il suffit d'une seule opération pread sur le SSD, sans mmap, et cela ne perturbe pas le cache de pages. Les experts populaires sont mis en cache dans un pool limité en utilisant une stratégie d'éviction LFU combinée à la récence ; le taux de réussite varie de 43 % à 70 %, et la taille du cache a presque aucun impact sur la vitesse, car le SSD d'Apple peut gérer la surcharge des échecs.
L'ensemble du passage avant s'exécute sur Metal à l'aide de shaders compilés au runtime, il n'est donc pas nécessaire d'avoir une toolchain Metal lors de la construction, et le même code peut être déployé directement sur iOS. Plus intéressant encore, 75 % des couches utilisent une attention linéaire Gated DeltaNet avec un état cyclique de taille fixe, ce qui signifie que quelle que soit la longueur du contexte, il ne génère jamais de cache KV en expansion — le fardeau caché des conversations sur de longs textes est ainsi discrètement déchargé.
Swiftlet n'est pas seulement un jouet en ligne de commande. Il possède quatre identités conçues pour lui-même. En tant que bibliothèque, SwiftletCore peut être intégré dans n'importe quelle application macOS ou iOS, offrant des capacités de chat avec une sortie incrémentale en streaming et une mise en cache des conversations ; en tant qu'outil en ligne de commande, swiftlet chat et swiftlet generate gèrent l'exécution locale et les tests de performance, tandis que swiftlet-repack construit des conteneurs directement à partir de points de contrôle MLX et prend en charge la reprise des téléchargements depuis Hugging Face. En tant que serveur, swiftlet-server fournit des interfaces de complétion de chat compatibles OpenAI sur une adresse en boucle locale, permettant à n'importe quelle interface de chat compatible OpenAI de se connecter au modèle local ; en tant qu'application, la version iOS de Priv AI intègre SwiftletCore comme moteur de modèle en streaming, permettant aux utilisateurs ordinaires de commencer à discuter simplement en le téléchargeant.
En ce qui concerne l'exactitude, le passage avant de chaque couche est comparé couche par couche à l'implémentation de référence mlx-lm, couvrant les formes de quantification f32 et int4. Le décodage incrémental est également comparé aux résultats de séquence complète, et les noyaux Metal ont été vérifiés à plusieurs reprises par rapport à des références CPU précises. Le conteneur peut également effectuer une vérification au niveau des octets par rapport au point de contrôle source — que les experts soient lus depuis le cache ou le disque, les réponses sont exactement les mêmes.
Son chemin d'inspiration est clairement expliqué : TurboFieldfare a d'abord validé la faisabilité de la diffusion d'experts pour Gemma sur Mac, et Swiftlet a emprunté certaines expériences de conception publiquement disponibles à partir de celui-ci, telles que l'utilisation de pread pour diffuser des experts dans des pools de slots bornés, l'utilisation de LFU combiné à la récence pour l'éviction, et l'utilisation d'un conditionnement à pas fixes de sorte qu'une lecture égale une récupération. Cependant, le reste a été écrit à partir de zéro, avec environ 10 000 lignes de code Swift et Metal, en abordant l'architecture mixte complètement différente de Qwen : attention linéaire Gated DeltaNet, GQA à portes et MoE à haute sparsité avec experts partagés. Il implémente même des calculs de quantification de groupe int4/int8 de style MLX dans Metal, en utilisant des noyaux adressables par octet et des décalages 64 bits pour prendre en charge des gigaoctets de fragments.
Article connexe
Tencent reorganise son équipe de grands modèles alors que Yao Shunyu prend la direction des modèles de base
L’équipe multimodale de Hunyuan chez Tencent a récemment achevé une restructuration majeure et un pivot stratégique. Lu Xudong, qui dirigeait auparavant les efforts de compréhension multimodale chez xAI, a rejoint Hunyuan pour diriger les algorithmes
Lancement de la Plateforme Ouverte Tongyi Qianwen, apportant la conversation en tant que service au quotidien
La plateforme ouverte Tongyi Qianwen a officiellement lancé, offrant aux développeurs l’accès à des services sur les appareils mobiles, les ordinateurs de bureau et les lunettes intelligentes. Les utilisateurs n’ont plus besoin de basculer entre les
Le fondateur atteint de cancer déploie l'IA dans sa lutte
Conno Christou refuse de laisser sa santé au hasard. Il surveille son sommeil avec un bracelet Whoop, recoupe les données avec une bague Oura, et subit près de 100 tests de biomarqueurs chaque année. Pendant quatre années consécutives, il a suivi les
Recommandations de sujets spéciaux liés
commentaires (0)
Un runtime Swift + Metal nommé Swiftlet redéfinit la notion de « là où les grands modèles peuvent s'exécuter ». Il est spécifiquement conçu pour la famille de modèles MoE (Mixture of Experts) Qwen3-Next et Qwen3.5/3.6. L'idée centrale est assez ingénieuse : seule la partie dense et réduite du modèle reste en mémoire, tandis que la partie volumineuse — les poids des experts de routage — réside normalement sur le SSD et est diffusée à la demande.
Les résultats sont clairs au regard des chiffres. Sur un Mac M5, la version 4 bits de Qwen3.6-35B-A3B occupe 18 Go sur le disque mais ne dépasse jamais 2,6 Go de mémoire, avec un débit de décodage de 7 à 10 tok/s ; encore plus impressionnant est la version 4 bits de Qwen3-Next-80B-A3B, qui nécessite 42 Go sur le disque mais ne dépasse que 4,3 Go de mémoire, avec une vitesse de 4,5 à 5 tok/s. La version 35B peut désormais s'exécuter sur un iPhone 17, avec environ 2,5 Go de mémoire et une vitesse d'environ 1 tok/s — selon les développeurs, il s'agit de la première fois qu'un tel modèle s'exécute nativement sur un téléphone sans faire appel à un serveur.

Le projet est entièrement utilisable de bout en bout, et les deux modèles peuvent produire des sorties vérifiées et correctes. Le développeur admet également un compromis : chaque token active environ 3 milliards de paramètres, de sorte que ces modèles se comportent comme de grands modèles lors des conversations et de la rédaction, mais agissent toujours comme de petits modèles en termes de mémoire factuelle.
Son principe de fonctionnement repose sur une planification fine. Chaque couche route chaque token vers 10 experts sur 512 (pour la version 80B) ou 8 experts sur 256 (pour la version 35B). Swiftlet conserve fermement les poids denses — attention, projections DeltaNet, routeurs, experts partagés et vecteurs d'intégration — en mémoire, occupant environ 1,3 Go (pour 35B) ou 2,5 Go (pour 80B) en 4 bits. Des milliers d'experts de routage sont reconditionnés en blocs de données à pas fixes, stockés dans des conteneurs .qpack. Pour récupérer un expert, il suffit d'une seule opération pread sur le SSD, sans mmap, et cela ne perturbe pas le cache de pages. Les experts populaires sont mis en cache dans un pool limité en utilisant une stratégie d'éviction LFU combinée à la récence ; le taux de réussite varie de 43 % à 70 %, et la taille du cache a presque aucun impact sur la vitesse, car le SSD d'Apple peut gérer la surcharge des échecs.
L'ensemble du passage avant s'exécute sur Metal à l'aide de shaders compilés au runtime, il n'est donc pas nécessaire d'avoir une toolchain Metal lors de la construction, et le même code peut être déployé directement sur iOS. Plus intéressant encore, 75 % des couches utilisent une attention linéaire Gated DeltaNet avec un état cyclique de taille fixe, ce qui signifie que quelle que soit la longueur du contexte, il ne génère jamais de cache KV en expansion — le fardeau caché des conversations sur de longs textes est ainsi discrètement déchargé.
Swiftlet n'est pas seulement un jouet en ligne de commande. Il possède quatre identités conçues pour lui-même. En tant que bibliothèque, SwiftletCore peut être intégré dans n'importe quelle application macOS ou iOS, offrant des capacités de chat avec une sortie incrémentale en streaming et une mise en cache des conversations ; en tant qu'outil en ligne de commande, swiftlet chat et swiftlet generate gèrent l'exécution locale et les tests de performance, tandis que swiftlet-repack construit des conteneurs directement à partir de points de contrôle MLX et prend en charge la reprise des téléchargements depuis Hugging Face. En tant que serveur, swiftlet-server fournit des interfaces de complétion de chat compatibles OpenAI sur une adresse en boucle locale, permettant à n'importe quelle interface de chat compatible OpenAI de se connecter au modèle local ; en tant qu'application, la version iOS de Priv AI intègre SwiftletCore comme moteur de modèle en streaming, permettant aux utilisateurs ordinaires de commencer à discuter simplement en le téléchargeant.
En ce qui concerne l'exactitude, le passage avant de chaque couche est comparé couche par couche à l'implémentation de référence mlx-lm, couvrant les formes de quantification f32 et int4. Le décodage incrémental est également comparé aux résultats de séquence complète, et les noyaux Metal ont été vérifiés à plusieurs reprises par rapport à des références CPU précises. Le conteneur peut également effectuer une vérification au niveau des octets par rapport au point de contrôle source — que les experts soient lus depuis le cache ou le disque, les réponses sont exactement les mêmes.
Son chemin d'inspiration est clairement expliqué : TurboFieldfare a d'abord validé la faisabilité de la diffusion d'experts pour Gemma sur Mac, et Swiftlet a emprunté certaines expériences de conception publiquement disponibles à partir de celui-ci, telles que l'utilisation de pread pour diffuser des experts dans des pools de slots bornés, l'utilisation de LFU combiné à la récence pour l'éviction, et l'utilisation d'un conditionnement à pas fixes de sorte qu'une lecture égale une récupération. Cependant, le reste a été écrit à partir de zéro, avec environ 10 000 lignes de code Swift et Metal, en abordant l'architecture mixte complètement différente de Qwen : attention linéaire Gated DeltaNet, GQA à portes et MoE à haute sparsité avec experts partagés. Il implémente même des calculs de quantification de groupe int4/int8 de style MLX dans Metal, en utilisant des noyaux adressables par octet et des décalages 64 bits pour prendre en charge des gigaoctets de fragments.
Tencent reorganise son équipe de grands modèles alors que Yao Shunyu prend la direction des modèles de base
L’équipe multimodale de Hunyuan chez Tencent a récemment achevé une restructuration majeure et un pivot stratégique. Lu Xudong, qui dirigeait auparavant les efforts de compréhension multimodale chez xAI, a rejoint Hunyuan pour diriger les algorithmes
Lancement de la Plateforme Ouverte Tongyi Qianwen, apportant la conversation en tant que service au quotidien
La plateforme ouverte Tongyi Qianwen a officiellement lancé, offrant aux développeurs l’accès à des services sur les appareils mobiles, les ordinateurs de bureau et les lunettes intelligentes. Les utilisateurs n’ont plus besoin de basculer entre les
Le fondateur atteint de cancer déploie l'IA dans sa lutte
Conno Christou refuse de laisser sa santé au hasard. Il surveille son sommeil avec un bracelet Whoop, recoupe les données avec une bague Oura, et subit près de 100 tests de biomarqueurs chaque année. Pendant quatre années consécutives, il a suivi les











