Lar
Pacotes de Swiftlet 80B Qwen no Mac com 4,3 GB de Memória; iPhone 17 executará nativamente 35B
Uma runtime Swift + Metal chamada Swiftlet está redefinindo "onde grandes modelos podem ser executados". Ela foi especificamente projetada para a família de modelos MoE (Mixture of Experts) Qwen3-Next e Qwen3.5/3.6. A ideia central é bastante engenhosa: apenas o núcleo denso e pequeno do modelo permanece na memória, enquanto a parte grande — os pesos dos especialistas de roteamento — normalmente reside no SSD e é transmitida conforme necessário.
Os resultados são claros pelos números. Em um Mac M5, a versão de 4 bits do Qwen3.6-35B-A3B ocupa 18 GB em disco, mas atinge apenas 2,6 GB de memória, decodificando a 7 a 11 tok/s; ainda mais impressionante é a versão de 4 bits do Qwen3-Next-80B-A3B, que requer 42 GB em disco, mas atinge apenas 4,3 GB de memória, com uma velocidade de 4,5 a 5 tok/s. A versão de 35B agora pode ser executada em um iPhone 17, com cerca de 2,5 GB de memória e uma velocidade de aproximadamente 1 tok/s — segundo os desenvolvedores, esta é a primeira vez que um modelo desse tipo é executado nativamente em um telefone sem tocar em um servidor.

O projeto é totalmente utilizável de ponta a ponta, e ambos os modelos podem produzir saídas verificadas e corretas. O desenvolvedor também admite uma troca: cada token ativa cerca de 3 bilhões de parâmetros, portanto, esses modelos se comportam como grandes modelos durante conversas e escrita, mas ainda atuam como pequenos modelos em termos de memória factual.
Seu princípio de funcionamento reside no agendamento fino. Cada camada roteia cada token para 10 dos 512 especialistas (para a versão de 80B) ou 8 dos 256 especialistas (para a versão de 35B). O Swiftlet mantém os pesos densos — atenção, projeções DeltaNet, roteadores, especialistas compartilhados e vetores de incorporação — firmemente na memória, ocupando cerca de 1,3 GB (para 35B) ou 2,5 GB (para 80B) em 4 bits. Milhares de especialistas de roteamento são reempacotados em blocos de dados de passo fixo, armazenados em contêineres .qpack. Para buscar um especialista, basta uma operação pread no SSD, sem mmap, e não perturba o cache de páginas. Especialistas populares são armazenados em cache em um pool limitado usando uma estratégia de evicção LFU mais recente; a taxa de acertos varia de 43% a 70%, e o tamanho do cache tem quase nenhum impacto na velocidade, pois o SSD da Apple pode lidar com a sobrecarga dos erros.
Toda a passagem direta é executada no Metal usando shaders compilados em tempo de execução, portanto, não há necessidade de uma toolchain Metal durante a compilação, e o mesmo código pode ser implantado diretamente no iOS. Mais interessante ainda, 75% das camadas usam atenção linear Gated DeltaNet com um estado cíclico de tamanho fixo, o que significa que, independentemente do comprimento do contexto, ele nunca cresce um cache KV expansivo — o ônus oculto de conversas longas é silenciosamente transferido.
O Swiftlet não é apenas um brinquedo de linha de comando. Ele tem quatro identidades projetadas para si mesmo. Como biblioteca, o SwiftletCore pode ser incorporado em qualquer aplicativo macOS ou iOS, fornecendo capacidades de chat com saída incremental em streaming e cache de conversas; como ferramenta de linha de comando, swiftlet chat e swiftlet generate lidam com execução local e benchmarking, enquanto swiftlet-repack constrói contêineres diretamente a partir de checkpoints MLX e suporta retomar downloads do Hugging Face. Como servidor, swiftlet-server fornece interfaces de chat-completions compatíveis com OpenAI em um endereço de loopback, permitindo que qualquer interface de chat compatível com OpenAI se conecte ao modelo local; como aplicativo, a versão iOS do Priv AI incorpora o SwiftletCore como um mecanismo de modelo em streaming, permitindo que usuários comuns comecem a conversar simplesmente baixando-o.
Quanto à correção, cada passagem direta de cada camada é comparada camada por camada contra a implementação de referência mlx-lm, cobrindo formas de quantização f32 e int4. A decodificação incremental também é comparada com os resultados da sequência completa, e os kernels Metal foram verificados repetidamente contra referências precisas de CPU. O contêiner também pode realizar verificação em nível de bytes contra o checkpoint original — seja os especialistas lidos do cache ou do disco, as respostas são exatamente as mesmas.
Sua trajetória de inspiração é claramente explicada: o TurboFieldfare primeiro validou a viabilidade do streaming de especialistas para o Gemma no Mac, e o Swiftlet emprestou algumas experiências de design publicamente disponíveis dele, como usar pread para transmitir especialistas para pools de slots limitados, usar LFU mais recente para evicção e usar empacotamento de passo fixo para que uma leitura equivalha a uma busca. No entanto, o resto foi escrito do zero, com cerca de 10.000 linhas de código Swift e Metal, abordando a arquitetura mista completamente diferente do Qwen: atenção linear Gated DeltaNet, GQA com portas e MoE altamente esparsa com especialistas compartilhados. Ele também implementa cálculos de quantização em grupo int4/int8 estilo MLX no Metal, usando kernels endereçáveis por byte e deslocamentos de 64 bits para suportar gigabytes de fragmentos.
Artigo relacionado
A Tencent reorganiza sua equipe de grandes modelos, com Yao Shunyu assumindo a responsabilidade pelos modelos básicos
A equipe multimodal do Hunyuan da Tencent concluiu recentemente uma reestruturação significativa e uma mudança estratégica. Lu Xudong, que anteriormente liderava os esforços de compreensão multimodal da xAI, juntou-se ao Hunyuan para comandar os algo
Plataforma Aberta Tongyi Qianwen é Lançada, Trazendo Conversação como Serviço para o Cotidiano
A Plataforma Aberta Tongyi Qianwen foi oficialmente lançada, fornecendo aos desenvolvedores acesso a serviços em dispositivos móveis, computadores e óculos de realidade aumentada. Os usuários não precisam mais alternar entre aplicativos; eles podem c
Fundador com câncer utiliza IA em contra-ataque
Conno Christou recusa-se a deixar sua saúde ao acaso. Ele monitora o sono com uma pulseira Whoop, cruza os dados com um anel Oura e realiza quase 100 testes de biomarcadores anualmente. Por quatro anos consecutivos, seguiu os protocolos de análise sa
Recomendações de tópicos especiais relacionados
Comentários (0)
Uma runtime Swift + Metal chamada Swiftlet está redefinindo "onde grandes modelos podem ser executados". Ela foi especificamente projetada para a família de modelos MoE (Mixture of Experts) Qwen3-Next e Qwen3.5/3.6. A ideia central é bastante engenhosa: apenas o núcleo denso e pequeno do modelo permanece na memória, enquanto a parte grande — os pesos dos especialistas de roteamento — normalmente reside no SSD e é transmitida conforme necessário.
Os resultados são claros pelos números. Em um Mac M5, a versão de 4 bits do Qwen3.6-35B-A3B ocupa 18 GB em disco, mas atinge apenas 2,6 GB de memória, decodificando a 7 a 11 tok/s; ainda mais impressionante é a versão de 4 bits do Qwen3-Next-80B-A3B, que requer 42 GB em disco, mas atinge apenas 4,3 GB de memória, com uma velocidade de 4,5 a 5 tok/s. A versão de 35B agora pode ser executada em um iPhone 17, com cerca de 2,5 GB de memória e uma velocidade de aproximadamente 1 tok/s — segundo os desenvolvedores, esta é a primeira vez que um modelo desse tipo é executado nativamente em um telefone sem tocar em um servidor.

O projeto é totalmente utilizável de ponta a ponta, e ambos os modelos podem produzir saídas verificadas e corretas. O desenvolvedor também admite uma troca: cada token ativa cerca de 3 bilhões de parâmetros, portanto, esses modelos se comportam como grandes modelos durante conversas e escrita, mas ainda atuam como pequenos modelos em termos de memória factual.
Seu princípio de funcionamento reside no agendamento fino. Cada camada roteia cada token para 10 dos 512 especialistas (para a versão de 80B) ou 8 dos 256 especialistas (para a versão de 35B). O Swiftlet mantém os pesos densos — atenção, projeções DeltaNet, roteadores, especialistas compartilhados e vetores de incorporação — firmemente na memória, ocupando cerca de 1,3 GB (para 35B) ou 2,5 GB (para 80B) em 4 bits. Milhares de especialistas de roteamento são reempacotados em blocos de dados de passo fixo, armazenados em contêineres .qpack. Para buscar um especialista, basta uma operação pread no SSD, sem mmap, e não perturba o cache de páginas. Especialistas populares são armazenados em cache em um pool limitado usando uma estratégia de evicção LFU mais recente; a taxa de acertos varia de 43% a 70%, e o tamanho do cache tem quase nenhum impacto na velocidade, pois o SSD da Apple pode lidar com a sobrecarga dos erros.
Toda a passagem direta é executada no Metal usando shaders compilados em tempo de execução, portanto, não há necessidade de uma toolchain Metal durante a compilação, e o mesmo código pode ser implantado diretamente no iOS. Mais interessante ainda, 75% das camadas usam atenção linear Gated DeltaNet com um estado cíclico de tamanho fixo, o que significa que, independentemente do comprimento do contexto, ele nunca cresce um cache KV expansivo — o ônus oculto de conversas longas é silenciosamente transferido.
O Swiftlet não é apenas um brinquedo de linha de comando. Ele tem quatro identidades projetadas para si mesmo. Como biblioteca, o SwiftletCore pode ser incorporado em qualquer aplicativo macOS ou iOS, fornecendo capacidades de chat com saída incremental em streaming e cache de conversas; como ferramenta de linha de comando, swiftlet chat e swiftlet generate lidam com execução local e benchmarking, enquanto swiftlet-repack constrói contêineres diretamente a partir de checkpoints MLX e suporta retomar downloads do Hugging Face. Como servidor, swiftlet-server fornece interfaces de chat-completions compatíveis com OpenAI em um endereço de loopback, permitindo que qualquer interface de chat compatível com OpenAI se conecte ao modelo local; como aplicativo, a versão iOS do Priv AI incorpora o SwiftletCore como um mecanismo de modelo em streaming, permitindo que usuários comuns comecem a conversar simplesmente baixando-o.
Quanto à correção, cada passagem direta de cada camada é comparada camada por camada contra a implementação de referência mlx-lm, cobrindo formas de quantização f32 e int4. A decodificação incremental também é comparada com os resultados da sequência completa, e os kernels Metal foram verificados repetidamente contra referências precisas de CPU. O contêiner também pode realizar verificação em nível de bytes contra o checkpoint original — seja os especialistas lidos do cache ou do disco, as respostas são exatamente as mesmas.
Sua trajetória de inspiração é claramente explicada: o TurboFieldfare primeiro validou a viabilidade do streaming de especialistas para o Gemma no Mac, e o Swiftlet emprestou algumas experiências de design publicamente disponíveis dele, como usar pread para transmitir especialistas para pools de slots limitados, usar LFU mais recente para evicção e usar empacotamento de passo fixo para que uma leitura equivalha a uma busca. No entanto, o resto foi escrito do zero, com cerca de 10.000 linhas de código Swift e Metal, abordando a arquitetura mista completamente diferente do Qwen: atenção linear Gated DeltaNet, GQA com portas e MoE altamente esparsa com especialistas compartilhados. Ele também implementa cálculos de quantização em grupo int4/int8 estilo MLX no Metal, usando kernels endereçáveis por byte e deslocamentos de 64 bits para suportar gigabytes de fragmentos.
A Tencent reorganiza sua equipe de grandes modelos, com Yao Shunyu assumindo a responsabilidade pelos modelos básicos
A equipe multimodal do Hunyuan da Tencent concluiu recentemente uma reestruturação significativa e uma mudança estratégica. Lu Xudong, que anteriormente liderava os esforços de compreensão multimodal da xAI, juntou-se ao Hunyuan para comandar os algo
Plataforma Aberta Tongyi Qianwen é Lançada, Trazendo Conversação como Serviço para o Cotidiano
A Plataforma Aberta Tongyi Qianwen foi oficialmente lançada, fornecendo aos desenvolvedores acesso a serviços em dispositivos móveis, computadores e óculos de realidade aumentada. Os usuários não precisam mais alternar entre aplicativos; eles podem c
Fundador com câncer utiliza IA em contra-ataque
Conno Christou recusa-se a deixar sua saúde ao acaso. Ele monitora o sono com uma pulseira Whoop, cruza os dados com um anel Oura e realiza quase 100 testes de biomarcadores anualmente. Por quatro anos consecutivos, seguiu os protocolos de análise sa











