opção
Lar
Notícias
Pacotes de Swiftlet 80B Qwen no Mac com 4,3 GB de Memória; iPhone 17 executará nativamente 35B

Pacotes de Swiftlet 80B Qwen no Mac com 4,3 GB de Memória; iPhone 17 executará nativamente 35B

24 de Setembro de 2026
5

Uma runtime Swift + Metal chamada Swiftlet está redefinindo "onde grandes modelos podem ser executados". Ela foi especificamente projetada para a família de modelos MoE (Mixture of Experts) Qwen3-Next e Qwen3.5/3.6. A ideia central é bastante engenhosa: apenas o núcleo denso e pequeno do modelo permanece na memória, enquanto a parte grande — os pesos dos especialistas de roteamento — normalmente reside no SSD e é transmitida conforme necessário.

Os resultados são claros pelos números. Em um Mac M5, a versão de 4 bits do Qwen3.6-35B-A3B ocupa 18 GB em disco, mas atinge apenas 2,6 GB de memória, decodificando a 7 a 11 tok/s; ainda mais impressionante é a versão de 4 bits do Qwen3-Next-80B-A3B, que requer 42 GB em disco, mas atinge apenas 4,3 GB de memória, com uma velocidade de 4,5 a 5 tok/s. A versão de 35B agora pode ser executada em um iPhone 17, com cerca de 2,5 GB de memória e uma velocidade de aproximadamente 1 tok/s — segundo os desenvolvedores, esta é a primeira vez que um modelo desse tipo é executado nativamente em um telefone sem tocar em um servidor.

image.png

O projeto é totalmente utilizável de ponta a ponta, e ambos os modelos podem produzir saídas verificadas e corretas. O desenvolvedor também admite uma troca: cada token ativa cerca de 3 bilhões de parâmetros, portanto, esses modelos se comportam como grandes modelos durante conversas e escrita, mas ainda atuam como pequenos modelos em termos de memória factual.

Seu princípio de funcionamento reside no agendamento fino. Cada camada roteia cada token para 10 dos 512 especialistas (para a versão de 80B) ou 8 dos 256 especialistas (para a versão de 35B). O Swiftlet mantém os pesos densos — atenção, projeções DeltaNet, roteadores, especialistas compartilhados e vetores de incorporação — firmemente na memória, ocupando cerca de 1,3 GB (para 35B) ou 2,5 GB (para 80B) em 4 bits. Milhares de especialistas de roteamento são reempacotados em blocos de dados de passo fixo, armazenados em contêineres .qpack. Para buscar um especialista, basta uma operação pread no SSD, sem mmap, e não perturba o cache de páginas. Especialistas populares são armazenados em cache em um pool limitado usando uma estratégia de evicção LFU mais recente; a taxa de acertos varia de 43% a 70%, e o tamanho do cache tem quase nenhum impacto na velocidade, pois o SSD da Apple pode lidar com a sobrecarga dos erros.

Toda a passagem direta é executada no Metal usando shaders compilados em tempo de execução, portanto, não há necessidade de uma toolchain Metal durante a compilação, e o mesmo código pode ser implantado diretamente no iOS. Mais interessante ainda, 75% das camadas usam atenção linear Gated DeltaNet com um estado cíclico de tamanho fixo, o que significa que, independentemente do comprimento do contexto, ele nunca cresce um cache KV expansivo — o ônus oculto de conversas longas é silenciosamente transferido.

O Swiftlet não é apenas um brinquedo de linha de comando. Ele tem quatro identidades projetadas para si mesmo. Como biblioteca, o SwiftletCore pode ser incorporado em qualquer aplicativo macOS ou iOS, fornecendo capacidades de chat com saída incremental em streaming e cache de conversas; como ferramenta de linha de comando, swiftlet chat e swiftlet generate lidam com execução local e benchmarking, enquanto swiftlet-repack constrói contêineres diretamente a partir de checkpoints MLX e suporta retomar downloads do Hugging Face. Como servidor, swiftlet-server fornece interfaces de chat-completions compatíveis com OpenAI em um endereço de loopback, permitindo que qualquer interface de chat compatível com OpenAI se conecte ao modelo local; como aplicativo, a versão iOS do Priv AI incorpora o SwiftletCore como um mecanismo de modelo em streaming, permitindo que usuários comuns comecem a conversar simplesmente baixando-o.

Quanto à correção, cada passagem direta de cada camada é comparada camada por camada contra a implementação de referência mlx-lm, cobrindo formas de quantização f32 e int4. A decodificação incremental também é comparada com os resultados da sequência completa, e os kernels Metal foram verificados repetidamente contra referências precisas de CPU. O contêiner também pode realizar verificação em nível de bytes contra o checkpoint original — seja os especialistas lidos do cache ou do disco, as respostas são exatamente as mesmas.

Sua trajetória de inspiração é claramente explicada: o TurboFieldfare primeiro validou a viabilidade do streaming de especialistas para o Gemma no Mac, e o Swiftlet emprestou algumas experiências de design publicamente disponíveis dele, como usar pread para transmitir especialistas para pools de slots limitados, usar LFU mais recente para evicção e usar empacotamento de passo fixo para que uma leitura equivalha a uma busca. No entanto, o resto foi escrito do zero, com cerca de 10.000 linhas de código Swift e Metal, abordando a arquitetura mista completamente diferente do Qwen: atenção linear Gated DeltaNet, GQA com portas e MoE altamente esparsa com especialistas compartilhados. Ele também implementa cálculos de quantização em grupo int4/int8 estilo MLX no Metal, usando kernels endereçáveis por byte e deslocamentos de 64 bits para suportar gigabytes de fragmentos.

Artigo relacionado
A Tencent reorganiza sua equipe de grandes modelos, com Yao Shunyu assumindo a responsabilidade pelos modelos básicos A Tencent reorganiza sua equipe de grandes modelos, com Yao Shunyu assumindo a responsabilidade pelos modelos básicos A equipe multimodal do Hunyuan da Tencent concluiu recentemente uma reestruturação significativa e uma mudança estratégica. Lu Xudong, que anteriormente liderava os esforços de compreensão multimodal da xAI, juntou-se ao Hunyuan para comandar os algo
Plataforma Aberta Tongyi Qianwen é Lançada, Trazendo Conversação como Serviço para o Cotidiano Plataforma Aberta Tongyi Qianwen é Lançada, Trazendo Conversação como Serviço para o Cotidiano A Plataforma Aberta Tongyi Qianwen foi oficialmente lançada, fornecendo aos desenvolvedores acesso a serviços em dispositivos móveis, computadores e óculos de realidade aumentada. Os usuários não precisam mais alternar entre aplicativos; eles podem c
Fundador com câncer utiliza IA em contra-ataque Fundador com câncer utiliza IA em contra-ataque Conno Christou recusa-se a deixar sua saúde ao acaso. Ele monitora o sono com uma pulseira Whoop, cruza os dados com um anel Oura e realiza quase 100 testes de biomarcadores anualmente. Por quatro anos consecutivos, seguiu os protocolos de análise sa
Recomendações de tópicos especiais relacionados
Composição musical Melhores Ferramentas de Demonstração de Voz por IA para Protótipos de Faixas
Melhores Ferramentas de Demonstração de Voz por IA para Protótipos de Faixas

Os melhores e mais bem avaliados ferramentas de demonstração vocal com IA de 2026 para protótipos de faixas estão aqui no XIX.AI! Esta lista selecionada apresenta ferramentas poderosas e transformadoras, testadas em cenários reais para garantir alto desempenho. Você encontrará uma comparação entre opções gratuitas e pagas, classificações detalhadas e opções imperdíveis perfeitas para aumentar a eficiência criativa e ajudá-lo a desbloquear sua vantagem com IA. Explore agora para descobrir a ferramenta ideal para você!

10 ferramentas
xix.ai
Desenvolvimento de software Ferramentas de simulação de APIs de IA para a colaboração entre front-end e back-end
Ferramentas de simulação de APIs de IA para a colaboração entre front-end e back-end

As melhores e mais bem avaliadas ferramentas de simulação de API de IA de 2026 para colaboração entre front-end e back-end estão aqui no XIX.AI! Esta lista selecionada apresenta soluções poderosas e revolucionárias que ajudam as equipes a otimizar fluxos de trabalho, aumentar a produtividade e criar aplicativos de alta qualidade mais rapidamente, por meio de testes reais e classificações rigorosas. Veja uma comparação entre as versões gratuitas e pagas para encontrar a opção imperdível que atenda às suas necessidades. Explore agora para aproveitar ao máximo o potencial da IA!

12 ferramentas
xix.ai
Design e Arte Ferramentas de referência de estilo do Midjourney para conceitos de personagens, pôsteres e imagens publicitárias
Ferramentas de referência de estilo do Midjourney para conceitos de personagens, pôsteres e imagens publicitárias

As melhores e mais bem avaliadas ferramentas de referência no estilo Midjourney de 2026 para conceitos de personagens, pôsteres e visuais publicitários! A XIX.AI selecionou uma coleção poderosa e revolucionária, que passa por testes práticos atualizados semanalmente. Você encontra análises detalhadas comparando versões gratuitas e pagas, além de rankings confiáveis, para ajudá-lo a escolher a opção imperdível que impulsiona sua criatividade e agiliza significativamente seu fluxo de trabalho. Explore agora e descubra a ferramenta perfeita para todas as suas necessidades de design visual.

11 ferramentas
xix.ai
Composição musical Ferramentas de Geração de Voz por IA: Crie Vocais de Demonstração e Camadas de Harmonia
Ferramentas de Geração de Voz por IA: Crie Vocais de Demonstração e Camadas de Harmonia

As melhores ferramentas de geração de voz por IA mais recentes e com as melhores avaliações de 2026 para criar vocais de demonstração e camadas de harmonia estão aqui no XIX.AI. Esta coleção selecionada apresenta soluções poderosas e revolucionárias que passaram por rigorosos testes no mundo real. Fornecemos uma comparação semanal atualizada entre versões gratuitas e pagas, juntamente com classificações detalhadas, para ajudá-lo a encontrar a ferramenta perfeita para impulsionar sua criatividade e produtividade. Explore agora para desbloquear sua vantagem com IA.

12 ferramentas
xix.ai
Produtividade Os melhores assistentes de foco com IA: reduza a alternância de tarefas e mantenha o foco
Os melhores assistentes de foco com IA: reduza a alternância de tarefas e mantenha o foco

Os melhores assistentes de IA com foco em produtividade de 2026, cuidadosamente selecionados para reduzir a troca de contexto e manter sua produtividade durante todo o dia. Essas ferramentas poderosas passam por testes rigorosos em condições reais, com uma comparação entre versões gratuitas e pagas, além de rankings atualizados semanalmente. Descubra a ferramenta perfeita para aumentar sua eficiência na escrita, estimular ideias criativas e manter o foco sem distrações. Explore agora no XIX.AI para aproveitar ao máximo sua vantagem com IA.

9 ferramentas
xix.ai
escrita Melhores ferramentas de edição por IA para textos corporativos claros e precisos
Melhores ferramentas de edição por IA para textos corporativos claros e precisos

Os melhores e mais atualizados ferramentas de edição por IA com alta avaliação, ideais para textos profissionais claros, estão disponíveis aqui no XIX.AI! Esta lista selecionada apresenta soluções poderosas e revolucionárias que ajudam a aumentar significativamente a eficiência na escrita, graças a testes em condições reais e classificações rigorosas. Você encontrará uma comparação entre as opções gratuitas e as pagas para auxiliá-lo a escolher a melhor alternativa. Explore agora e aproveite todas as vantagens oferecidas pela IA!

10 ferramentas
xix.ai
Comentários (0)
0/500
OR