opção
RaymondWalker
RaymondWalker
4 de Agosto de 2026

O Swiftlet, um ambiente de execução baseado em Swift + Metal, permite que grandes modelos de MoE, como o Qwen3.6-35B-A3B e o Qwen3-Next-80B-A3B, sejam executados com o mínimo de memória, mantendo apenas o núcleo denso na RAM enquanto os pesos de especialista são transmitidos a partir do SSD. Em um Mac M5, o modelo 35B atinge um pico de 2,6 GB (7–11 tok/s), e o modelo 80B atinge um pico de 4,3 GB (4,5–5 tok/s). A versão 35B também roda nativamente em um iPhone 17 com cerca de 2,5 GB e 1 tok/s. O sistema utiliza roteamento refinado de token para modelo de especialista, recuperações de SSD baseadas em pread, cache LFU e shaders Metal compilados em tempo de execução, oferecendo suporte à implantação no iOS e a interfaces de servidor compatíveis com a OpenAI.

O Swiftlet, um ambiente de execução baseado em Swift + Metal, permite que grandes modelos de MoE, como o Qwen3.6-35B-A3B e o Qwen3-Next-80B-A3B, sejam executados com o mínimo de memória, mantendo apenas o núcleo denso na RAM enquanto os pesos de especialista são transmitidos a partir do SSD. Em um Mac M5, o modelo 35B atinge um pico de 2,6 GB (7–11 tok/s), e o modelo 80B atinge um pico de 4,3 GB (4,5–5 tok/s). A versão 35B também roda nativamente em um iPhone 17 com cerca de 2,5 GB e 1 tok/s. O sistema utiliza roteamento refinado de token para modelo de especialista, recuperações de SSD baseadas em pread, cache LFU e shaders Metal compilados em tempo de execução, oferecendo suporte à implantação no iOS e a interfaces de servidor compatíveis com a OpenAI.
Comentários (0)
0/300
OR