Hogar
Paquetes de Swiftlet 80B Qwen en Mac con 4.3GB de memoria; iPhone 17 ejecutará 35B de forma nativa
Un entorno de ejecución en Swift + Metal llamado Swiftlet está redefiniendo «dónde pueden ejecarse los grandes modelos». Está específicamente diseñado para la familia de modelos MoE (Mixture of Experts) Qwen3-Next y Qwen3.5/3.6. La idea central es bastante ingeniosa: solo el núcleo denso y pequeño del modelo permanece en la memoria, mientras que la parte grande, los pesos de los expertos de enrutamiento, reside normalmente en el SSD y se transmite según sea necesario.
Los resultados son evidentes a partir de las cifras. En un Mac M5, la versión de 4 bits de Qwen3.6-35B-A3B ocupa 18 GB en disco pero solo alcanza un pico de 2,6 GB de memoria, decodificando a una velocidad de 7 a 10 tok/s; aún más impresionante es la versión de 4 bits de Qwen3-Next-80B-A3B, que requiere 42 GB en disco pero alcanza un pico de solo 4,3 GB de memoria, con una velocidad de 4,5 a 5 tok/s. La versión de 35B ahora puede ejecutarse en un iPhone 17, con unos 2,5 GB de memoria y una velocidad de aproximadamente 1 tok/s; según los desarrolladores, esta es la primera vez que un modelo de estas características se ejecuta de forma nativa en un teléfono sin necesidad de recurrir a un servidor.

El proyecto es completamente utilizable de extremo a extremo, y ambos modelos pueden producir salidas verificadas y correctas. El desarrollador también admite una compensación: cada token activa aproximadamente 3B de parámetros, por lo que estos modelos se comportan como grandes modelos durante las conversaciones y la escritura, pero aún actúan como modelos pequeños en términos de memoria factual.
Su principio de funcionamiento radica en la programación a gran escala. Cada capa enruta cada token a 10 de los 512 expertos (para la versión de 80B) o a 8 de los 256 expertos (para la versión de 35B). Swiftlet mantiene los pesos densos —atención, proyecciones DeltaNet, enrutadores, expertos compartidos y vectores de incrustación— firmemente en la memoria, ocupando aproximadamente 1,3 GB (para 35B) o 2,5 GB (para 80B) en 4 bits. Miles de expertos de enrutamiento se reempaquetan en bloques de datos de paso fijo, almacenados en contenedores .qpack. Para obtener un experto, solo se necesita una operación pread en el SSD, sin mmap, y no perturba la caché de páginas. Los expertos populares se almacenan en caché en un pool limitado utilizando una estrategia de evicción LFU más antigüedad; la tasa de aciertos oscila entre el 43 % y el 70 %, y el tamaño de la caché tiene casi ningún impacto en la velocidad, ya que el SSD de Apple puede manejar la sobrecarga de los fallos.
Todo el paso hacia adelante se ejecuta en Metal utilizando shaders compilados en tiempo de ejecución, por lo que no es necesario un entorno de herramientas de Metal durante la compilación, y el mismo código se puede implementar directamente en iOS. Más interesante aún, el 75 % de las capas utilizan atención lineal Gated DeltaNet con un estado cíclico de tamaño fijo, lo que significa que, independientemente de la longitud del contexto, nunca crece una caché KV expansiva; la carga oculta de las conversaciones de texto largo se descarga silenciosamente.
Swiftlet no es solo un juguete de línea de comandos. Tiene cuatro identidades diseñadas para sí mismo. Como biblioteca, SwiftletCore se puede incrustar en cualquier aplicación de macOS o iOS, proporcionando capacidades de chat con salida incremental en streaming y almacenamiento en caché de conversaciones; como herramienta de línea de comandos, swiftlet chat y swiftlet generate manejan la ejecución local y las pruebas de rendimiento, mientras que swiftlet-repack construye contenedores directamente desde puntos de control de MLX y admite la reanudación de descargas desde Hugging Face. Como servidor, swiftlet-server proporciona interfaces de chat-completions compatibles con OpenAI en una dirección de bucle invertido, permitiendo que cualquier interfaz de chat compatible con OpenAI se conecte al modelo local; como aplicación, la versión para iOS de Priv AI incrusta SwiftletCore como un motor de modelos en streaming, permitiendo que los usuarios habituales comiencen a chatear simplemente descargándolo.
En cuanto a la corrección, el paso hacia adelante de cada capa se compara capa por capa con la implementación de referencia de mlx-lm, cubriendo las formas de cuantización f32 e int4. La decodificación incremental también se compara con los resultados de la secuencia completa, y los núcleos de Metal se han verificado repetidamente frente a referencias precisas de CPU. El contenedor también puede realizar una verificación a nivel de bytes frente al punto de control original; ya sea que los expertos se lean desde la caché o desde el disco, las respuestas son exactamente las mismas.
Su trayectoria de inspiración está claramente explicada: TurboFieldfare validó primero la viabilidad de transmitir expertos para Gemma en Mac, y Swiftlet tomó prestadas algunas experiencias de diseño públicamente disponibles de este, como el uso de pread para transmitir expertos en pools de ranuras limitadas, el uso de LFU más antigüedad para la evicción, y el empaquetado de pasos fijos para que una lectura equivalga a una búsqueda. Sin embargo, el resto se escribió desde cero, con aproximadamente 10 000 líneas de código Swift y Metal, abordando la arquitectura mixta completamente diferente de Qwen: atención lineal Gated DeltaNet, GQA con compuertas y MoE de alta dispersión con expertos compartidos. Incluso implementa cálculos de cuantización grupal int4/int8 al estilo MLX en Metal, utilizando núcleos direccionables por bytes y desplazamientos de 64 bits para admitir gigabytes de fragmentos.
Artículo relacionado
Tencent reorganiza su equipo de modelos grandes mientras Yao Shunyu asume el liderazgo del modelo base
El equipo multimodal de Hunyuan de Tencent ha completado recientemente una reestructuración significativa y un cambio estratégico. Lu Xudong, anteriormente al frente de los esfuerzos de comprensión multimodal de xAI, se ha unido a Hunyuan para dirigi
Se lanza la Plataforma Abierta de Tongyi Qianwen, llevando la conversación como servicio a la vida cotidiana
La plataforma abierta Tongyi Qianwen ha sido lanzada oficialmente, proporcionando a los desarrolladores acceso a servicios en dispositivos móviles, ordenadores y gafas de realidad aumentada. Los usuarios ya no necesitan cambiar entre aplicaciones; pu
El fundador, afectado por el cáncer, despliega la inteligencia artificial en su contraataque
Conno Christou se niega a dejar su salud al azar. Monitorea su sueño con una banda Whoop, cruza los datos con un anillo Oura y se somete a casi 100 pruebas de biomarcadores anualmente. Durante cuatro años consecutivos, siguió los protocolos de anális
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Un entorno de ejecución en Swift + Metal llamado Swiftlet está redefiniendo «dónde pueden ejecarse los grandes modelos». Está específicamente diseñado para la familia de modelos MoE (Mixture of Experts) Qwen3-Next y Qwen3.5/3.6. La idea central es bastante ingeniosa: solo el núcleo denso y pequeño del modelo permanece en la memoria, mientras que la parte grande, los pesos de los expertos de enrutamiento, reside normalmente en el SSD y se transmite según sea necesario.
Los resultados son evidentes a partir de las cifras. En un Mac M5, la versión de 4 bits de Qwen3.6-35B-A3B ocupa 18 GB en disco pero solo alcanza un pico de 2,6 GB de memoria, decodificando a una velocidad de 7 a 10 tok/s; aún más impresionante es la versión de 4 bits de Qwen3-Next-80B-A3B, que requiere 42 GB en disco pero alcanza un pico de solo 4,3 GB de memoria, con una velocidad de 4,5 a 5 tok/s. La versión de 35B ahora puede ejecutarse en un iPhone 17, con unos 2,5 GB de memoria y una velocidad de aproximadamente 1 tok/s; según los desarrolladores, esta es la primera vez que un modelo de estas características se ejecuta de forma nativa en un teléfono sin necesidad de recurrir a un servidor.

El proyecto es completamente utilizable de extremo a extremo, y ambos modelos pueden producir salidas verificadas y correctas. El desarrollador también admite una compensación: cada token activa aproximadamente 3B de parámetros, por lo que estos modelos se comportan como grandes modelos durante las conversaciones y la escritura, pero aún actúan como modelos pequeños en términos de memoria factual.
Su principio de funcionamiento radica en la programación a gran escala. Cada capa enruta cada token a 10 de los 512 expertos (para la versión de 80B) o a 8 de los 256 expertos (para la versión de 35B). Swiftlet mantiene los pesos densos —atención, proyecciones DeltaNet, enrutadores, expertos compartidos y vectores de incrustación— firmemente en la memoria, ocupando aproximadamente 1,3 GB (para 35B) o 2,5 GB (para 80B) en 4 bits. Miles de expertos de enrutamiento se reempaquetan en bloques de datos de paso fijo, almacenados en contenedores .qpack. Para obtener un experto, solo se necesita una operación pread en el SSD, sin mmap, y no perturba la caché de páginas. Los expertos populares se almacenan en caché en un pool limitado utilizando una estrategia de evicción LFU más antigüedad; la tasa de aciertos oscila entre el 43 % y el 70 %, y el tamaño de la caché tiene casi ningún impacto en la velocidad, ya que el SSD de Apple puede manejar la sobrecarga de los fallos.
Todo el paso hacia adelante se ejecuta en Metal utilizando shaders compilados en tiempo de ejecución, por lo que no es necesario un entorno de herramientas de Metal durante la compilación, y el mismo código se puede implementar directamente en iOS. Más interesante aún, el 75 % de las capas utilizan atención lineal Gated DeltaNet con un estado cíclico de tamaño fijo, lo que significa que, independientemente de la longitud del contexto, nunca crece una caché KV expansiva; la carga oculta de las conversaciones de texto largo se descarga silenciosamente.
Swiftlet no es solo un juguete de línea de comandos. Tiene cuatro identidades diseñadas para sí mismo. Como biblioteca, SwiftletCore se puede incrustar en cualquier aplicación de macOS o iOS, proporcionando capacidades de chat con salida incremental en streaming y almacenamiento en caché de conversaciones; como herramienta de línea de comandos, swiftlet chat y swiftlet generate manejan la ejecución local y las pruebas de rendimiento, mientras que swiftlet-repack construye contenedores directamente desde puntos de control de MLX y admite la reanudación de descargas desde Hugging Face. Como servidor, swiftlet-server proporciona interfaces de chat-completions compatibles con OpenAI en una dirección de bucle invertido, permitiendo que cualquier interfaz de chat compatible con OpenAI se conecte al modelo local; como aplicación, la versión para iOS de Priv AI incrusta SwiftletCore como un motor de modelos en streaming, permitiendo que los usuarios habituales comiencen a chatear simplemente descargándolo.
En cuanto a la corrección, el paso hacia adelante de cada capa se compara capa por capa con la implementación de referencia de mlx-lm, cubriendo las formas de cuantización f32 e int4. La decodificación incremental también se compara con los resultados de la secuencia completa, y los núcleos de Metal se han verificado repetidamente frente a referencias precisas de CPU. El contenedor también puede realizar una verificación a nivel de bytes frente al punto de control original; ya sea que los expertos se lean desde la caché o desde el disco, las respuestas son exactamente las mismas.
Su trayectoria de inspiración está claramente explicada: TurboFieldfare validó primero la viabilidad de transmitir expertos para Gemma en Mac, y Swiftlet tomó prestadas algunas experiencias de diseño públicamente disponibles de este, como el uso de pread para transmitir expertos en pools de ranuras limitadas, el uso de LFU más antigüedad para la evicción, y el empaquetado de pasos fijos para que una lectura equivalga a una búsqueda. Sin embargo, el resto se escribió desde cero, con aproximadamente 10 000 líneas de código Swift y Metal, abordando la arquitectura mixta completamente diferente de Qwen: atención lineal Gated DeltaNet, GQA con compuertas y MoE de alta dispersión con expertos compartidos. Incluso implementa cálculos de cuantización grupal int4/int8 al estilo MLX en Metal, utilizando núcleos direccionables por bytes y desplazamientos de 64 bits para admitir gigabytes de fragmentos.
Tencent reorganiza su equipo de modelos grandes mientras Yao Shunyu asume el liderazgo del modelo base
El equipo multimodal de Hunyuan de Tencent ha completado recientemente una reestructuración significativa y un cambio estratégico. Lu Xudong, anteriormente al frente de los esfuerzos de comprensión multimodal de xAI, se ha unido a Hunyuan para dirigi
Se lanza la Plataforma Abierta de Tongyi Qianwen, llevando la conversación como servicio a la vida cotidiana
La plataforma abierta Tongyi Qianwen ha sido lanzada oficialmente, proporcionando a los desarrolladores acceso a servicios en dispositivos móviles, ordenadores y gafas de realidad aumentada. Los usuarios ya no necesitan cambiar entre aplicaciones; pu
El fundador, afectado por el cáncer, despliega la inteligencia artificial en su contraataque
Conno Christou se niega a dejar su salud al azar. Monitorea su sueño con una banda Whoop, cruza los datos con un anillo Oura y se somete a casi 100 pruebas de biomarcadores anualmente. Durante cuatro años consecutivos, siguió los protocolos de anális











