opción
Hogar
Noticias
Paquetes de Swiftlet 80B Qwen en Mac con 4.3GB de memoria; iPhone 17 ejecutará 35B de forma nativa

Paquetes de Swiftlet 80B Qwen en Mac con 4.3GB de memoria; iPhone 17 ejecutará 35B de forma nativa

24 de septiembre de 2026
5

Un entorno de ejecución en Swift + Metal llamado Swiftlet está redefiniendo «dónde pueden ejecarse los grandes modelos». Está específicamente diseñado para la familia de modelos MoE (Mixture of Experts) Qwen3-Next y Qwen3.5/3.6. La idea central es bastante ingeniosa: solo el núcleo denso y pequeño del modelo permanece en la memoria, mientras que la parte grande, los pesos de los expertos de enrutamiento, reside normalmente en el SSD y se transmite según sea necesario.

Los resultados son evidentes a partir de las cifras. En un Mac M5, la versión de 4 bits de Qwen3.6-35B-A3B ocupa 18 GB en disco pero solo alcanza un pico de 2,6 GB de memoria, decodificando a una velocidad de 7 a 10 tok/s; aún más impresionante es la versión de 4 bits de Qwen3-Next-80B-A3B, que requiere 42 GB en disco pero alcanza un pico de solo 4,3 GB de memoria, con una velocidad de 4,5 a 5 tok/s. La versión de 35B ahora puede ejecutarse en un iPhone 17, con unos 2,5 GB de memoria y una velocidad de aproximadamente 1 tok/s; según los desarrolladores, esta es la primera vez que un modelo de estas características se ejecuta de forma nativa en un teléfono sin necesidad de recurrir a un servidor.

image.png

El proyecto es completamente utilizable de extremo a extremo, y ambos modelos pueden producir salidas verificadas y correctas. El desarrollador también admite una compensación: cada token activa aproximadamente 3B de parámetros, por lo que estos modelos se comportan como grandes modelos durante las conversaciones y la escritura, pero aún actúan como modelos pequeños en términos de memoria factual.

Su principio de funcionamiento radica en la programación a gran escala. Cada capa enruta cada token a 10 de los 512 expertos (para la versión de 80B) o a 8 de los 256 expertos (para la versión de 35B). Swiftlet mantiene los pesos densos —atención, proyecciones DeltaNet, enrutadores, expertos compartidos y vectores de incrustación— firmemente en la memoria, ocupando aproximadamente 1,3 GB (para 35B) o 2,5 GB (para 80B) en 4 bits. Miles de expertos de enrutamiento se reempaquetan en bloques de datos de paso fijo, almacenados en contenedores .qpack. Para obtener un experto, solo se necesita una operación pread en el SSD, sin mmap, y no perturba la caché de páginas. Los expertos populares se almacenan en caché en un pool limitado utilizando una estrategia de evicción LFU más antigüedad; la tasa de aciertos oscila entre el 43 % y el 70 %, y el tamaño de la caché tiene casi ningún impacto en la velocidad, ya que el SSD de Apple puede manejar la sobrecarga de los fallos.

Todo el paso hacia adelante se ejecuta en Metal utilizando shaders compilados en tiempo de ejecución, por lo que no es necesario un entorno de herramientas de Metal durante la compilación, y el mismo código se puede implementar directamente en iOS. Más interesante aún, el 75 % de las capas utilizan atención lineal Gated DeltaNet con un estado cíclico de tamaño fijo, lo que significa que, independientemente de la longitud del contexto, nunca crece una caché KV expansiva; la carga oculta de las conversaciones de texto largo se descarga silenciosamente.

Swiftlet no es solo un juguete de línea de comandos. Tiene cuatro identidades diseñadas para sí mismo. Como biblioteca, SwiftletCore se puede incrustar en cualquier aplicación de macOS o iOS, proporcionando capacidades de chat con salida incremental en streaming y almacenamiento en caché de conversaciones; como herramienta de línea de comandos, swiftlet chat y swiftlet generate manejan la ejecución local y las pruebas de rendimiento, mientras que swiftlet-repack construye contenedores directamente desde puntos de control de MLX y admite la reanudación de descargas desde Hugging Face. Como servidor, swiftlet-server proporciona interfaces de chat-completions compatibles con OpenAI en una dirección de bucle invertido, permitiendo que cualquier interfaz de chat compatible con OpenAI se conecte al modelo local; como aplicación, la versión para iOS de Priv AI incrusta SwiftletCore como un motor de modelos en streaming, permitiendo que los usuarios habituales comiencen a chatear simplemente descargándolo.

En cuanto a la corrección, el paso hacia adelante de cada capa se compara capa por capa con la implementación de referencia de mlx-lm, cubriendo las formas de cuantización f32 e int4. La decodificación incremental también se compara con los resultados de la secuencia completa, y los núcleos de Metal se han verificado repetidamente frente a referencias precisas de CPU. El contenedor también puede realizar una verificación a nivel de bytes frente al punto de control original; ya sea que los expertos se lean desde la caché o desde el disco, las respuestas son exactamente las mismas.

Su trayectoria de inspiración está claramente explicada: TurboFieldfare validó primero la viabilidad de transmitir expertos para Gemma en Mac, y Swiftlet tomó prestadas algunas experiencias de diseño públicamente disponibles de este, como el uso de pread para transmitir expertos en pools de ranuras limitadas, el uso de LFU más antigüedad para la evicción, y el empaquetado de pasos fijos para que una lectura equivalga a una búsqueda. Sin embargo, el resto se escribió desde cero, con aproximadamente 10 000 líneas de código Swift y Metal, abordando la arquitectura mixta completamente diferente de Qwen: atención lineal Gated DeltaNet, GQA con compuertas y MoE de alta dispersión con expertos compartidos. Incluso implementa cálculos de cuantización grupal int4/int8 al estilo MLX en Metal, utilizando núcleos direccionables por bytes y desplazamientos de 64 bits para admitir gigabytes de fragmentos.

Artículo relacionado
Tencent reorganiza su equipo de modelos grandes mientras Yao Shunyu asume el liderazgo del modelo base Tencent reorganiza su equipo de modelos grandes mientras Yao Shunyu asume el liderazgo del modelo base El equipo multimodal de Hunyuan de Tencent ha completado recientemente una reestructuración significativa y un cambio estratégico. Lu Xudong, anteriormente al frente de los esfuerzos de comprensión multimodal de xAI, se ha unido a Hunyuan para dirigi
Se lanza la Plataforma Abierta de Tongyi Qianwen, llevando la conversación como servicio a la vida cotidiana Se lanza la Plataforma Abierta de Tongyi Qianwen, llevando la conversación como servicio a la vida cotidiana La plataforma abierta Tongyi Qianwen ha sido lanzada oficialmente, proporcionando a los desarrolladores acceso a servicios en dispositivos móviles, ordenadores y gafas de realidad aumentada. Los usuarios ya no necesitan cambiar entre aplicaciones; pu
El fundador, afectado por el cáncer, despliega la inteligencia artificial en su contraataque El fundador, afectado por el cáncer, despliega la inteligencia artificial en su contraataque Conno Christou se niega a dejar su salud al azar. Monitorea su sueño con una banda Whoop, cruza los datos con un anillo Oura y se somete a casi 100 pruebas de biomarcadores anualmente. Durante cuatro años consecutivos, siguió los protocolos de anális
Recomendaciones de temas especiales relacionados
composicion musical Mejores herramientas de demostración de voz con IA para prototipos de pistas
Mejores herramientas de demostración de voz con IA para prototipos de pistas

2026 Últimas, mejores y más valoradas herramientas de demostración vocal con IA para prototipos de pistas ya están disponibles en XIX.AI. Esta lista seleccionada incluye herramientas poderosas y transformadoras que han pasado pruebas en el mundo real para garantizar un rendimiento óptimo. Encontrarás una comparación entre versiones gratuitas y de pago, clasificaciones detalladas y opciones imprescindibles perfectas para potenciar la eficiencia creativa y ayudarte a desbloquear tu ventaja con IA. ¡Explora ahora para descubrir la herramienta ideal para ti!

10 herramientas
xix.ai
Desarrollo de software Herramientas de simulación de API de IA para la colaboración entre front-end y back-end
Herramientas de simulación de API de IA para la colaboración entre front-end y back-end

¡Ya están aquí, en XIX.AI, las mejores herramientas de simulación de API de IA de 2026, mejor valoradas para la colaboración entre front-end y back-end! Esta lista seleccionada incluye soluciones potentes y revolucionarias que ayudan a los equipos a optimizar los flujos de trabajo, aumentar la productividad y crear aplicaciones de alta calidad más rápidamente, gracias a pruebas en condiciones reales y a rigurosas clasificaciones. Consigue una comparación entre las opciones gratuitas y de pago para encontrar la que mejor se adapte a tus necesidades. ¡Explora ahora mismo y descubre tu ventaja en IA!

12 herramientas
xix.ai
Diseño y Arte Herramientas de referencia de estilos de Midjourney para conceptos de personajes, carteles y material gráfico publicitario
Herramientas de referencia de estilos de Midjourney para conceptos de personajes, carteles y material gráfico publicitario

¡Las mejores y más valoradas herramientas de referencia al estilo Midjourney de 2026 para conceptos de personajes, carteles y material gráfico publicitario! XIX.AI ha seleccionado una potente colección revolucionaria que se somete a pruebas en el mundo real que se actualizan semanalmente. Encontrarás comparativas detalladas entre opciones gratuitas y de pago, así como clasificaciones fiables que te ayudarán a elegir la opción imprescindible que potencie tu creatividad y acelere significativamente tu flujo de trabajo. Explora ahora mismo y descubre la herramienta perfecta para todas tus necesidades de diseño visual.

11 herramientas
xix.ai
composicion musical Herramientas de generación de voz con IA: crea demos vocales y capas de armonía
Herramientas de generación de voz con IA: crea demos vocales y capas de armonía

2026 Últimas Mejores Herramientas de Generación de Voz con IA Mejor Valoradas para Crear Voces de Demo y Capas de Armonía están aquí en XIX.AI. Esta colección seleccionada presenta soluciones poderosas y revolucionarias que han superado rigurosas pruebas en el mundo real. Proporcionamos una comparación semanal actualizada entre versiones gratuitas y de pago junto con clasificaciones detalladas para ayudarte a encontrar la herramienta perfecta que impulse tu creatividad y productividad. Explora ahora para Desbloquear tu ventaja con IA.

12 herramientas
xix.ai
Productividad Los mejores asistentes de concentración basados en IA: reduce los cambios de contexto y mantén la concentración
Los mejores asistentes de concentración basados en IA: reduce los cambios de contexto y mantén la concentración

Los mejores asistentes de IA de 2026, seleccionados para reducir al mínimo los cambios de contexto y mantenerte productivo durante todo el día. Estas potentes herramientas se someten a rigurosas pruebas en condiciones reales y se presentan con una comparación entre las versiones gratuitas y de pago, además de clasificaciones que se actualizan semanalmente. Descubre la herramienta perfecta para potenciar tu eficiencia a la hora de escribir, dar rienda suelta a tus ideas creativas y mantener la concentración sin distracciones. Explora ahora en XIX.AI para sacar partido a tu ventaja con la IA.

9 herramientas
xix.ai
escribiendo Mejores herramientas de edición con IA para un texto empresarial claro y preciso
Mejores herramientas de edición con IA para un texto empresarial claro y preciso

¡Los mejores y más recientes herramientas de edición por IA con las calificaciones más altas para lograr un texto empresarial claro ya están disponibles en XIX.AI! Esta lista cuidadosamente seleccionada incluye soluciones potentes y revolucionarias que, gracias a pruebas en entornos reales y una evaluación rigurosa, le ayudarán a mejorar significativamente la eficiencia en su escritura. Encontrará una comparación entre las opciones gratuitas y de pago para que pueda elegir la más adecuada para sus necesidades. ¡Explore ahora y aproveche toda la ventaja que le brinda la inteligencia artificial!

10 herramientas
xix.ai
comentario (0)
0/500
OR