Пакеты Swiftlet 80B Qwen в Mac с памятью 4,3 ГБ; iPhone 17 будет работать с 35B нативно
Swiftlet — среда выполнения на базе Swift и Metal, которая переосмысливает понятие «места, где могут запускаться большие модели». Она специально адаптирована для семейства MoE (Mixture of Experts) моделей Qwen3-Next и Qwen3.5/3.6. Основная идея довольно изящна: в памяти остаётся только небольшая плотная часть модели, тогда как крупная часть — веса экспертов маршрутизации — обычно хранится на SSD и подгружается по мере необходимости.
Результаты наглядно демонстрируются цифрами. На Mac с чипом M5 версия Qwen3.6-35B-A3B в 4-битном квантовании занимает 18 ГБ на диске, но пиковое потребление памяти составляет всего 2,6 ГБ, а скорость декодирования — от 7 до 11 токенов в секунду; ещё более впечатляющим является 4-битная версия Qwen3-Next-80B-A3B, которой требуется 42 ГБ на диске, но пиковое потребление памяти составляет всего 4,3 ГБ при скорости 4,5–5 токенов в секунду. Версия на 35B миллиардов параметров теперь может работать на iPhone 17, потребляя около 2,5 ГБ памяти со скоростью примерно 1 токен в секунду — по словам разработчиков, это первый случай, когда такая модель работает нативно на телефоне без обращения к серверу.

Проект полностью готов к использованию в режиме end-to-end, и обе модели способны выдавать проверенные корректные результаты. Разработчик также признаёт компромисс: каждый токен фактически активирует около 3 миллиардов параметров, поэтому эти модели ведут себя как большие в ходе бесед и генерации текста, но при этом сохраняют характеристики малых моделей с точки зрения фактической памяти.
Принцип работы основан на тонкогранном планировании. Каждый слой маршрутизирует каждый токен к 10 из 512 экспертов (для версии 80B) или к 8 из 256 экспертов (для версии 35B). Swiftlet удерживает плотные веса — внимание, проекции DeltaNet, маршрутизаторы, общих экспертов и векторы встраивания — строго в памяти, занимая около 1,3 ГБ (для 35B) или 2,5 ГБ (для 80B) в 4-битном представлении. Тысячи экспертов маршрутизации переупакованы в блоки данных фиксированного шага и хранятся в контейнерах .qpack. Для получения одного эксперта требуется лишь одна операция pread на SSD, без использования mmap, и это не затрагивает кэш страниц. Популярные эксперты кэшируются в ограниченном пуле с использованием стратегии вытеснения LFU плюс учёт недавности; частота попаданий в кэш варьируется от 43% до 70%, а размер кэша практически не влияет на скорость, поскольку SSD Apple способна обработать накладные расходы при промахах.
Весь прямой проход выполняется в Metal с использованием шейдеров, компилируемых во время выполнения, поэтому не требуется инструментальный набор Metal на этапе сборки, и тот же код может быть напрямую развёрнут на iOS. Что ещё интереснее, 75% слоёв используют линейное внимание Gated DeltaNet с циклическим состоянием фиксированного размера, что означает: независимо от длины контекста, расширяющийся KV-кэш никогда не растёт — скрытая нагрузка долгих разговоров тихо перекладывается на другие механизмы.
Swiftlet — это не просто инструмент командной строки. У него четыре идентичности, созданные для себя. Как библиотека, SwiftletCore можно встроить в любое приложение macOS или iOS, обеспечивая возможности чата с потоковым инкрементным выводом и кэшированием разговоров; как инструмент командной строки, swiftlet chat и swiftlet generate обрабатывают локальное выполнение и бенчмаркинг, а swiftlet-repack создаёт контейнеры непосредственно из контрольных точек MLX и поддерживает возобновление загрузки с Hugging Face. Как сервер, swiftlet-server предоставляет интерфейсы chat-completions, совместимые с OpenAI, на адресе localhost, позволяя любому интерфейсу чата, совместимому с OpenAI, подключаться к локальной модели; как приложение, версия iOS Priv AI встраивает SwiftletCore в качестве потокового движка моделей, позволяя обычным пользователям начать общение, просто скачав его.
Что касается корректности, прямой проход каждого слоя сравнивается слой за слоем с эталонной реализацией mlx-lm, охватывая формы квантования f32 и int4. Инкрементное декодирование также сравнивается с результатами полной последовательности, а ядра Metal неоднократно проверялись против точных эталонных вычислений на CPU. Контейнер также может выполнять посимвольную проверку против исходной контрольной точки — независимо от того, читаются ли эксперты из кэша или с диска, ответы оказываются абсолютно одинаковыми.
Путь вдохновения чётко объяснён: TurboFieldfare сначала подтвердил возможность потоковой передачи экспертов для модели Gemma на Mac, и Swiftlet заимствовал некоторые общедоступные дизайнерские решения, такие как использование pread для потоковой передачи экспертов в ограниченные слоты, применение LFU плюс учёт недавности для вытеснения и фиксированная упаковка, при которой одно чтение равно одному запросу. Однако всё остальное было написано с нуля: около 10 000 строк кода на Swift и Metal, решающих совершенно иную смешанную архитектуру Qwen: линейное внимание Gated DeltaNet, GQA с гейтами и высоко разреженную MoE с общими экспертами. Реализованы даже вычисления квантования групп int4/int8 в стиле MLX в Metal, с использованием байтово-адресуемых ядер и 64-битных смещений для поддержки гигабайтов фрагментов.
Связанная статья
Tencent проводит перестановки в команде по работе с большими моделями, где Яо Шунью берет на себя руководство базовой моделью
Команда мультимодальных моделей Tencent Hunyuan недавно завершила масштабную реструктуризацию и стратегический поворот. Лу Сюдун, ранее руководивший работами по мультимодальному пониманию в xAI, присоединился к Hunyuan для руководства алгоритмами ген
Платформа Tongyi Qianwen открыта для разработчиков, предоставляя возможности диалогов как сервиса в повседневной жизни
Платета Tongyi Qianwen Open Platform официально запущена, предоставляя разработчикам доступ к услугам на мобильных устройствах, ПК и умных очках. Пользователям больше не нужно переключаться между приложениями; они могут выполнять различные повседневн
Основатель, страдающий раком, использует ИИ в ответной борьбе
Конно Христу не доверяет случайностям в вопросах своего здоровья. Он отслеживает сон с помощью браслета Whoop, сопоставляет эти данные с данными от кольца Oura и ежегодно проходит почти 100 тестов на биомаркеры. На протяжении четырех лет подряд он сл
Рекомендации по связанным специальным темам
Комментарии (0)
Swiftlet — среда выполнения на базе Swift и Metal, которая переосмысливает понятие «места, где могут запускаться большие модели». Она специально адаптирована для семейства MoE (Mixture of Experts) моделей Qwen3-Next и Qwen3.5/3.6. Основная идея довольно изящна: в памяти остаётся только небольшая плотная часть модели, тогда как крупная часть — веса экспертов маршрутизации — обычно хранится на SSD и подгружается по мере необходимости.
Результаты наглядно демонстрируются цифрами. На Mac с чипом M5 версия Qwen3.6-35B-A3B в 4-битном квантовании занимает 18 ГБ на диске, но пиковое потребление памяти составляет всего 2,6 ГБ, а скорость декодирования — от 7 до 11 токенов в секунду; ещё более впечатляющим является 4-битная версия Qwen3-Next-80B-A3B, которой требуется 42 ГБ на диске, но пиковое потребление памяти составляет всего 4,3 ГБ при скорости 4,5–5 токенов в секунду. Версия на 35B миллиардов параметров теперь может работать на iPhone 17, потребляя около 2,5 ГБ памяти со скоростью примерно 1 токен в секунду — по словам разработчиков, это первый случай, когда такая модель работает нативно на телефоне без обращения к серверу.

Проект полностью готов к использованию в режиме end-to-end, и обе модели способны выдавать проверенные корректные результаты. Разработчик также признаёт компромисс: каждый токен фактически активирует около 3 миллиардов параметров, поэтому эти модели ведут себя как большие в ходе бесед и генерации текста, но при этом сохраняют характеристики малых моделей с точки зрения фактической памяти.
Принцип работы основан на тонкогранном планировании. Каждый слой маршрутизирует каждый токен к 10 из 512 экспертов (для версии 80B) или к 8 из 256 экспертов (для версии 35B). Swiftlet удерживает плотные веса — внимание, проекции DeltaNet, маршрутизаторы, общих экспертов и векторы встраивания — строго в памяти, занимая около 1,3 ГБ (для 35B) или 2,5 ГБ (для 80B) в 4-битном представлении. Тысячи экспертов маршрутизации переупакованы в блоки данных фиксированного шага и хранятся в контейнерах .qpack. Для получения одного эксперта требуется лишь одна операция pread на SSD, без использования mmap, и это не затрагивает кэш страниц. Популярные эксперты кэшируются в ограниченном пуле с использованием стратегии вытеснения LFU плюс учёт недавности; частота попаданий в кэш варьируется от 43% до 70%, а размер кэша практически не влияет на скорость, поскольку SSD Apple способна обработать накладные расходы при промахах.
Весь прямой проход выполняется в Metal с использованием шейдеров, компилируемых во время выполнения, поэтому не требуется инструментальный набор Metal на этапе сборки, и тот же код может быть напрямую развёрнут на iOS. Что ещё интереснее, 75% слоёв используют линейное внимание Gated DeltaNet с циклическим состоянием фиксированного размера, что означает: независимо от длины контекста, расширяющийся KV-кэш никогда не растёт — скрытая нагрузка долгих разговоров тихо перекладывается на другие механизмы.
Swiftlet — это не просто инструмент командной строки. У него четыре идентичности, созданные для себя. Как библиотека, SwiftletCore можно встроить в любое приложение macOS или iOS, обеспечивая возможности чата с потоковым инкрементным выводом и кэшированием разговоров; как инструмент командной строки, swiftlet chat и swiftlet generate обрабатывают локальное выполнение и бенчмаркинг, а swiftlet-repack создаёт контейнеры непосредственно из контрольных точек MLX и поддерживает возобновление загрузки с Hugging Face. Как сервер, swiftlet-server предоставляет интерфейсы chat-completions, совместимые с OpenAI, на адресе localhost, позволяя любому интерфейсу чата, совместимому с OpenAI, подключаться к локальной модели; как приложение, версия iOS Priv AI встраивает SwiftletCore в качестве потокового движка моделей, позволяя обычным пользователям начать общение, просто скачав его.
Что касается корректности, прямой проход каждого слоя сравнивается слой за слоем с эталонной реализацией mlx-lm, охватывая формы квантования f32 и int4. Инкрементное декодирование также сравнивается с результатами полной последовательности, а ядра Metal неоднократно проверялись против точных эталонных вычислений на CPU. Контейнер также может выполнять посимвольную проверку против исходной контрольной точки — независимо от того, читаются ли эксперты из кэша или с диска, ответы оказываются абсолютно одинаковыми.
Путь вдохновения чётко объяснён: TurboFieldfare сначала подтвердил возможность потоковой передачи экспертов для модели Gemma на Mac, и Swiftlet заимствовал некоторые общедоступные дизайнерские решения, такие как использование pread для потоковой передачи экспертов в ограниченные слоты, применение LFU плюс учёт недавности для вытеснения и фиксированная упаковка, при которой одно чтение равно одному запросу. Однако всё остальное было написано с нуля: около 10 000 строк кода на Swift и Metal, решающих совершенно иную смешанную архитектуру Qwen: линейное внимание Gated DeltaNet, GQA с гейтами и высоко разреженную MoE с общими экспертами. Реализованы даже вычисления квантования групп int4/int8 в стиле MLX в Metal, с использованием байтово-адресуемых ядер и 64-битных смещений для поддержки гигабайтов фрагментов.
Tencent проводит перестановки в команде по работе с большими моделями, где Яо Шунью берет на себя руководство базовой моделью
Команда мультимодальных моделей Tencent Hunyuan недавно завершила масштабную реструктуризацию и стратегический поворот. Лу Сюдун, ранее руководивший работами по мультимодальному пониманию в xAI, присоединился к Hunyuan для руководства алгоритмами ген
Платформа Tongyi Qianwen открыта для разработчиков, предоставляя возможности диалогов как сервиса в повседневной жизни
Платета Tongyi Qianwen Open Platform официально запущена, предоставляя разработчикам доступ к услугам на мобильных устройствах, ПК и умных очках. Пользователям больше не нужно переключаться между приложениями; они могут выполнять различные повседневн
Основатель, страдающий раком, использует ИИ в ответной борьбе
Конно Христу не доверяет случайностям в вопросах своего здоровья. Он отслеживает сон с помощью браслета Whoop, сопоставляет эти данные с данными от кольца Oura и ежегодно проходит почти 100 тестов на биомаркеры. На протяжении четырех лет подряд он сл





Дом






