Swiftlet Packs 80B Qwen Into Mac With 4.3GB Memory; iPhone 17 to Run 35B Natively
Swift + Metal 런타임인 Swiftlet은 "대규모 모델이 어디에서 실행될 수 있는가"라는 개념을 재정의하고 있습니다. 이 프로젝트는 특히 Qwen3-Next 및 Qwen3.5/3.6 계열의 MoE(Expert 혼합) 모델들을 위해 특별히 설계되었습니다. 핵심 아이디어는 매우 독창적입니다. 모델의 작은 밀집 코어만 메모리에 유지되고, 라우팅 전문가 가중치와 같은 큰 부분은 일반적으로 SSD에 저장되며 필요할 때 스트리밍되어 로드됩니다.
수치 결과를 보면 명확합니다. M5 Mac에서 Qwen3.6-35B-A3B의 4비트 버전은 디스크 상에서 18GB를 차지하지만 메모리 사용량은 최대 2.6GB에 불과하며, 디코딩 속도는 초당 7~11 토큰입니다. 더욱 인상적인 것은 Qwen3-Next-80B-A3B의 4비트 버전으로, 디스크에서 42GB가 필요하지만 메모리 사용량은 최대 4.3GB에 불과하며 속도는 초당 4.5~5 토큰입니다. 35B 버전은 이제 iPhone 17에서 약 2.5GB의 메모리와 초당 약 1 토큰의 속도로 실행할 수 있습니다. 개발자에 따르면, 이는 서버에 접근하지 않고도 스마트폰에서 해당 모델을 네이티브로 실행한 최초의 사례입니다.

이 프로젝트는 전체 엔드투엔드 사용이 가능하며, 두 모델 모두 검증된 정확한 출력을 생성할 수 있습니다. 개발자는 또한 일종의 타협점을 인정합니다. 각 토큰은 실제로 약 3B의 매개변수를 활성화하므로, 이러한 모델들은 대화 및 글쓰기 시에는 대규모 모델처럼 동작하지만 사실적 기억 측면에서는 여전히 소형 모델처럼 행동합니다.
그 작동 원리는 세분화된 스케줄링에 기반합니다. 각 레이어는 각 토큰을 512개 전문가 중 10개(80B 버전의 경우) 또는 256개 전문가 중 8개(35B 버전의 경우)로 라우팅합니다. Swiftlet은 어텐션, DeltaNet 투영, 라우터, 공유 전문가 및 임베딩 벡터와 같은 밀집 가중치를 메모리에 고정적으로 유지하며, 이는 4비트 기준 35B 버전의 경우 약 1.3GB, 80B 버전의 경우 약 2.5GB를 차지합니다. 수천 개의 라우팅 전문가는 고정 단계 데이터 블록으로 재패키징되어 .qpack 컨테이너에 저장됩니다. 단일 전문가를 가져오기 위해서는 SSD에서 단 하나의 pread 연산만 필요하며, mmap은 사용하지 않고 페이지 캐시를 방해하지도 않습니다. 인기 있는 전문가는 LFU와 최근성 전략을 결합한 제한된 풀에 캐시되며, 히트율은 43%에서 70% 사이입니다. 캐시 크기는 속도에 거의 영향을 미치지 않는데, 이는 Apple의 SSD가 미스(hit miss)로 인한 오버헤드를 처리할 수 있기 때문입니다.
전체 순전달(forward pass)은 런타임 컴파일된 셰이더를 사용하여 Metal에서 실행되므로, 빌드 시 Metal 툴체인이 필요하지 않으며 동일한 코드를 iOS에 직접 배포할 수 있습니다. 더욱 흥미로운 점은 레이어의 75%가 고정 크기 순환 상태를 가진 Gated DeltaNet 선형 어텐션을 사용한다는 것입니다. 즉, 컨텍스트 길이에 관계없이 확장되는 KV 캐시가 생성되지 않으며, 긴 텍스트 대화의 숨겨진 부담은 조용히 오프로드됩니다.
Swiftlet은 단순히 명령줄 장난감이 아닙니다. 자체적으로 네 가지 정체성을 갖추고 있습니다. 라이브러리로서 SwiftletCore는 모든 macOS 또는 iOS 앱에 임베드되어 스트리밍 증분 출력 및 대화 캐싱 기능을 갖춘 채팅 기능을 제공합니다. 명령줄 도구로서 swiftlet chat과 swiftlet generate는 로컬 실행 및 벤치마킹을 처리하며, swiftlet-repack은 MLX 체크포인트에서 직접 컨테이너를 빌드하고 Hugging Face에서의 다운로드 재개를 지원합니다. 서버로서 swiftlet-server는 로컬 주소에서 OpenAI 호환 채팅-완성 인터페이스를 제공하여, 모든 OpenAI 호환 채팅 인터페이스가 로컬 모델에 연결할 수 있게 합니다. 애플리케이션으로서 iOS 버전의 Priv AI는 SwiftletCore를 스트리밍 모델 엔진으로 임베드하여 일반 사용자가 단순히 다운로드하기만 하면 채팅을 시작할 수 있게 합니다.
정확성과 관련하여, 각 레이어의 순전달은 mlx-lm 참조 구현과 레이어별로 비교되며, f32 및 int4 양자화 형태를 모두 포함합니다. 증분 디코딩은 전체 시퀀스 결과와 비교되며, Metal 커널은 정밀한 CPU 참조를 상대로 반복적으로 검증되었습니다. 컨테이너는 소스 체크포인트에 대해 바이트 단위 검증을 수행할 수 있으며, 전문가가 캐시에서 읽히든 디스크에서 읽히든 답변은 정확히 동일합니다.
그 영감의 경로는 명확하게 설명되어 있습니다. TurboFieldfare는 먼저 Mac에서 Gemma에 대한 전문가 스트리밍의 타당성을 검증했으며, Swiftlet은 이를 통해 pread를 사용하여 전문가를 제한된 슬롯 풀로 스트리밍하고, LFU와 최근성을 결합하여 교체 전략을 적용하며, 고정 단계 패키징을 사용하여 한 번의 읽기가 한 번의 가져오기가 되는 것과 같은 공개된 설계 경험들을 일부 차용했습니다. 그러나 나머지는 처음부터 작성되었으며, 약 10,000줄의 Swift 및 Metal 코드를 포함하여 완전히 다른 Qwen 혼합 아키텍처인 Gated DeltaNet 선형 어텐션, 게이트드 GQA, 그리고 공유 전문가를 가진 고-희소 MoE를 처리합니다. 심지어 바이트 주소 가능 커널과 64비트 오프셋을 사용하여 기가바이트 단위의 샤드를 지원하기 위해 MLX 스타일의 int4/int8 그룹 양자화 계산을 Metal에 구현했습니다.
관련 기사
통이치엔원 오픈 플랫폼 출시, 일상 속 대화형 서비스 실현
통이치엔원 오픈 플랫폼이 정식 출시되어 모바일 기기, PC, AI 안경 등 다양한 디바이스에서 서비스 접근을 개발자에게 제공합니다. 사용자는 이제 앱 간 전환이 필요하지 않으며, 대화창 내에서 다양한 일상 서비스 작업을 직접 완료할 수 있습니다.현재 플랫폼은 물류, 임대 주택, 홈 서비스, 금융 관리 등 10개 이상의 분야를 아우릅니다. 사용자는 @SF 익스프레스를 통해包裹를 추적하고 발송할 수 있으며, @지루 렌트에서 위치와 예산에 기반해 부
암에 걸린 창업자가 반격에 AI를 투입하다
Conno Christou는 자신의 건강을 운에 맡기지 않는다. 그는 Whoop 밴드로 수면을 모니터링하고, Oura 반지와 데이터를 교차 검증하며, 매년 거의 100가지의 바이오마커 검사를 받는다. 그는 Peter Attia와 Rhonda Patrick과 같은 장수 전문가들의 혈액 검사 프로토콜을 4년 연속으로 따랐으며, 보충제, 일주기 리듬, 단백질 섭취를 최적화했다. 35세 때 두 번째 회사를 설립하던 그는 그의 동료들 중 최신 건강 연구
Encore AI, 고객 전화 응대형 AI 에이전트 개발을 위해 3,000만 달러 투자 유치
기업 고객과의 상호작용을 분석하여 지원 및 영업 팀과 협업하거나 독립적으로 운영할 수 있는 AI 음성 에이전트를 훈련 및 배포하는 스타트업인 Encore AI가 Team8이 주도한 시리즈 A 투자 라운드에서 3,000만 달러를 유치했다.2022년 CEO 드비르 긴즈버그(Dvir Ginzburg)에 의해 ‘인사이트 IO(Insait IO)’라는 이름으로 설립
관련 특별 주제 추천
의견 (0)
0/500
Swift + Metal 런타임인 Swiftlet은 "대규모 모델이 어디에서 실행될 수 있는가"라는 개념을 재정의하고 있습니다. 이 프로젝트는 특히 Qwen3-Next 및 Qwen3.5/3.6 계열의 MoE(Expert 혼합) 모델들을 위해 특별히 설계되었습니다. 핵심 아이디어는 매우 독창적입니다. 모델의 작은 밀집 코어만 메모리에 유지되고, 라우팅 전문가 가중치와 같은 큰 부분은 일반적으로 SSD에 저장되며 필요할 때 스트리밍되어 로드됩니다.
수치 결과를 보면 명확합니다. M5 Mac에서 Qwen3.6-35B-A3B의 4비트 버전은 디스크 상에서 18GB를 차지하지만 메모리 사용량은 최대 2.6GB에 불과하며, 디코딩 속도는 초당 7~11 토큰입니다. 더욱 인상적인 것은 Qwen3-Next-80B-A3B의 4비트 버전으로, 디스크에서 42GB가 필요하지만 메모리 사용량은 최대 4.3GB에 불과하며 속도는 초당 4.5~5 토큰입니다. 35B 버전은 이제 iPhone 17에서 약 2.5GB의 메모리와 초당 약 1 토큰의 속도로 실행할 수 있습니다. 개발자에 따르면, 이는 서버에 접근하지 않고도 스마트폰에서 해당 모델을 네이티브로 실행한 최초의 사례입니다.

이 프로젝트는 전체 엔드투엔드 사용이 가능하며, 두 모델 모두 검증된 정확한 출력을 생성할 수 있습니다. 개발자는 또한 일종의 타협점을 인정합니다. 각 토큰은 실제로 약 3B의 매개변수를 활성화하므로, 이러한 모델들은 대화 및 글쓰기 시에는 대규모 모델처럼 동작하지만 사실적 기억 측면에서는 여전히 소형 모델처럼 행동합니다.
그 작동 원리는 세분화된 스케줄링에 기반합니다. 각 레이어는 각 토큰을 512개 전문가 중 10개(80B 버전의 경우) 또는 256개 전문가 중 8개(35B 버전의 경우)로 라우팅합니다. Swiftlet은 어텐션, DeltaNet 투영, 라우터, 공유 전문가 및 임베딩 벡터와 같은 밀집 가중치를 메모리에 고정적으로 유지하며, 이는 4비트 기준 35B 버전의 경우 약 1.3GB, 80B 버전의 경우 약 2.5GB를 차지합니다. 수천 개의 라우팅 전문가는 고정 단계 데이터 블록으로 재패키징되어 .qpack 컨테이너에 저장됩니다. 단일 전문가를 가져오기 위해서는 SSD에서 단 하나의 pread 연산만 필요하며, mmap은 사용하지 않고 페이지 캐시를 방해하지도 않습니다. 인기 있는 전문가는 LFU와 최근성 전략을 결합한 제한된 풀에 캐시되며, 히트율은 43%에서 70% 사이입니다. 캐시 크기는 속도에 거의 영향을 미치지 않는데, 이는 Apple의 SSD가 미스(hit miss)로 인한 오버헤드를 처리할 수 있기 때문입니다.
전체 순전달(forward pass)은 런타임 컴파일된 셰이더를 사용하여 Metal에서 실행되므로, 빌드 시 Metal 툴체인이 필요하지 않으며 동일한 코드를 iOS에 직접 배포할 수 있습니다. 더욱 흥미로운 점은 레이어의 75%가 고정 크기 순환 상태를 가진 Gated DeltaNet 선형 어텐션을 사용한다는 것입니다. 즉, 컨텍스트 길이에 관계없이 확장되는 KV 캐시가 생성되지 않으며, 긴 텍스트 대화의 숨겨진 부담은 조용히 오프로드됩니다.
Swiftlet은 단순히 명령줄 장난감이 아닙니다. 자체적으로 네 가지 정체성을 갖추고 있습니다. 라이브러리로서 SwiftletCore는 모든 macOS 또는 iOS 앱에 임베드되어 스트리밍 증분 출력 및 대화 캐싱 기능을 갖춘 채팅 기능을 제공합니다. 명령줄 도구로서 swiftlet chat과 swiftlet generate는 로컬 실행 및 벤치마킹을 처리하며, swiftlet-repack은 MLX 체크포인트에서 직접 컨테이너를 빌드하고 Hugging Face에서의 다운로드 재개를 지원합니다. 서버로서 swiftlet-server는 로컬 주소에서 OpenAI 호환 채팅-완성 인터페이스를 제공하여, 모든 OpenAI 호환 채팅 인터페이스가 로컬 모델에 연결할 수 있게 합니다. 애플리케이션으로서 iOS 버전의 Priv AI는 SwiftletCore를 스트리밍 모델 엔진으로 임베드하여 일반 사용자가 단순히 다운로드하기만 하면 채팅을 시작할 수 있게 합니다.
정확성과 관련하여, 각 레이어의 순전달은 mlx-lm 참조 구현과 레이어별로 비교되며, f32 및 int4 양자화 형태를 모두 포함합니다. 증분 디코딩은 전체 시퀀스 결과와 비교되며, Metal 커널은 정밀한 CPU 참조를 상대로 반복적으로 검증되었습니다. 컨테이너는 소스 체크포인트에 대해 바이트 단위 검증을 수행할 수 있으며, 전문가가 캐시에서 읽히든 디스크에서 읽히든 답변은 정확히 동일합니다.
그 영감의 경로는 명확하게 설명되어 있습니다. TurboFieldfare는 먼저 Mac에서 Gemma에 대한 전문가 스트리밍의 타당성을 검증했으며, Swiftlet은 이를 통해 pread를 사용하여 전문가를 제한된 슬롯 풀로 스트리밍하고, LFU와 최근성을 결합하여 교체 전략을 적용하며, 고정 단계 패키징을 사용하여 한 번의 읽기가 한 번의 가져오기가 되는 것과 같은 공개된 설계 경험들을 일부 차용했습니다. 그러나 나머지는 처음부터 작성되었으며, 약 10,000줄의 Swift 및 Metal 코드를 포함하여 완전히 다른 Qwen 혼합 아키텍처인 Gated DeltaNet 선형 어텐션, 게이트드 GQA, 그리고 공유 전문가를 가진 고-희소 MoE를 처리합니다. 심지어 바이트 주소 가능 커널과 64비트 오프셋을 사용하여 기가바이트 단위의 샤드를 지원하기 위해 MLX 스타일의 int4/int8 그룹 양자화 계산을 Metal에 구현했습니다.
통이치엔원 오픈 플랫폼 출시, 일상 속 대화형 서비스 실현
통이치엔원 오픈 플랫폼이 정식 출시되어 모바일 기기, PC, AI 안경 등 다양한 디바이스에서 서비스 접근을 개발자에게 제공합니다. 사용자는 이제 앱 간 전환이 필요하지 않으며, 대화창 내에서 다양한 일상 서비스 작업을 직접 완료할 수 있습니다.현재 플랫폼은 물류, 임대 주택, 홈 서비스, 금융 관리 등 10개 이상의 분야를 아우릅니다. 사용자는 @SF 익스프레스를 통해包裹를 추적하고 발송할 수 있으며, @지루 렌트에서 위치와 예산에 기반해 부
암에 걸린 창업자가 반격에 AI를 투입하다
Conno Christou는 자신의 건강을 운에 맡기지 않는다. 그는 Whoop 밴드로 수면을 모니터링하고, Oura 반지와 데이터를 교차 검증하며, 매년 거의 100가지의 바이오마커 검사를 받는다. 그는 Peter Attia와 Rhonda Patrick과 같은 장수 전문가들의 혈액 검사 프로토콜을 4년 연속으로 따랐으며, 보충제, 일주기 리듬, 단백질 섭취를 최적화했다. 35세 때 두 번째 회사를 설립하던 그는 그의 동료들 중 최신 건강 연구
Encore AI, 고객 전화 응대형 AI 에이전트 개발을 위해 3,000만 달러 투자 유치
기업 고객과의 상호작용을 분석하여 지원 및 영업 팀과 협업하거나 독립적으로 운영할 수 있는 AI 음성 에이전트를 훈련 및 배포하는 스타트업인 Encore AI가 Team8이 주도한 시리즈 A 투자 라운드에서 3,000만 달러를 유치했다.2022년 CEO 드비르 긴즈버그(Dvir Ginzburg)에 의해 ‘인사이트 IO(Insait IO)’라는 이름으로 설립





집






