一个名为 swiftlet 的 swift + metal 运行时正悄然改写“大模型可部署平台”的边界。它专为 qwen3-next 与 qwen3.5/3.6 系列 moe 混合架构模型量身打造,核心策略颇为精巧:仅将模型中轻量级的稠密主干常驻内存,而真正庞大的部分——即路由激活的专家权重——则长期静卧于 ssd 中,按需实时流式加载。
性能数据极具说服力。在 M5 Mac 上,Qwen3.6-35B-A3B 的 4-bit 版本磁盘占用 18GB,峰值内存却仅需 2.6GB,解码速度达 7–11 tok/s;更令人瞩目的是 Qwen3-Next-80B-A3B 的 4-bit 版本,磁盘空间需 42GB,峰值内存却压至 4.3GB,速度稳定在 4.5–5 tok/s。尤为突破的是,35B 版本已可在 iPhone17 上原生运行,内存占用约 2.5GB,推理速度约为 1 tok/s——据项目开发者确认,这是同量级模型首次实现完全离线、无服务端依赖的手机端本地执行。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

该项目已完成端到端可用验证,两个模型均能输出经严格校验的正确结果。开发者亦坦诚指出一项权衡:每个 token 实际仅激活约 3B 参数,因此模型在对话生成与文本创作中表现类大模型,但在事实性记忆能力上仍接近中小规模模型。
深入其机制,关键在于极细粒度的调度设计。每层对每个 token 动态路由至 512 个专家中的 10 个(80B 版)或 256 个专家中的 8 个(35B 版)。Swiftlet 将注意力模块、DeltaNet 投影层、路由器、共享专家及嵌入向量等稠密组件牢牢锁定于内存——4-bit 量化下分别占约 1.3GB(35B)或 2.5GB(80B)。而数以千计的路由专家被重新组织为固定步长的数据块,封装进 .qpack 容器;加载单个专家仅需一次 pread 系统调用,无需 mmap,亦不干扰内核页缓存。热门专家被缓存在有限容量池中,淘汰策略融合 LFU 与近期访问频率;实测缓存命中率介于 43% 至 70%,且缓存大小对整体吞吐影响甚微——Apple 高速 SSD 足以消化未命中带来的 I/O 延迟。
全部前向传播均在 Metal 上执行,着色器由运行时即时编译,构建阶段无需 Metal SDK 支持,同一套代码无缝适配 iOS 与 macOS。更值得关注的是,75% 的层采用 Gated DeltaNet 线性注意力机制,配备固定尺寸循环状态,彻底规避传统 KV 缓存随上下文长度线性膨胀的问题——长文本交互中潜藏的内存与延迟负担由此悄然消解。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
Swiftlet 并非仅限命令行的实验工具,它被赋予四重角色:
- 作为库:SwiftletCore 可集成至任意 macOS 或 iOS 应用,提供支持流式增量输出与对话上下文缓存的聊天能力;
-
作为 CLI 工具:
swiftlet chat与swiftlet generate分别用于本地交互与基准测试,swiftlet-repack支持从 MLX 检查点直接构建 .qpack 容器,并兼容 Hugging Face 断点续传下载; -
作为服务:
swiftlet-server在本地回环地址暴露 OpenAI 兼容的/v1/chat/completions接口,任何遵循 OpenAI 协议的前端均可直连本地模型; - 作为应用:iOS 端 Priv AI 已将 SwiftletCore 深度嵌入,作为底层流式推理引擎,普通用户点击下载即可开启本地对话。
在正确性保障方面,每一层前向计算均与 mlx-lm 参考实现逐层比对,覆盖 f32 与 int4 两种精度;增量解码结果亦与全序列一次性推理结果严格对齐;Metal 内核经过反复校验,确保与 CPU 精确参考一致;容器文件本身还支持与原始检查点进行字节级哈希校验——无论专家来自缓存抑或磁盘,最终输出完全一致。
其技术脉络清晰可溯:TurboFieldfare 早先在 Mac 平台验证了 Gemma 类 MoE 模型专家流式加载的可行性;Swiftlet 借鉴了其中若干公开工程经验,例如使用 pread 实现专家按需载入有界槽位池、LFU 结合近期性策略的缓存淘汰、以及固定步长打包确保单次 fetch 即完成专家加载。但其余模块几乎全部从零构建——约一万行 Swift 与 Metal 代码,硬核攻克 Qwen 独特混合架构:Gated DeltaNet 线性注意力、门控分组查询注意力(GQA),以及含共享专家的高稀疏 MoE。它甚至在 Metal 中完整复现了 MLX 风格的 int4/int8 分组量化计算,通过字节寻址内核与 64 位偏移机制,支撑起数 GB 规模的权重分片读取。
部署门槛并不苛刻:Apple Silicon 芯片、macOS 14+ 或 iOS 17+ 系统,外加充足 SSD 空间(35B 需 18GB,80B 需 42GB)。iPhone 用户当前可通过 App Store 下载 Priv AI 应用,在 Experimental Models 设置中启用该功能(新版本尚处审核流程);若希望即刻体验,亦可直接从源码构建。项目整体以 Apache 2.0 协议开源,模型权重需单独下载并遵守各自授权条款。










