你让 AI 整理电脑里的合同、账单或私人笔记,最担心的往往不是它答得慢,而是文件要先传到云端。Perplexity 的思路是:敏感内容留在 Mac 上处理,再把适合联网的任务交给云端。为此,它公开了 Lily——一个面向 Apple Silicon、专门服务 Qwen3.6-35B-A3B 的轻量本地推理引擎。推理引擎就是应用背后的“发动机”,负责装载模型、完成计算,再把生成结果交回来。
把 Mac 变成一台专机
常见做法是使用 MLX-LM——建立在 Apple 开源 MLX 框架上的通用大模型运行工具,可以适配多种模型。Lily 走了相反方向:它不追求什么都能跑,而是围绕一种模型结构和一类芯片做专项优化。像是放弃制造通用工具箱,改做一把尺寸完全贴合的扳手。
据 Perplexity 介绍,Lily 用单一 Rust 进程管理模型、会话和生成循环,并通过兼容 OpenAI 的 chat-completions API 流式返回 token。token 可以理解为模型逐步吐出的文字单位。实际计算交给定制 Metal kernel——针对 Apple GPU 执行特点编写的小段计算程序;整条执行路径不依赖 PyTorch 或 MLX。
这套设计也利用了 Apple Silicon 的统一内存:CPU 和 GPU 共用一片内存,少做数据搬运。但本地模型仍要先装得下。Lily 使用 4-bit 量化——用更少位数保存模型权重,把约 70 GB 的 bfloat16 权重压到 19.4 GB。代价是数值精度有所降低,收益则是大模型更容易留在 Mac 的内存里运行。
快多少,要看它和谁比
Perplexity 在一台配备 40 核 GPU、128 GB 统一内存的 M5 Max MacBook Pro 上,将 Lily 与 MLX-LM 对比。其公布结果显示,Lily 的平均预填充吞吐为后者的 1.23 倍,解码吞吐为 1.35 倍。预填充是模型先读完提示词的阶段,解码则是随后逐词生成答案的阶段。
测试覆盖 256 到 128K token 的十种提示长度,以及十种解码上下文长度。Perplexity 称,Lily 在全部记录长度上都快于 MLX-LM。数值一致性方面,它在 192 个位置进行 teacher-forced 比较——给定正确上文,再检查下一步预测;Lily 的困惑度高 0.04%,两套引擎有 96.35% 的位置选中了同一个最高排名 token。这说明专项优化没有让输出行为出现明显偏离,但数据仍来自项目方自己的测试。
为什么这个样本值得看
据 Perplexity Blog,Lily 原本是其 Hybrid Compute 方案的一部分:云端负责搜索、规划和高强度推理,Mac 上的模型接触不该离开设备的私人文件。本地 privacy gate 会识别人名、地址、账号和密钥,再决定遮盖、留在本机、拒绝发送或询问用户。
因此,Lily 的价值不只是一组速度数字。它把商业产品内部的一块本地隐私计算后端公开出来,展示了另一种工程取舍:通用框架覆盖面广,专用引擎则可以围绕固定模型、固定硬件,把性能一点点削出来。对想研究 Apple 芯片本地部署的人来说,这比单纯宣布“Mac 能跑大模型”更具体。
局限与未知
- 性能和一致性数字均由 Perplexity 提供,目前材料没有独立复测,不能据此断言 Lily 普遍领先。
- Lily 针对 Qwen3.6-35B-A3B 和 Apple Silicon 专门优化;换模型或换硬件后是否仍有优势,现有材料没有说明。
- 公开的是独立演示源码。它与 Perplexity 商业产品中完整后端的功能边界、维护计划及生产部署条件,材料未披露。