在 Mac 上跑本地 AI,模型装得下不等于用得顺:每次提问都等它重新读一遍固定说明,速度很容易拖慢。Rapid-MLX 是一套面向 Apple Silicon 的本地模型服务引擎,基于 MLX——Apple 为自家芯片推出的机器学习框架——运行,主攻低延迟、重复输入复用和 Agent 工具调用体验。
它最值得注意的是提示缓存(Prompt Cache):模型会保存系统提示、代码库背景等固定前缀产生的中间计算,后续请求不必从头再算。项目还兼容 OpenAI 与 Anthropic 的 API 格式;API 就是应用交换请求和结果的接口,兼容意味着 Cursor、Aider 等现有工具通常只需改服务地址和模型名,便可接入 Mac 本地引擎。
项目作者宣称其速度比 Ollama 快 2—4 倍,并支持 M1 至 M4 芯片,但供稿未披露完整测试模型、硬件配置和测量方法。这组成绩目前应视为项目方自测,仍需独立复测。