Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.086 — 2026-09-28
NEWS 约 1 分钟

M5上的本地Agent跑到50 tok/s

Splash 1.1拓宽模型入口,M5 Pro运行27B模型的Agent速度自报约50 token/s。

让编程 Agent 在 Mac 上直接跑大模型,价值很直观:代码和项目资料可以留在本机,也不必事事等待云端。9 月 26 日的 Splash 1.1.0 发布帖称,新版支持 GGUF 量化模型——把压缩后的模型权重、量化信息和元数据装在一起的常见文件格式——也能导入 MLX 模型。MLX 是 Apple 为自家芯片设计的机器学习框架。换句话说,Splash 正从少数预制模型,走向更容易接入现有本地模型资源。

发帖者自报,在配备 64GB 内存的 M5 Pro 上,以 Unsloth UD-Q4_K_XL 量化运行 Qwen3.8 27B 的 Agent 工作流,速度约为每秒 50 token;token 是模型生成文字时使用的小片段。据 Inco AI GitHub,Splash 是面向 Apple Silicon 的本地推理引擎,并提供兼容 OpenAI 与 Anthropic 的接口,方便 Agent 调用。不过帖子没有披露完整基准配置,官方文档也提醒:单一 token 速率不能代表冷启动、首次响应和完整 Agent 任务的整体体验。因此,这更适合作为本地工具链继续成熟的信号,而非可横向比较的性能结论。


供稿材料 SOURCES — 1

← 返回 2026-09-28 · 开源板块