Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.022 — 2026-07-26
NEWS 约 1 分钟

26B模型靠分页跑上iPhone

把模型权重分批从闪存调入内存,26B模型也能在iPhone本地运行

IMAGE — r/LocalLLaMA 日榜

手机跑大模型,常见难题不是算不动,而是内存装不下。Noema 创始人在 Reddit 展示了一个取巧办法:让 Q4_K_M 版 Gemma 4 26B-A4B 在 iPhone 17 Pro 上分页运行。模型分页像把厚书分册取用,不把全部权重同时塞进 RAM(高速工作内存);普通权重留在 RAM,专家权重——模型中负责不同任务的参数块——需要时再从 SSD(容量更大但更慢的闪存)读取。

代价很直接:能装下,不等于跑得快。作者自述,699 token 的输入以每秒 34.4 token 完成预处理,用时 20.34 秒;随后生成速度为每秒 3.5 token,完整回答约花 6 分钟。TTFT——提交问题后等到第一个文本片段的时间——和生成速度都会因读取闪存而变慢。这个演示的意义,是把手机本地模型的容量边界继续往上推;但目前证据来自团队自己的展示,摘要没有披露内存占用、功耗或独立测试结果。


供稿材料 SOURCES — 1

← 返回 2026-07-26 · 开源板块