Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.085 — 2026-09-27
NEWS 约 1 分钟

SSD“扩显存”跑起7000亿模型

Colibrì把超大模型权重放进SSD按需读取,让普通笔记本也能加载7000亿级模型,但速度仍是代价。

IMAGE — 量子位

几百GB的模型,普通笔记本内存装不下怎么办?Colibrì的答案是:别全装。它把SSD当作模型的“仓库”,只在需要时取出一小部分权重,让没有独立显卡的电脑也能加载超大模型。据量子位报道,一台12核CPU、25GB内存的开发机已运行总参数744B(7440亿)的GLM-5.2。

关键在于GLM-5.2采用MoE(Mixture of Experts,混合专家)架构:模型虽大,每生成一个Token——可理解为一小段文字——只会调用少数“专家”子网络。Colibrì让约9.9GB的常用部分留在内存,把约370GB专家权重放在NVMe SSD;模型选中哪个专家,再把它读进来。它还缓存近期常用专家,并提前预测下一层可能调用谁。项目测试称,这种提前预测的可预测性达到71.6%。

代价是速度。报道显示,冷缓存时生成速度仅约0.05至0.1 Token/秒;128GB内存的纯CPU桌面机约为1.8 Token/秒。换句话说,它证明的是“普通电脑能装下并运行”,并不等于已经适合流畅日用。它的价值更像一条工程新路:用SSD容量和等待时间,换取低成本本地运行超大模型的可能。


供稿材料 SOURCES — 1

← 返回 2026-09-27 · 科技板块