Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.072 — 2026-09-14
REPO 在榜 3 天 约 3 分钟

Edge0突然冲榜:35B模型从哪来

Edge0把35B级模型压进3 GiB活动内存,冲榜背后是Qwen底座与按需加载

IMAGE — HF Trending Models(模型榜单)

你想在小内存设备上运行一个大模型,通常像要把整间仓库塞进客厅。Edge0换了个办法:仓库仍放在SSD里,每次只把眼下要用的几箱货搬进来。这个突然进入Hugging Face趋势榜的预览模型,吸引人的重点并不是“凭空造出一个35B”,而是试图让35B级模型以不到3 GiB的活动内存运行。

不过,现有数字和说明都来自Edge0自己的Hugging Face页面及同平台榜单,尚无独立复核。题目所说的榜单第三、下载增长123%和点赞增长64%,供稿没有对应数据,因此本文不把它们作为已核实事实。

35B从哪来?

答案已经写进模型页:Edge0-35B-A3B-preview以Qwen3.5-MoE 35B-A3B为底座,并非从零训练。这里的MoE是“专家混合模型”——模型内部有许多负责不同计算的“专家”模块,每处理一个token,也就是一小段文字单位,只调用其中少数几个。

页面列出的配置是40层、共256个专家,每个token启用4个。35B-A3B表示总规模约350亿参数、一次计算约激活30亿参数。它用大容量保存更多能力,同时把单步计算控制在较小范围。

Edge0在底座之外加入两类组件。一个是LoRA修正层——用少量额外参数调整模型;另一个是“预路由器”,提前预测下一步需要哪些专家。完整的四比特权重留在SSD,只把被选中的专家送进内存。四比特量化,就是用更低精度保存参数,以减少存储和内存占用。

真正的新意是提前备货

单纯从SSD按需读取会遇到等待:模型决定调用哪个专家后,计算可能停下来等数据。预路由器把判断提前一步,让读取专家权重与当前计算重叠。按Edge0自测,这一机制最高可把解码吞吐提高59%。

模型页称,整套流程的峰值活动内存低于3 GiB,解码速度约每秒15个token,长提示词的填充速度约每秒140个token。页面披露的性能测试使用24 GB内存的Mac mini M4 Pro;“手机级内存”说的是活动内存规模,并不等于材料已经证明它能在普通手机上以相同速度运行。

低精度也会损失能力。Edge0冻结四比特底座,再让LoRA向FP16教师模型学习。其OpenCompass自测显示,五项基准平均分为79.2,FP16底座为83.2,相差约3.9分。这些结果来自团队在相同设置下的内部测试,尚不是第三方验证。

为什么值得关注

这次冲榜反映出一个清晰方向:大模型的竞争不只看“有多聪明”,也看“能否在有限内存里跑起来”。Edge0把模型、LoRA、预路由器和专用推理框架打包发布,并提供MLX加载方式及OpenAI兼容接口。它卖的其实是一整套运行方案,而不只是一个权重文件。

“Preview”也很关键:预览版意味着能力、权重和使用条件仍可能调整。陌生名字和35B标签带来了注意力,但目前更值得观察的是它的SSD流式推理方案能否被独立复现。

局限与未知

  • 榜位、发布时间及下载和点赞增速没有可核查数据,无法确认“突然”发生在何时、幅度多大。
  • 速度、内存和基准成绩均为Edge0自测,尚缺第三方兼容性与性能复核。
  • 材料没有披露LoRA与预路由器的训练数据;目前只能确认底座和组件构成,不能进一步判断训练来源。

供稿材料 SOURCES — 1
01
Edge0/Edge0-35B-A3B-preview HF Trending Models(模型榜单) · REPO
原文 ↗

← 返回 2026-09-14 · 开源板块