你想在家用电脑上运行大模型,常会遇到两道坎:模型装不下,生成也不够快。一个常见办法是压缩模型,再让显卡、系统内存甚至硬盘分担工作;但这像把大件行李拆进几只箱子,虽然带得走,来回搬运仍然费时。这次,开发者换了一个思路:不再只调整“怎么装”,而是为Qwen3.8-Flash-Next和特定电脑单独写了一套推理引擎,把生成速度推到最高65.1 token/s。
Token是模型处理文字时使用的小单位,token/s表示每秒能处理或生成多少个单位。据作者KnownAd4832在Reddit发布的测试,这套名为Strata的引擎运行在Windows主机上,配置为12GB RTX 5070 SFF、64GB DDR5-5600内存和Ryzen 5 7600。所有成绩均来自作者及其项目页面,目前没有独立第三方复测。
快,不只因为模型压得更小
推理引擎是装载模型并执行生成计算的软件。通用框架要照顾许多模型和硬件,像一把能拧多种螺丝的扳手;Strata则只面向一个模型和一类PC,可以针对固定任务做更激进的优化。代价也很直接:它目前只针对CUDA优化,适用范围更窄。
作者测试了三种量化版本。量化就是降低模型权重的数字精度,以减少内存和计算需求,但通常也要在速度、体积和输出质量之间取舍。在作者标为“128K context”的测试中,Q2_0输出65.1 token/s,IQ2_XS为52.0,IQ3_XXS为44.8。这里的128K究竟是已经填满的上下文、最大支持长度,还是某项测试参数,原帖没有说明。
输入阶段同样更快。Prompt processing又称prefill,指模型先读完并计算整段提示词的过程,它会影响长输入的处理速度和开始吐出第一个字前的等待。三种版本分别达到543、472和414 token/s。
作者还把Q2_0、IQ2_XS和IQ3_XXS分别称为相当于unsloth Q3、Q4和Q5,但没有解释“相当”的标准,因此不能把它们视为公认的量化等级对应关系。作者称RCO-GSQ的2-bit版本更快,也没有给出足以与Q2_0直接比较的具体数据。
“12GB显存”不等于只用12GB
标题最容易造成的误解,是以为整个模型都装进了12GB显存。实际上,作者列出的最低RAM与VRAM总容量分别是:Q2_0需37.6GB,IQ2_XS需39.2GB,IQ3_XXS需47GB;视觉编码器还要额外0.91GB。也就是说,最快的Q2_0即使使用全部12GB显存,仍至少需要约25.6GB系统内存参与。这是消费级显卡方案,但不是一台只有12GB总内存的机器。
这也延续了本刊9月16日报道的路线。当时,同一模型借助64GB内存、SSD卸载、量化和尚未合并的llama.cpp补丁,速度约为20.65 token/s。本次变化不只是再次拼装资源,而是为单一模型自建软件。它说明,在硬件不变的情况下,专用引擎仍可能释放明显性能;同时,它也把维护成本和兼容性问题留给了开发者。
数字里有一处明显矛盾
原帖正文称“同一个IQ3_XXS”可达到约65 token/s输出和约430 token/s提示词处理,但随后表格把IQ3_XXS列为44.8和414 token/s;65.1实际属于精度更低的Q2_0。两组表述无法同时成立,因此更稳妥的结论是:该机器上的最高公开表格成绩为Q2_0的65.1 token/s,而不是IQ3_XXS的65 token/s。
局限与未知
- 作者没有披露生成长度、批大小、采样设置、功耗、首字延迟、测试次数及量化后的质量损失,速度不能直接拿去和其他方案横向比较。
- 一键安装降低了试用门槛,但引擎目前只针对CUDA,尚不能据此推断其他显卡或操作系统上的表现。
- 结果只有项目方单一信源。它展示了专用优化的潜力,但是否稳定复现,仍需独立测试。