Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.093 — 2026-10-05
NEWS 约 1 分钟

5KB汇编也能跑Gemma 2B

5.2KB纯汇编引擎让Gemma-2B在老款四核i5上跑到约4.6词元/秒。

通常,要让大模型在电脑上开口说话,得装上一整套运行软件。这个项目反过来追问:如果只保留最必要的零件,程序能小到什么程度?作者用纯x86-64汇编——几乎直接对应CPU指令的底层语言——写了一套Gemma-2B推理引擎,也就是加载现成模型并生成文字的程序。机器码合计只有5.2KB。

作者称,它在一台老款四核i5台式机上,以FP16(用16位数字保存参数和中间结果)运行,解码速度为每秒4.5至4.7个词元;词元是模型生成文字时处理的基本片段。引擎借助AVX2与F16C指令扩展并行计算,还为输入处理写了四线程矩阵乘法,测得内存带宽约18.5GB/s。它不依赖C/C++运行库或PyTorch,Python只负责申请内存和启动系统线程。

这不是要替代功能完整的llama.cpp,而像是把汽车拆到只剩能行驶的核心部件:它展示了现代Transformer究竟能摆脱多少通用软件层。代价也很明确,汇编难维护、难移植;上述体积与性能均来自作者自述。


供稿材料 SOURCES — 1

← 返回 2026-10-05 · 开源板块