手机运行大模型,常遇到一个现实问题:模型权重——支撑模型能力的整套数字参数——装不进手机的高速内存,只能临时从较慢的闪存搬进来。等需要时再搬,计算芯片会干等;提前搬,又可能猜错,白费读取和计算。LeanStream解决的正是这道取舍题。
它把过程改成“边猜边精修”:先用当时已有的信息预测下一步需要哪些权重,提前发起读取;GPU计算上一层时,系统再利用陆续产生的中间结果,不断修正权重的加载、保留和执行顺序。权重也按小块流入,GPU拿到高优先级部分就能开工,不必等整层数据到齐。系统还会在线调整CPU、GPU与存储之间的同步频率,以免沟通过勤反而拖慢速度。
作者在OnePlus 13及两款NVIDIA Jetson设备上测试三种7B模型,并自述:在达到既有方案最佳吞吐量时,LeanStream将内存占用减少4.8至7.5倍;继续追求速度时,每秒生成的token数量提升至1.6至2.1倍。这里的关键不只是“更准地预测”,而是让预测、搬运和计算组成一条持续修正的流水线。