咖啡机出了问题,身边又没有网络,一颗成本不高、算力和内存都很有限的芯片,能不能直接给出排查建议?开发者 slvDev_ 做了 Barista v0.1:一个只处理意式咖啡故障问答的专用小模型,完整运行在 ESP32-S3 上,不依赖云端。目前用户通过 USB 输入问题,答案会逐字显示在 OLED 屏幕或终端里。
它最巧的一步,是让模型“读得多、说得少”。Barista 能读入超过 8000 个 token(模型处理文字的基本单位),却只能从 854 个输出类别中组织回答。因为咖啡故障的表达范围有限,这把负责挑选下一个词的输出层从约 100 万参数缩到 10.9 万。较大的嵌入表则通过 Flash memory mapping——把闪存当作可按地址读取的空间——留在闪存中,避免整块挤进 RAM。
这也划出了专用小模型的边界:它甚至没有数字字符,因此无法输出数字;遇到无关问题,也可能胡乱给出咖啡建议,而不是拒答。作者还称,更深的版本没有改善当前效果,眼下瓶颈是问答数据的数量和质量,而非继续堆模型层数。