想让门锁、玩具或小型传感器听懂一段话,通常得把录音传到云端;这个项目则把语音识别直接塞进一颗廉价芯片。作者称,他将 1310 万参数的 Conformer——兼顾局部声音特征和较长语境的语音模型——部署到售价不足 10 美元的 ESP32-S3 微控制器上,可在本地转写 8 秒音频。
关键不是换了一颗更强的芯片,而是给模型“瘦身”:先用蒸馏让小模型学习 NVIDIA 小型 Conformer,再用量化以更少位数存储和计算参数。最终模型占用 14MB 闪存,运行时使用 256KB SRAM 和 4MB PSRAM;芯片本身还能加速 8 位运算。代价也明确:作者自述,在 Hugging Face 的 ASR 基准数据集上,蒸馏与量化使词错误率增加约 3%。
它离实用仍有距离。作者直言速度“慢得痛苦”,且没有给出当前版本的具体耗时;不过最初版本转写 5 秒音频要推理 10 分钟,尝试 Whisper tiny 时更超过 50 分钟。现阶段的意义不是做出一台流畅的离线听写机,而是证明:自动语音识别也能进入没有完整操作系统、内存极少的十美元级硬件。