Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.090 — 2026-10-02
NEWS 约 4 分钟

5美元芯片也能听懂人话

Oído把英语语音识别塞进无GPU、无NPU的ESP32-S3,项目方测试优于Whisper tiny.en。

你对着一件小家电说出完整句子,它若想把声音变成文字,通常得把录音交给云端,或依赖专门的 AI 芯片。Oído 想把这一步留在设备里:一颗资源远少于手机和电脑的 ESP32-S3 微控制器,不接云端,也没有 GPU 或 NPU,就能识别任意英语句子,而非只听懂几条预设口令。

这也是“5 美元芯片也能听懂人话”真正指向的事情。更准确地说,它做的是自动语音识别(ASR)——把语音转成文字,并不代表机器理解了话里的意思。“5 美元”则来自项目标题,团队没有交代具体采购渠道、数量或整板成本,因此更适合看作低成本定位,而不是可复核的固定价格。

本文数据均来自 Lokutor 团队于 2026 年 9 月 30 日公开的项目材料,目前仍属于项目方单一信源,尚无独立复现结果。

它怎样塞进一颗小芯片?

Oído 使用 NVIDIA Conformer-CTC Small,约 1300 万个参数。参数可以理解为模型训练后记住的数字规则;数量越多,通常越占空间、越费计算。团队又做了 int8 量化,把模型计算压缩为 8 位整数运算,以降低资源需求。

目标设备是带 8 MB PSRAM 和 16 MB flash 的 ESP32-S3。PSRAM 是运行时可用的外部内存,flash 则用来长期存放程序和模型。团队称,模型权重直接从 flash 读取,再由专门为 ESP32-S3 编写的 C 推理引擎完成整数矩阵运算。说白了,它没有把电脑上的语音模型原封不动搬过去,而是围绕这颗小芯片有限的内存和算力,重新安排模型如何存、如何算。

这里没有 GPU——擅长大规模并行计算的图形处理器,也没有 NPU——专门加速神经网络的单元。项目强调的正是:普通微控制器也能承担开放词汇识别,不必局限于“开灯”“关灯”这样的固定命令表。

项目方公布的成绩有多好?

团队用词错误率(WER)衡量识别效果。它统计识别结果中替换、漏掉和多出的词所占比例,数字越低通常越好。

据 Lokutor 项目公布的数据,Oído 在 LibriSpeech 的 test-clean 和 test-other 测试中,WER 分别为 3.7% 和 8.2%;项目列出的 Whisper tiny.en 对照值是 6.3% 和 15.9%。在加入 DEMAND 的汽车、厨房和餐厅噪声,以及多人声和混响后,Oído 的平均 WER 为 8.4%,对照的 Whisper tiny.en 为 12.1%。

这些数字说明,至少在团队选定的英语测试中,小模型并没有因为运行平台小就必然输给 Whisper tiny.en。项目标题把它概括为“beats Whisper-tiny”,但这句话需要收窄理解:对照对象实际是 Whisper tiny.en,而且 Oído 跑在 ESP32-S3 上,对照模型跑在笔记本电脑上。它是识别结果的比较,不是同硬件、同资源条件下的全面胜负。

为什么值得关注?

Oído 的看点不只是又一个更小的模型,而是把完整英语句子的转写推进到了微控制器这一档设备。对低成本语音设备开发者来说,这意味着一种不同的产品路径:设备可以在本地完成语音转文字,不依赖云端,也不必额外配置 AI 加速器。

项目已经开源,并提供 live_demo.py。开发者可以用电脑麦克风体验与目标芯片一致的算术过程。团队还称,主机版运算已与固件保持一致,并在 Espressif 的 QEMU 模拟器——一种用软件模拟目标硬件的工具——中核对了输出。

局限与未知

  • 截至公开当日,实体开发板的运行时间测量仍未发布;材料也没有给出实时率和实际内存占用,因此还无法判断它能否流畅用于具体产品。
  • 项目没有披露双方的解码参数、数据预处理及是否采用完全相同的评测流程;噪声测试的样本构造、信噪比、混响条件和统计口径也不清楚。“优于 Whisper tiny.en”目前只能视为项目方在这些测试上的报告。
  • 已公开结果只覆盖英语,不能外推到中文、多语言或任意现实环境。团队虽透露西班牙语版本已经完成,但尚未发布。

供稿材料 SOURCES — 1

← 返回 2026-10-02 · 开源板块