想让浏览器或小设备在本机把文字念出来,模型往往既要占空间,又要吃算力。Inflect v2试着把这套能力塞进更小的包里:作者 b111ue 发布了两个完整的 TTS(文本转语音)模型,Inflect-Nano-v2 为396万参数、15.97 MB,Inflect-Micro-v2 为936万参数、37.53 MB,尺寸均按 FP32 格式计算。参数是模型训练后保存的数值,通常会影响文件大小、内存和计算成本。
这里值得注意的不是单独缩小某个部件,而是把文本处理、时长预测、语音生成和波形解码全部算进去。文字输入后可直接输出 24 kHz 音频,不需要外接声码器——也就是把声学表示还原为可播放声音的模型——或调用云端 API。两款模型均可通过同一套 PyTorch API 在 CPU 或 CUDA 上本地运行;Nano优先压低体积,Micro则用更多参数换取作者所称的清晰度、稳定性和整体音质。作者报告,两者的 CPU 推理速度分别达到实时的10.72倍和6.28倍,但参数更少不自动等于音质更好,现有材料也未提供独立测试结果。