935万参数本地语音合成模型获66%盲听偏好率,质量超越多款更大模型

935万参数本地语音合成模型获66%盲听偏好率,质量超越多款更大模型

_

一款不足1000万参数的本地语音合成模型,在社区盲听测试中拿下66.2%的偏好率。独立开发者Owen本周发布Inflect-Micro-v2,主打「完整本地部署」——从文本直接输出波形,无需联网调用云端接口,24 kHz单声道输出。

为什么关注这个规模

传统高质量TTS往往需要上亿参数,云端部署是主流选择。Inflect-Micro-v2将参数压缩至约935万(FP32精度约37.5 MB),同时在三项硬指标上与更大的基线模型同台比较:

  • 人类盲听偏好:66.2%(21胜·10负·3平,对手包括KittenTTS Nano、Piper Low、Supertonic 3)
  • UTMOS22自然度预测:4.395分(95%置信区间4.381–4.408),超越图中所有对照系统
  • 三个ASR模型平均词错误率(WER):3.57%(Qwen3-ASR 2.52%、Nemotron 3.5 5.45%、Whisper large-v3 2.73%)

运行效率

该模型支持CPU和CUDA推理,在8核CPU、32 GB内存、四线程配置下,100个固定提示词的端到端合成速度快于实时,且不含ONNX优化。开发者同时提供了单独的ONNX推理路径,供追求更高吞吐量的场景使用。

Inflect-Micro-v2与更小体量的Nano版共享同一套API,区别在于Micro优先质量、Nano优先体积。开发者表示,如果这款模型获得足够关注,计划推进v3版本,可能加入更多语言、更多音色和稳定性改进。

编注:信源为Hugging Face模型卡页面,含完整评估协议、社区偏好测试、ASR诊断与运行时基准。材料未涉及模型训练数据来源与版权信息。


携程因垄断被罚没51.79亿元,滥用市场支配地位被定性 2026-07-25
GrapheneOS 如何封堵锁屏状态下的数据提取 2026-07-26