人工智能前沿技术解读 · 按栏目浏览全部文章

寻想集团-超级人工智能有限公司全部文章

你的技术前沿之旅,从这里开始

语音模型的输入表示与训练路线

语音作为连续信号进入模型,需要先变成可处理的表示。

隔音录音室内的话筒与一块泛着微光的波形显示屏,整体为炭黑色调并带柔和黄色高光。
音频输入与处理示意。

一、频谱与离散化两条路线

一类方法直接把音频转换成频谱当作序列处理,另一类先把音频离散成离散符号再送入序列模型。前者在保留细节上更直接,后者在复用文本模型结构上更方便。

二、弱监督大规模预训练

Whisper 使用大量弱标注的语音数据训练,换来对多种口音与噪声环境的鲁棒性。这类工作的共同点是数据规模与标注成本之间的取舍:用弱标注换规模。

三、评估要按场景拆开

语音识别常用字错误率衡量,但真实业务还要考虑专有名词、语气与多人重叠场景,单一指标不足以反映可用性。

四、噪声与口音是主要失败来源

电话带宽、背景人声与非母语口音是弱监督训练最常覆盖的三类条件。实际业务部署时,应优先用自己业务的真实音频做抽样复核,而不是只看公开测试集。

五、可核对的来源

Robust Speech Recognition via Large-Scale Weak Supervision,arXiv:2212.04356。

六、适用边界

本文讨论表示方式与训练路线。具体字错误率依赖数据集,不在此比较。