你的技术前沿之旅,从这里开始
语音模型的输入表示与训练路线
语音作为连续信号进入模型,需要先变成可处理的表示。

一、频谱与离散化两条路线
一类方法直接把音频转换成频谱当作序列处理,另一类先把音频离散成离散符号再送入序列模型。前者在保留细节上更直接,后者在复用文本模型结构上更方便。
二、弱监督大规模预训练
Whisper 使用大量弱标注的语音数据训练,换来对多种口音与噪声环境的鲁棒性。这类工作的共同点是数据规模与标注成本之间的取舍:用弱标注换规模。
三、评估要按场景拆开
语音识别常用字错误率衡量,但真实业务还要考虑专有名词、语气与多人重叠场景,单一指标不足以反映可用性。
四、噪声与口音是主要失败来源
电话带宽、背景人声与非母语口音是弱监督训练最常覆盖的三类条件。实际业务部署时,应优先用自己业务的真实音频做抽样复核,而不是只看公开测试集。
五、可核对的来源
Robust Speech Recognition via Large-Scale Weak Supervision,arXiv:2212.04356。
六、适用边界
本文讨论表示方式与训练路线。具体字错误率依赖数据集,不在此比较。