Canto: A speech model built for the real world
5 hours ago
- Canto 是 Wispr 先进接口实验室推出的一种新型语音模型,专为在嘈杂的真实世界条件下进行实时听写而设计。
- 与 Google、OpenAI、AssemblyAI 和 Deepgram 的模型相比,该模型在真实世界听写评估中实现了最低的词错误率(WER)。
- Canto 在包含困难音频的挑战集上总体排名第二,但在实时转录模型中领先,与低音量语音和短听写并列第一。
- 在公开基准(LibriSpeech、FLEURS、Common Voice)上,Canto 表现具有竞争力,尽管仅在 LibriSpeech 上并列最低 WER。
- 训练涉及监督微调,随后进行强化学习(使用 GRPO)以提高转录质量并专注于真实世界错误。
- 训练后的基础设施支持扩展,包括使用用户更正和上下文词汇来提高识别率。
- 方法如嫁接更正和上下文处理实验显示了在遵循上下文和信任音频之间可训练平衡。
- Canto 的继任者正在更大规模上训练,目标是更好地处理嘈杂音频、多人说话人分离、更广泛的语言和更好的上下文使用。
- 未来工作包括统一的转录和说话人分离,以及将语音模型与用户意图和应用上下文整合。
- 团队正在招聘研究人员,专注于语音识别、强化学习、说话人分离、多语言和多模态接口工作。