Silent speech with ultrasound25 days agohttps://alephneuro.com/blog/silent-speech研究人员开发了一种模型,通过静默语音期间的超声舌像预测语音,在开放词汇语音上达到了15.6%的词错误率。该系统使用了从可听语音收集的50小时数据集,因为静默语音和有声语音的舌部运动相似,可通过音频转录进行质量检查。它采用ResNet-18 2+1d进行视频编码,使用Whisper解码器进行文本预测,训练重点在于将视频嵌入与Whisper的音频嵌入对齐。该模型可推广至带美国口音的新说话者,但对非美国口音表现不佳,且随着数据量增加性能提升,未见平台期迹象。更多...