Safety & Civility
Artificial Intelligence
Speech & Audio
利用语音-文本对齐提升多语言语音毒性检测
Author
Venue
Interspeech 2024
Abstract
语音毒性分类高度依赖于语音的语义内容。我们提出了一种新型框架,利用跨模态学习在训练过程中将文本的语义嵌入整合到多标签语音毒性分类器中。这使我们能够在训练过程中纳入文本信息,同时在推理阶段仍仅需音频数据。 我们利用具有真实世界特征的大规模数据集对该分类器进行评估,以验证该框架的有效性。通过消融研究,我们证明通用语义文本嵌入在毒性分类任务中具有丰富的信息量,且与语音内容高度契合。在多语言大规模实验中,我们展示了该方法在五种语言及不同毒性类别下的语音毒性分类性能均有所提升。
