Safety & Civility
Speech & Audio
Artificial Intelligence
基于多任务学习的语音毒性检测
Author
Venue
IEEE ICASSP '24
Abstract
社交沟通系统必须识别具有攻击性的语音内容,以支持内容审核工作,从而保障社区的安全与文明。语音的攻击性分类既取决于音频风格(如音量和语调),也取决于内容(如语音中的单个词语及其上下文)。 我们提出了一种基于音频的有害内容检测的全新端到端多任务学习(MTL)范式,旨在解决现有自动语音识别(ASR)和基于文本系统所面临的挑战。 通过采用硬参数共享的骨干网络和灵活的软注意力任务适配器,我们的模型执行两项任务:针对特定类别有害行为的多标签有害性分类任务,以及专注于仅转录有害关键词的辅助“音频到关键词”检测任务,从而提升计算效率并补充分类结果。我们观察到,分类器显著提升了关键词检测的质量。此外,我们还提供了一套用于训练集自动离线标注的数据处理管道。
