Safety & Civility
Artificial Intelligence
Speech & Audio
透過語音-文字對齊強化多語言語音毒性檢測
Author
Venue
Interspeech 2024
Abstract
語音毒性分類高度依賴於語音的語義內容。我們提出一種新型框架,利用跨模態學習在訓練過程中將文本的語義嵌入整合到多標籤語音毒性分類器中。這使我們能夠在訓練期間納入文本資訊,同時在推論階段仍僅需音訊資料。 我們在具備真實世界特徵的大規模資料集上對此分類器進行評估,以驗證此框架的有效性。透過剝離實驗,我們證明通用語義文本嵌入具有豐富的資訊,且與語音在毒性分類方面具有高度對齊性。透過大規模的多語言實驗,我們展示了在五種語言及不同毒性類別中,語音毒性分類表現均有所提升。
