本網站內容使用人工智慧(AI)或機器翻譯技術翻譯,可能存在錯誤。

Skip to content
Safety & Civility
Artificial Intelligence
Speech & Audio

透過語音-文字對齊強化多語言語音毒性檢測

View Publication

Author

劉約瑟夫(Roblox)、馬赫什·庫馬爾·南德瓦納(Roblox)、揚內·皮爾科寧(Roblox)、漢尼斯·海金海莫(Roblox)、摩根·麥奎爾(Roblox)

Venue

Interspeech 2024

Abstract

語音毒性分類高度依賴於語音的語義內容。我們提出一種新型框架,利用跨模態學習在訓練過程中將文本的語義嵌入整合到多標籤語音毒性分類器中。這使我們能夠在訓練期間納入文本資訊,同時在推論階段仍僅需音訊資料。 我們在具備真實世界特徵的大規模資料集上對此分類器進行評估,以驗證此框架的有效性。透過剝離實驗,我們證明通用語義文本嵌入具有豐富的資訊,且與語音在毒性分類方面具有高度對齊性。透過大規模的多語言實驗,我們展示了在五種語言及不同毒性類別中,語音毒性分類表現均有所提升。