Safety & Civility
Speech & Audio
Artificial Intelligence
運用多任務學習進行語音毒性檢測
Author
Venue
IEEE ICASSP '24
Abstract
社交通訊系統必須識別具攻擊性的語音內容,以支援內容審核工作,從而保障社群的安全與文明。語音的攻擊性分類取決於音訊風格(例如音量與語調)以及內容(例如語句中的單一詞彙及其上下文)。 我們提出一種針對語音毒性檢測的創新端到端多任務學習(MTL)框架,以解決現有自動語音識別(ASR)及基於文字系統所面臨的挑戰。 透過採用硬參數共享的基礎架構與靈活的軟注意力任務適配器,我們的模型執行兩項任務:針對特定類別有害行為的多標籤有害內容分類任務,以及專注於僅轉錄有害關鍵字的輔助「音訊轉關鍵字」偵測任務,藉此提升運算效率並補充分類輸出。我們觀察到,分類器顯著提升了關鍵字偵測的品質。此外,我們也提出一套用於訓練資料集自動離線標註的資料處理流程。
