या साइटवरील सामग्री कृत्रिम बुद्धिमत्ता (AI) किंवा मशीन भाषांतर तंत्रज्ञानाचा वापर करून भाषांतरित केली आहे आणि त्यात त्रुटी असू शकतात.

Skip to content
Safety & Civility
Artificial Intelligence
Speech & Audio

भाषण-मजकूर संरेखनासह बहुभाषिक आवाज विषारीपणा शोधनाची सुधारणा

View Publication

Author

जोसेफ लियू (Roblox), महेश कुमार नंदवाना (Roblox), जॅने पिल्क्कोनेन (Roblox), हॅनेस हेइकिंहेइमो (Roblox), मॉर्गन मॅकग्वायर (Roblox)

Venue

इंटरस्पीच २०२४

Abstract

आवाजाची विषारीपणा वर्गीकरण मुख्यत्वे भाषणाच्या अर्थपूर्ण सामग्रीवर अवलंबून असते. आम्ही एक नवीन फ्रेमवर्क प्रस्तावित करतो जे क्रॉस-मोडल लर्निंगचा वापर करून प्रशिक्षणादरम्यान मजकुराच्या अर्थपूर्ण एम्बेडिंगला मल्टिलेबल भाषण विषारीपणा वर्गीकरणकर्त्यात समाकलित करते. यामुळे प्रशिक्षणादरम्यान मजकूर माहिती समाविष्ट करता येते, तर निष्कर्षादरम्यान फक्त ऑडिओचीच आवश्यकता असते. या फ्रेमवर्कच्या परिणामकारकतेची पडताळणी करण्यासाठी आम्ही वास्तविक-जगातील वैशिष्ट्यांसह मोठ्या प्रमाणावरच्या डेटासेटवर या वर्गीकरणकर्त्याचे मूल्यांकन करतो. अब्लेशन अभ्यासाद्वारे, आम्ही दाखवतो की सामान्य-उद्देशीय अर्थपूर्ण मजकूर एम्बेडिंग्स समृद्ध असतात आणि विषारीपणा वर्गीकरणाच्या उद्देशांसाठी भाषणाशी सुसंगत असतात. अनेक भाषांमध्ये मोठ्या प्रमाणावर प्रयोग करून, आम्ही पाच भाषांमध्ये आणि विविध विषारीपणा श्रेणींमध्ये आवाज विषारीपणा वर्गीकरणात सुधारणा दर्शवितो.