भाषण-मजकूर संरेखनासह बहुभाषिक आवाज विषारीपणा शोधनाची सुधारणा
Author
Venue
इंटरस्पीच २०२४
Abstract
आवाजाची विषारीपणा वर्गीकरण मुख्यत्वे भाषणाच्या अर्थपूर्ण सामग्रीवर अवलंबून असते. आम्ही एक नवीन फ्रेमवर्क प्रस्तावित करतो जे क्रॉस-मोडल लर्निंगचा वापर करून प्रशिक्षणादरम्यान मजकुराच्या अर्थपूर्ण एम्बेडिंगला मल्टिलेबल भाषण विषारीपणा वर्गीकरणकर्त्यात समाकलित करते. यामुळे प्रशिक्षणादरम्यान मजकूर माहिती समाविष्ट करता येते, तर निष्कर्षादरम्यान फक्त ऑडिओचीच आवश्यकता असते. या फ्रेमवर्कच्या परिणामकारकतेची पडताळणी करण्यासाठी आम्ही वास्तविक-जगातील वैशिष्ट्यांसह मोठ्या प्रमाणावरच्या डेटासेटवर या वर्गीकरणकर्त्याचे मूल्यांकन करतो. अब्लेशन अभ्यासाद्वारे, आम्ही दाखवतो की सामान्य-उद्देशीय अर्थपूर्ण मजकूर एम्बेडिंग्स समृद्ध असतात आणि विषारीपणा वर्गीकरणाच्या उद्देशांसाठी भाषणाशी सुसंगत असतात. अनेक भाषांमध्ये मोठ्या प्रमाणावर प्रयोग करून, आम्ही पाच भाषांमध्ये आणि विविध विषारीपणा श्रेणींमध्ये आवाज विषारीपणा वर्गीकरणात सुधारणा दर्शवितो.
