भाषण-पाठ संरेखण के साथ बहुभाषी ध्वनि विषाक्तता का पता लगाने में सुधार
Author
Venue
इंटरस्पीच 2024
Abstract
वॉयस के लिए विषाक्तता वर्गीकरण मुख्य रूप से भाषण की अर्थपूर्ण सामग्री पर निर्भर करता है। हम एक नवीन फ्रेमवर्क प्रस्तावित करते हैं जो क्रॉस-मोडल लर्निंग का उपयोग करके प्रशिक्षण के दौरान टेक्स्ट के अर्थपूर्ण एम्बेडिंग को एक मल्टीलेबल स्पीच टॉक्सिसिटी क्लासिफायर में एकीकृत करता है। यह हमें प्रशिक्षण के दौरान टेक्स्टुअल जानकारी शामिल करने में सक्षम बनाता है, जबकि इन्फरेंस के दौरान केवल ऑडियो की आवश्यकता होती है। हम इस फ्रेमवर्क की प्रभावशीलता को मान्य करने के लिए वास्तविक-विश्व विशेषताओं वाले बड़े पैमाने पर डेटासेट पर इस क्लासिफायर का मूल्यांकन करते हैं। एब्लेशन स्टडीज़ के माध्यम से, हम यह प्रदर्शित करते हैं कि सामान्य-उद्देश्य सेमींटिक टेक्स्ट एम्बेडिंग्स, विषाक्तता वर्गीकरण उद्देश्यों के लिए समृद्ध और भाषण के साथ संरेखित हैं। बड़े पैमाने पर कई भाषाओं में प्रयोग करके, हम पाँच भाषाओं और विभिन्न विषाक्तता श्रेणियों में वॉइस टॉक्सिसिटी क्लासिफिकेशन में सुधार दिखाते हैं।
