इस साइट की सामग्री का अनुवाद कृत्रिम बुद्धिमत्ता (AI) या मशीन अनुवाद तकनीक का उपयोग करके किया गया है, और इसमें त्रुटियाँ हो सकती हैं.

Skip to content
Safety & Civility
Artificial Intelligence
Speech & Audio

भाषण-पाठ संरेखण के साथ बहुभाषी ध्वनि विषाक्तता का पता लगाने में सुधार

View Publication

Author

जोसेफ लियू (रॉब्लॉक्स), महेश कुमार नंदवाना (रॉब्लॉक्स), जान्ने पिल्क्कोनेन (रॉब्लॉक्स), हान्नेस हेकिनहेइमो (रॉब्लॉक्स), मॉर्गन मैकग्वायर (रॉब्लॉक्स)

Venue

इंटरस्पीच 2024

Abstract

वॉयस के लिए विषाक्तता वर्गीकरण मुख्य रूप से भाषण की अर्थपूर्ण सामग्री पर निर्भर करता है। हम एक नवीन फ्रेमवर्क प्रस्तावित करते हैं जो क्रॉस-मोडल लर्निंग का उपयोग करके प्रशिक्षण के दौरान टेक्स्ट के अर्थपूर्ण एम्बेडिंग को एक मल्टीलेबल स्पीच टॉक्सिसिटी क्लासिफायर में एकीकृत करता है। यह हमें प्रशिक्षण के दौरान टेक्स्टुअल जानकारी शामिल करने में सक्षम बनाता है, जबकि इन्फरेंस के दौरान केवल ऑडियो की आवश्यकता होती है। हम इस फ्रेमवर्क की प्रभावशीलता को मान्य करने के लिए वास्तविक-विश्व विशेषताओं वाले बड़े पैमाने पर डेटासेट पर इस क्लासिफायर का मूल्यांकन करते हैं। एब्लेशन स्टडीज़ के माध्यम से, हम यह प्रदर्शित करते हैं कि सामान्य-उद्देश्य सेमींटिक टेक्स्ट एम्बेडिंग्स, विषाक्तता वर्गीकरण उद्देश्यों के लिए समृद्ध और भाषण के साथ संरेखित हैं। बड़े पैमाने पर कई भाषाओं में प्रयोग करके, हम पाँच भाषाओं और विभिन्न विषाक्तता श्रेणियों में वॉइस टॉक्सिसिटी क्लासिफिकेशन में सुधार दिखाते हैं।