ఈ సైట్‌లోని విషయాలు కృత్రిమ మేధస్సు (AI) లేదా యంత్ర అనువాద సాంకేతికత ఉపయోగించి అనువదించబడ్డాయి మరియు లోపాలు ఉండవచ్చు.

Skip to content
Safety & Civility
Artificial Intelligence
Speech & Audio

స్పీచ్-టెక్స్ట్ అలైన్‌మెంట్‌తో బహుభాషా వాయిస్ టాక్సిసిటీ గుర్తింపును మెరుగుపరచడం

View Publication

Author

జోసెఫ్ లియు (రాబ్లాక్స్), మహేష్ కుమార్ నంద్వనా (రాబ్లాక్స్), జాన్నే పిల్క్కోనెన్ (రాబ్లాక్స్), హన్నెస్ హెకిన్‌హీమో (రాబ్లాక్స్), మోర్గాన్ మెక్‌గైర్ (రాబ్లాక్స్)

Venue

ఇంటర్‌స్పీచ్ 2024

Abstract

వాయిస్ విషపూరిత వర్గీకరణ అనేది ప్రధానంగా ప్రసంగంలోని సెమాంటిక్ కంటెంట్‌పై ఆధారపడి ఉంటుంది. మేము ఒక నూతన ఫ్రేమ్‌వర్క్‌ను ప్రతిపాదిస్తున్నాము, ఇది శిక్షణ సమయంలో టెక్స్ట్ యొక్క సెమాంటిక్ ఎంబెడింగ్‌ను మల్టీలేబుల్ స్పీచ్ టాక్సిసిటీ క్లాసిఫైయర్‌లోకి ఏకీకృతం చేయడానికి క్రాస్-మాడల్ లెర్నింగ్‌ను ఉపయోగిస్తుంది. ఇది శిక్షణ సమయంలో టెక్స్ట్ సమాచారాన్ని పొందుపరచడానికి మాకు వీలు కల్పిస్తుంది, అదే సమయంలో ఇన్‌ఫెరెన్స్ సమయంలో కేవలం ఆడియో మాత్రమే అవసరం. ఈ ఫ్రేమ్‌వర్క్ యొక్క సమర్థతను ధృవీకరించడానికి, మేము వాస్తవ-ప్రపంచ లక్షణాలతో కూడిన పెద్ద-స్థాయి డేటాసెట్‌లపై ఈ క్లాసిఫైయర్‌ను మూల్యాంకనం చేస్తాము. అబ్లేషన్ స్టడీస్ ద్వారా, టాక్సిసిటీ వర్గీకరణ ప్రయోజనాల కోసం జనరల్-పర్పస్ సెమాంటిక్ టెక్స్ట్ ఎంబెడింగ్‌లు సమృద్ధిగా ఉంటాయని మరియు వాక్చాతుర్యంతో అనుసంధానించబడి ఉంటాయని మేము ప్రదర్శిస్తాము. బహుళ భాషలలో పెద్ద ఎత్తున ప్రయోగాలు నిర్వహించడం ద్వారా, ఐదు భాషలలో మరియు విభిన్న టాక్సిసిటీ కేటగిరీలలో వాయిస్ టాక్సిసిటీ వర్గీకరణలో మెరుగుదలలను మేము చూపిస్తున్నాము.