స్పీచ్-టెక్స్ట్ అలైన్మెంట్తో బహుభాషా వాయిస్ టాక్సిసిటీ గుర్తింపును మెరుగుపరచడం
Author
Venue
ఇంటర్స్పీచ్ 2024
Abstract
వాయిస్ విషపూరిత వర్గీకరణ అనేది ప్రధానంగా ప్రసంగంలోని సెమాంటిక్ కంటెంట్పై ఆధారపడి ఉంటుంది. మేము ఒక నూతన ఫ్రేమ్వర్క్ను ప్రతిపాదిస్తున్నాము, ఇది శిక్షణ సమయంలో టెక్స్ట్ యొక్క సెమాంటిక్ ఎంబెడింగ్ను మల్టీలేబుల్ స్పీచ్ టాక్సిసిటీ క్లాసిఫైయర్లోకి ఏకీకృతం చేయడానికి క్రాస్-మాడల్ లెర్నింగ్ను ఉపయోగిస్తుంది. ఇది శిక్షణ సమయంలో టెక్స్ట్ సమాచారాన్ని పొందుపరచడానికి మాకు వీలు కల్పిస్తుంది, అదే సమయంలో ఇన్ఫెరెన్స్ సమయంలో కేవలం ఆడియో మాత్రమే అవసరం. ఈ ఫ్రేమ్వర్క్ యొక్క సమర్థతను ధృవీకరించడానికి, మేము వాస్తవ-ప్రపంచ లక్షణాలతో కూడిన పెద్ద-స్థాయి డేటాసెట్లపై ఈ క్లాసిఫైయర్ను మూల్యాంకనం చేస్తాము. అబ్లేషన్ స్టడీస్ ద్వారా, టాక్సిసిటీ వర్గీకరణ ప్రయోజనాల కోసం జనరల్-పర్పస్ సెమాంటిక్ టెక్స్ట్ ఎంబెడింగ్లు సమృద్ధిగా ఉంటాయని మరియు వాక్చాతుర్యంతో అనుసంధానించబడి ఉంటాయని మేము ప్రదర్శిస్తాము. బహుళ భాషలలో పెద్ద ఎత్తున ప్రయోగాలు నిర్వహించడం ద్వారా, ఐదు భాషలలో మరియు విభిన్న టాక్సిసిటీ కేటగిరీలలో వాయిస్ టాక్సిసిటీ వర్గీకరణలో మెరుగుదలలను మేము చూపిస్తున్నాము.
