মাল্টি-টাস্ক লার্নিং ব্যবহার করে ভয়েস টক্সিসিটি সনাক্তকরণ
Author
Venue
আইইইই আইসিএএসপি '২৪
Abstract
সামাজিক যোগাযোগ ব্যবস্থাগুলোকে তাদের সম্প্রদায়ের নিরাপত্তা ও সভ্যতা রক্ষায় মডারেটেশন সমর্থনে বিষাক্ত ভয়েস অডিও শনাক্ত করতে হয়। ভয়েসের বিষাক্ততা শ্রেণীবদ্ধকরণ অডিও শৈলী (যেমন ভলিউম ও টোন) এবং বিষয়বস্তু (যেমন বক্তৃতার শব্দগুলো পৃথকভাবে ও প্রেক্ষাপটে) উভয়ের ওপর নির্ভর করে। আমরা অডিও-ভিত্তিক বিষাক্ততা সনাক্তকরণের জন্য একটি নতুন এন্ড-টু-এন্ড মাল্টি-টাস্ক লার্নিং (MTL) প্যারাডাইম উপস্থাপন করছি, যা বিদ্যমান স্বয়ংক্রিয় বক্তৃতা স্বীকৃতি (ASR) এবং টেক্সট-ভিত্তিক সিস্টেমের সাথে সম্পর্কিত চ্যালেঞ্জগুলি মোকাবেলা করে। কঠোর প্যারামিটার-শেয়ারিং ব্যাকবোন এবং নমনীয় সফট-অ্যাটেনশন টাস্ক অ্যাডাপ্টার ব্যবহার করে, আমাদের মডেল দুটি কাজ সম্পাদন করে: একটি মাল্টি-লেবেল টক্সিসিটি ক্লাসিফিকেশন টাস্ক যা নির্দিষ্ট ধরনের বিষাক্ত আচরণকে লক্ষ্য করে, এবং একটি সহায়ক অডিও টু কীওয়ার্ড ডিটেকশন টাস্ক যা শুধুমাত্র বিষাক্ত কীওয়ার্ডগুলো ট্রান্সক্রাইব করতে ফোকাস করে, এর ফলে কম্পিউটেশনাল দক্ষতা বৃদ্ধি পায় এবং ক্লাসিফিকেশন আউটপুটকে পরিপূরক করে। আমরা লক্ষ্য করেছি যে ক্লাসিফায়ার কীওয়ার্ড ডিটেকশনের গুণমান উল্লেখযোগ্যভাবে উন্নত করে। আমরা প্রশিক্ষণ সেটের স্বয়ংক্রিয় অফলাইন লেবেলিংয়ের জন্য একটি ডেটা পাইপলাইনও উপস্থাপন করেছি।
