এই সাইটের বিষয়বস্তু কৃত্রিম বুদ্ধিমত্তা (AI) বা মেশিন অনুবাদ প্রযুক্তি ব্যবহার করে অনুবাদ করা হয়েছে এবং ত্রুটি থাকতে পারে।

Skip to content
Safety & Civility
Speech & Audio
Artificial Intelligence

মাল্টি-টাস্ক লার্নিং ব্যবহার করে ভয়েস টক্সিসিটি সনাক্তকরণ

View Publication

Author

মহেশ কুমার নন্দওয়ানা (রবলোক্স), ইফান হে (রবলোক্স + কার্নেগি মেলন বিশ্ববিদ্যালয়), জোসেফ লিউ (রবলোক্স), ঝাও ইউ (রবলোক্স), চার্লস শাং (রবলোক্স), এলয় দু বুইস (রবলোক্স), মরগান ম্যাকগাইর (রবলোক্স), এবং কিরণ ভাট (রবলোক্স)

Venue

আইইইই আইসিএএসপি '২৪

Abstract

সামাজিক যোগাযোগ ব্যবস্থাগুলোকে তাদের সম্প্রদায়ের নিরাপত্তা ও সভ্যতা রক্ষায় মডারেটেশন সমর্থনে বিষাক্ত ভয়েস অডিও শনাক্ত করতে হয়। ভয়েসের বিষাক্ততা শ্রেণীবদ্ধকরণ অডিও শৈলী (যেমন ভলিউম ও টোন) এবং বিষয়বস্তু (যেমন বক্তৃতার শব্দগুলো পৃথকভাবে ও প্রেক্ষাপটে) উভয়ের ওপর নির্ভর করে। আমরা অডিও-ভিত্তিক বিষাক্ততা সনাক্তকরণের জন্য একটি নতুন এন্ড-টু-এন্ড মাল্টি-টাস্ক লার্নিং (MTL) প্যারাডাইম উপস্থাপন করছি, যা বিদ্যমান স্বয়ংক্রিয় বক্তৃতা স্বীকৃতি (ASR) এবং টেক্সট-ভিত্তিক সিস্টেমের সাথে সম্পর্কিত চ্যালেঞ্জগুলি মোকাবেলা করে। কঠোর প্যারামিটার-শেয়ারিং ব্যাকবোন এবং নমনীয় সফট-অ্যাটেনশন টাস্ক অ্যাডাপ্টার ব্যবহার করে, আমাদের মডেল দুটি কাজ সম্পাদন করে: একটি মাল্টি-লেবেল টক্সিসিটি ক্লাসিফিকেশন টাস্ক যা নির্দিষ্ট ধরনের বিষাক্ত আচরণকে লক্ষ্য করে, এবং একটি সহায়ক অডিও টু কীওয়ার্ড ডিটেকশন টাস্ক যা শুধুমাত্র বিষাক্ত কীওয়ার্ডগুলো ট্রান্সক্রাইব করতে ফোকাস করে, এর ফলে কম্পিউটেশনাল দক্ষতা বৃদ্ধি পায় এবং ক্লাসিফিকেশন আউটপুটকে পরিপূরক করে। আমরা লক্ষ্য করেছি যে ক্লাসিফায়ার কীওয়ার্ড ডিটেকশনের গুণমান উল্লেখযোগ্যভাবে উন্নত করে। আমরা প্রশিক্ষণ সেটের স্বয়ংক্রিয় অফলাইন লেবেলিংয়ের জন্য একটি ডেটা পাইপলাইনও উপস্থাপন করেছি।