SmoothCache: ডিফিউশন ট্রান্সফরমারের জন্য একটি সর্বজনীন ইনফারেন্স ত্বরণ কৌশল
Author
Venue
CVPR eLVM কর্মশালা ২০২৫
Abstract
ডিফিউশন ট্রান্সফরমার (DiT) চিত্র, ভিডিও এবং বক্তৃতা সংশ্লেষণসহ বিভিন্ন কাজের জন্য শক্তিশালী জেনারেটিভ মডেল হিসেবে আবির্ভূত হয়েছে। তবে, রিসোর্স-নিবিড় অ্যাটেনশন এবং ফিড-ফরওয়ার্ড মডিউলগুলোর পুনরাবৃত্ত মূল্যায়নের কারণে এদের ইনফারেন্স প্রক্রিয়া গণনামূলকভাবে ব্যয়বহুল। এই সমস্যা সমাধানে, আমরা DiT আর্কিটেকচারের জন্য মডেল-নিরপেক্ষ ইনফারেন্স ত্বরণ কৌশল SmoothCache উপস্থাপন করছি। SmoothCache পার্শ্ববর্তী ডিফিউশন টাইমস্টেপগুলোর মধ্যে লেয়ার আউটপুটগুলোর উচ্চ সাদৃশ্যকে কাজে লাগায়। একটি ছোট ক্যালিব্রেশন সেট থেকে স্তর-ভিত্তিক উপস্থাপনা ত্রুটি বিশ্লেষণ করে, SmoothCache ইনফারেন্স চলাকালীন গুরুত্বপূর্ণ বৈশিষ্ট্যগুলো অভিযোজিতভাবে ক্যাশ করে এবং পুনর্ব্যবহার করে। আমাদের পরীক্ষায় দেখা গেছে যে SmoothCache ৮% থেকে ৭১% গতি বৃদ্ধি অর্জন করে, একই সাথে বিভিন্ন ধরনের মাধ্যমে জেনারেটনের গুণমান বজায় রাখে বা এমনকি উন্নত করে। আমরা ইমেজ জেনারেটনের জন্য DiT-XL, টেক্সট-টু-ভিডিওর জন্য Open-Sora, এবং টেক্সট-টু-অডিওর জন্য Stable Audio Open-এ এর কার্যকারিতা প্রদর্শন করেছি, যা রিয়েল-টাইম অ্যাপ্লিকেশন সক্ষম করার এবং শক্তিশালী DiT মডেলগুলির প্রবেশযোগ্যতা বাড়ানোর সম্ভাবনা তুলে ধরে।
