এই সাইটের বিষয়বস্তু কৃত্রিম বুদ্ধিমত্তা (AI) বা মেশিন অনুবাদ প্রযুক্তি ব্যবহার করে অনুবাদ করা হয়েছে এবং ত্রুটি থাকতে পারে।

Skip to content
Artificial Intelligence

SmoothCache: ডিফিউশন ট্রান্সফরমারের জন্য একটি সর্বজনীন ইনফারেন্স ত্বরণ কৌশল

Author

জোসেফ লিউ (রবলোক্স), জোশুয়া গেডেস (কুইন্স বিশ্ববিদ্যালয়), জিয়ু গুও (রবলোক্স), হাওমিয়াও জিয়াং (রবলোক্স), মহেশ কুমার নন্দওয়ানা (রবলোক্স)

Venue

CVPR eLVM কর্মশালা ২০২৫

Abstract

ডিফিউশন ট্রান্সফরমার (DiT) চিত্র, ভিডিও এবং বক্তৃতা সংশ্লেষণসহ বিভিন্ন কাজের জন্য শক্তিশালী জেনারেটিভ মডেল হিসেবে আবির্ভূত হয়েছে। তবে, রিসোর্স-নিবিড় অ্যাটেনশন এবং ফিড-ফরওয়ার্ড মডিউলগুলোর পুনরাবৃত্ত মূল্যায়নের কারণে এদের ইনফারেন্স প্রক্রিয়া গণনামূলকভাবে ব্যয়বহুল। এই সমস্যা সমাধানে, আমরা DiT আর্কিটেকচারের জন্য মডেল-নিরপেক্ষ ইনফারেন্স ত্বরণ কৌশল SmoothCache উপস্থাপন করছি। SmoothCache পার্শ্ববর্তী ডিফিউশন টাইমস্টেপগুলোর মধ্যে লেয়ার আউটপুটগুলোর উচ্চ সাদৃশ্যকে কাজে লাগায়। একটি ছোট ক্যালিব্রেশন সেট থেকে স্তর-ভিত্তিক উপস্থাপনা ত্রুটি বিশ্লেষণ করে, SmoothCache ইনফারেন্স চলাকালীন গুরুত্বপূর্ণ বৈশিষ্ট্যগুলো অভিযোজিতভাবে ক্যাশ করে এবং পুনর্ব্যবহার করে। আমাদের পরীক্ষায় দেখা গেছে যে SmoothCache ৮% থেকে ৭১% গতি বৃদ্ধি অর্জন করে, একই সাথে বিভিন্ন ধরনের মাধ্যমে জেনারেটনের গুণমান বজায় রাখে বা এমনকি উন্নত করে। আমরা ইমেজ জেনারেটনের জন্য DiT-XL, টেক্সট-টু-ভিডিওর জন্য Open-Sora, এবং টেক্সট-টু-অডিওর জন্য Stable Audio Open-এ এর কার্যকারিতা প্রদর্শন করেছি, যা রিয়েল-টাইম অ্যাপ্লিকেশন সক্ষম করার এবং শক্তিশালী DiT মডেলগুলির প্রবেশযোগ্যতা বাড়ানোর সম্ভাবনা তুলে ধরে।