🔎 بهینهسازی مصرف حافظه در مدلهای Looped
مدلهای Looped LM با عبور دادن توکنها از یک بلوک لایههای تکراری، عمق مدل را بدون افزایش تعداد پارامترها افزایش میدهند. مشکل اصلی این ساختار، مصرف بالای حافظه به دلیل انباشت
محققان با مشاهده اینکه وضعیت درونی مدل در تکرارهای نهایی تقریباً ثابت میماند، روشی برای نگهداری فقط کلیدها و مقادیر نهایی ابداع کردند. نتایج این رویکرد به شرح زیر است:
* کاهش ۳ برابری نیاز به حافظه
* افزایش سرعت پردازش پرامپت (Prefill) تا ۱.۷۹ برابر.
* بهبود ۲ برابری در سرعت آموزش RL.
در مدل ۱.۶ میلیارد پارامتری، مدل Looped با ۴ بلوک، عملکردی در سطح مدلهای ۵ میلیارد پارامتری معمولی نشان میدهد. برای بررسی جزئیات فنی و پیادهسازی، کد و چکپوینتها در گیتهاب این پروژه و مقاله آن در arXiv در دسترس است.
#Looped_LM #KV_cache
مدلهای Looped LM با عبور دادن توکنها از یک بلوک لایههای تکراری، عمق مدل را بدون افزایش تعداد پارامترها افزایش میدهند. مشکل اصلی این ساختار، مصرف بالای حافظه به دلیل انباشت
KV-cache در هر تکرار بود. محققان با مشاهده اینکه وضعیت درونی مدل در تکرارهای نهایی تقریباً ثابت میماند، روشی برای نگهداری فقط کلیدها و مقادیر نهایی ابداع کردند. نتایج این رویکرد به شرح زیر است:
* کاهش ۳ برابری نیاز به حافظه
KV-cache برای رسیدن به عملکردی مشابه مدلهای ۱۲ بلوکی.* افزایش سرعت پردازش پرامپت (Prefill) تا ۱.۷۹ برابر.
* بهبود ۲ برابری در سرعت آموزش RL.
در مدل ۱.۶ میلیارد پارامتری، مدل Looped با ۴ بلوک، عملکردی در سطح مدلهای ۵ میلیارد پارامتری معمولی نشان میدهد. برای بررسی جزئیات فنی و پیادهسازی، کد و چکپوینتها در گیتهاب این پروژه و مقاله آن در arXiv در دسترس است.
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
#Looped_LM #KV_cache
❤1