ㅤ
Transformers:
اگر می خواهید معماری Transformerها در شبکههای عصبی عمیق رو یاد بگیرید دو تا مسیر دارید:
الف){مسیر طولانی} شروع کنید از RNN ها برید سراغ GRU بعد برید سراغ LSTM بعد با مشکلات و محدودیتهای LSTM آشنا میشید. نویسندههای مقالهی GRU میآید اولین پایهی ایدهی Attention رو مطرح میکند. یکی دو سالی انواع مختلف مکانیزمهای Attention مطرح میشده با انواع توابع similarity مختلف بعد یک دفعه سال ۲۰۱۷ مقالهی Attention is all you need از گوگل مطرح میشه و یک نوع خاصی از مکانیزم توجه رو مطرح میکنه به اسم Multi-head self attention. یادگیری Transformer از این مسیر واقعه مناسب کار پژوهشیه. کسی میخواهد صرفا با این معماری آشنا باشه این مسیر اصلا efficient نیست اگر چه دانشش واقعا عمیق میشه.
تازه وقتی بخواهید خیلی عمیق بشوید میبینید که این ایده از یه جائی دیگه هم مطرح شده اون هم بحث Neural Turing Machine و تاپیک عمومیتر Memory-augumented Machines که واقعا ایدههای جذابیه. شاید بعدا در موردشون نوشتم.
یک بلاگ معروفی که این مسیر رو رفته یعنی از RNN شروع کرده رسیده به Transformer. نویسنده این بلاگ یک بلاگر خیلی خفن از OpenAI هست که در زمینههای دیگه مثل Self-supervised Learning هم به بهترین شکل آموزش داده.
ب){مسیر کوتاه} مستقیم از خود Transformer شروع کنید به یاد گرفتن و هر مفهومی رو هر جايی با آن مواجه می شود یاد بگیرید. مثلا وقتی از Transformer شروع کنید همانجا با مفهوم word-embeding آشنا میشود جلوتر با self-attention در ادامه با cross-attention و ... .
برای این منظور من چهار ویدئو زیر رو توصیه میکنم که سه ویدئو اول به بهترین شکل معماری Transformer رو ویژوالایز کردند و چهارمی لکچر دانشگاه نیویورک از آلفردو کازیانی است که از یک نگاه متفاوت با بیان ساده از روابط جبری شروع به توضیح Attention و Transformer میکنه.
قسمت اول: positional encoding
توضیحی که در مورد positional encoding آورده هیچ جا نمیبینید. خیلی قشنگ فلسفهی طراحی رابطهی positional encoding رو توجیه میکنه.
قسمت دوم: self/mult-head attention
قسمت سوم: دیکور ترنسفورمر و masked attention
جلسه ۱۰ تدریس آلفردو کازیانی- دانشگاه نیویورک
#transformer
#attention
https://xn--r1a.website/tweetdev
Transformers:
اگر می خواهید معماری Transformerها در شبکههای عصبی عمیق رو یاد بگیرید دو تا مسیر دارید:
الف){مسیر طولانی} شروع کنید از RNN ها برید سراغ GRU بعد برید سراغ LSTM بعد با مشکلات و محدودیتهای LSTM آشنا میشید. نویسندههای مقالهی GRU میآید اولین پایهی ایدهی Attention رو مطرح میکند. یکی دو سالی انواع مختلف مکانیزمهای Attention مطرح میشده با انواع توابع similarity مختلف بعد یک دفعه سال ۲۰۱۷ مقالهی Attention is all you need از گوگل مطرح میشه و یک نوع خاصی از مکانیزم توجه رو مطرح میکنه به اسم Multi-head self attention. یادگیری Transformer از این مسیر واقعه مناسب کار پژوهشیه. کسی میخواهد صرفا با این معماری آشنا باشه این مسیر اصلا efficient نیست اگر چه دانشش واقعا عمیق میشه.
تازه وقتی بخواهید خیلی عمیق بشوید میبینید که این ایده از یه جائی دیگه هم مطرح شده اون هم بحث Neural Turing Machine و تاپیک عمومیتر Memory-augumented Machines که واقعا ایدههای جذابیه. شاید بعدا در موردشون نوشتم.
یک بلاگ معروفی که این مسیر رو رفته یعنی از RNN شروع کرده رسیده به Transformer. نویسنده این بلاگ یک بلاگر خیلی خفن از OpenAI هست که در زمینههای دیگه مثل Self-supervised Learning هم به بهترین شکل آموزش داده.
ب){مسیر کوتاه} مستقیم از خود Transformer شروع کنید به یاد گرفتن و هر مفهومی رو هر جايی با آن مواجه می شود یاد بگیرید. مثلا وقتی از Transformer شروع کنید همانجا با مفهوم word-embeding آشنا میشود جلوتر با self-attention در ادامه با cross-attention و ... .
برای این منظور من چهار ویدئو زیر رو توصیه میکنم که سه ویدئو اول به بهترین شکل معماری Transformer رو ویژوالایز کردند و چهارمی لکچر دانشگاه نیویورک از آلفردو کازیانی است که از یک نگاه متفاوت با بیان ساده از روابط جبری شروع به توضیح Attention و Transformer میکنه.
قسمت اول: positional encoding
توضیحی که در مورد positional encoding آورده هیچ جا نمیبینید. خیلی قشنگ فلسفهی طراحی رابطهی positional encoding رو توجیه میکنه.
قسمت دوم: self/mult-head attention
قسمت سوم: دیکور ترنسفورمر و masked attention
جلسه ۱۰ تدریس آلفردو کازیانی- دانشگاه نیویورک
#transformer
#attention
https://xn--r1a.website/tweetdev
Telegram
Dev Tweet
گعدهای در باب برنامه نویسی، پایتون، هوش مصنوعی و داده
Dev Tweet
ㅤ Transformers: اگر می خواهید معماری Transformerها در شبکههای عصبی عمیق رو یاد بگیرید دو تا مسیر دارید: الف){مسیر طولانی} شروع کنید از RNN ها برید سراغ GRU بعد برید سراغ LSTM بعد با مشکلات و محدودیتهای LSTM آشنا میشید. نویسندههای مقالهی GRU میآید اولین…
ㅤ
هر آموزشی از Deep Learning دیدید بیاید در کنارش لکچر همون مبحث رو از آلفردو کازیانی ببنید. ایشون ایتالیائي و استاد دانشگاه نیویورک که یک کورس مشترکی با یان لیکان ارائه میکنه. نگاه خاصی به معماریهای دیپ لرنینگ داره که احتمالا از مدلهای Energy-Based Model یان لیکان گرفته. اگر با موضوع Transformerها کاملا آشنا هستید باز هم دقیقه 48 به بعد این ویدئو رو ببنید که میگه اصلا Transformerها معماری Decode-Encoder نیستند بلکه معماری Decoder-Predictor-Encoder هستند برای فهم این موضوع باید ۱۰ دقیقه از این ویدئو رو دید.
هر آموزشی از Deep Learning دیدید بیاید در کنارش لکچر همون مبحث رو از آلفردو کازیانی ببنید. ایشون ایتالیائي و استاد دانشگاه نیویورک که یک کورس مشترکی با یان لیکان ارائه میکنه. نگاه خاصی به معماریهای دیپ لرنینگ داره که احتمالا از مدلهای Energy-Based Model یان لیکان گرفته. اگر با موضوع Transformerها کاملا آشنا هستید باز هم دقیقه 48 به بعد این ویدئو رو ببنید که میگه اصلا Transformerها معماری Decode-Encoder نیستند بلکه معماری Decoder-Predictor-Encoder هستند برای فهم این موضوع باید ۱۰ دقیقه از این ویدئو رو دید.
Telegram
Dev Tweet
گعدهای در باب برنامه نویسی، پایتون، هوش مصنوعی و داده
