Dev Tweet
933 subscribers
143 photos
17 videos
3 files
113 links
گعده‌ای در باب برنامه نویسی، پایتون، هوش مصنوعی و داده
Download Telegram
Channel created
Channel name was changed to «Dev Tweet»
Channel photo updated
بسم الله الرحمن الرحیم
در اینجا آنچه را که در باب هر چیزی که در موضوع علوم کامپیوتر و برنامه نویسی و پایتون و علم داده و هوش مصنوعی، جالب، دیدنی و شنیدنی یافتیم با شما به اشتراک می‌گذاریم.

Transformers:


اگر می خواهید معماری Transformerها در شبکه‌های عصبی عمیق رو یاد بگیرید دو تا مسیر دارید:
الف){مسیر طولانی} شروع کنید از RNN ها برید سراغ GRU بعد برید سراغ LSTM بعد با مشکلات و محدودیت‌های LSTM آشنا می‌شید. نویسنده‌های مقاله‌ی GRU می‌آید اولین پایه‌ی ایده‌ی Attention رو مطرح می‌کند. یکی دو سالی انواع مختلف مکانیزم‌های Attention مطرح می‌شده با انواع توابع similarity مختلف بعد یک دفعه سال ۲۰۱۷ مقاله‌ی Attention is all you need از گوگل مطرح‌ میشه و یک نوع خاصی از مکانیزم توجه رو مطرح می‌کنه به اسم Multi-head self attention. یادگیری Transformer از این مسیر واقعه مناسب کار پژوهشیه. کسی می‌خواهد صرفا با این معماری آشنا باشه این مسیر اصلا efficient نیست اگر چه دانش‌ش واقعا عمیق میشه.
تازه وقتی بخو‌اهید خیلی عمیق بشوید می‌بینید که این ایده از یه جائی دیگه هم مطرح شده اون هم بحث Neural Turing Machine و تاپیک عمومی‌تر Memory-augumented Machines که واقعا ایده‌های جذابیه. شاید بعدا در موردشون نوشتم.
یک بلاگ معروفی که این مسیر رو رفته یعنی از RNN شروع کرده رسیده به Transformer. نویسنده این بلاگ یک بلاگر خیلی خفن از OpenAI هست که در زمینه‌های دیگه مثل Self-supervised Learning هم به بهترین شکل آموزش داده.

ب){مسیر کوتاه} مستقیم از خود Transformer شروع کنید به یاد گرفتن و هر مفهومی رو هر جايی با آن مواجه می شود یاد بگیرید. مثلا وقتی از Transformer شروع کنید همانجا با مفهوم word-embeding آشنا می‌شود جلوتر با self-attention در ادامه با cross-attention و ... .
برای این منظور من چهار ویدئو زیر رو توصیه می‌کنم که سه ویدئو اول به بهترین شکل معماری Transformer رو ویژوالایز کردند و چهارمی لکچر دانشگاه نیویورک از آلفردو کازیانی است که از یک نگاه متفاوت با بیان ساده از روابط جبری شروع به توضیح Attention و Transformer می‌کنه.
قسمت اول: positional encoding
توضیحی که در مورد positional encoding آورده هیچ جا نمی‌بینید. خیلی قشنگ فلسفه‌ی طراحی رابطه‌ی positional encoding رو توجیه می‌کنه.
قسمت دوم: self/mult-head attention
قسمت سوم: دیکور ترنسفورمر و masked attention
جلسه ۱۰ تدریس آلفردو کازیانی- دانشگاه نیویورک

#transformer
#attention

https://xn--r1a.website/tweetdev
Dev Tweet
ㅤ Transformers: اگر می خواهید معماری Transformerها در شبکه‌های عصبی عمیق رو یاد بگیرید دو تا مسیر دارید: الف){مسیر طولانی} شروع کنید از RNN ها برید سراغ GRU بعد برید سراغ LSTM بعد با مشکلات و محدودیت‌های LSTM آشنا می‌شید. نویسنده‌های مقاله‌ی GRU می‌آید اولین…

هر آموزشی از Deep Learning دیدید بیاید در کنارش لکچر همون مبحث رو از آلفردو کازیانی ببنید. ایشون ایتالیائي و استاد دانشگاه نیویورک که یک کورس مشترکی با یان لیکان ارائه می‌کنه. نگاه خاصی به معماری‌های دیپ لرنینگ داره که احتمالا از مدل‌های Energy-Based Model یان لیکان گرفته. اگر با موضوع Transformerها کاملا آشنا هستید باز هم دقیقه 48 به بعد این ویدئو رو ببنید که میگه اصلا Transformerها معماری Decode-Encoder نیستند بلکه معماری Decoder-Predictor-Encoder هستند برای فهم این موضوع باید ۱۰ دقیقه از این ویدئو رو دید.