This media is not supported in your browser
VIEW IN TELEGRAM
🚀 عرضه مدل قدرتمند Kimi K3 با ۲.۸ تریلیون پارامتر
🚨 شرکت Moonshot AI مدل جدید Kimi K3 را با ۲.۸ تریلیون پارامتر در پلتفرم Hugging Face منتشر کرد. این نخستین مدل در کلاس ۳ تریلیون پارامتر است که به صورت Open-weights در دسترس عموم قرار میگیرد. به لطف معماری MoE (مدل ترکیبی متخصصان)، در هر توکن تنها ۱۰۴ میلیارد پارامتر فعال میشوند که شامل ۱۶ متخصص از مجموع ۸۹۶ متخصص موجود است.
🧠 این مدل از کانتکست یک میلیون توکنی پشتیبانی کرده و بهصورت بومی با متن و تصویر کار میکند. ساختار فنی آن شامل ۹۳ لایه است که از ۶۹ لایه Kimi Delta Attention (مکانیزم توجه بهینه) و ۲۴ لایه Gated MLA تشکیل شده است. استفاده از فرمتهای MXFP4 برای وزنها و MXFP8 برای اکتیویشنها، باعث شده تا بهرهوری مقیاسپذیری آن ۲.۵ برابر نسبت به نسخه K2 افزایش یابد.
⚡ مدل Kimi K3 بهطور خاص برای وظایف ایجنتیک طولانی توسعه یافته است.
#Kimi_K3 #Mixture_of_Experts
🚨 شرکت Moonshot AI مدل جدید Kimi K3 را با ۲.۸ تریلیون پارامتر در پلتفرم Hugging Face منتشر کرد. این نخستین مدل در کلاس ۳ تریلیون پارامتر است که به صورت Open-weights در دسترس عموم قرار میگیرد. به لطف معماری MoE (مدل ترکیبی متخصصان)، در هر توکن تنها ۱۰۴ میلیارد پارامتر فعال میشوند که شامل ۱۶ متخصص از مجموع ۸۹۶ متخصص موجود است.
🧠 این مدل از کانتکست یک میلیون توکنی پشتیبانی کرده و بهصورت بومی با متن و تصویر کار میکند. ساختار فنی آن شامل ۹۳ لایه است که از ۶۹ لایه Kimi Delta Attention (مکانیزم توجه بهینه) و ۲۴ لایه Gated MLA تشکیل شده است. استفاده از فرمتهای MXFP4 برای وزنها و MXFP8 برای اکتیویشنها، باعث شده تا بهرهوری مقیاسپذیری آن ۲.۵ برابر نسبت به نسخه K2 افزایش یابد.
⚡ مدل Kimi K3 بهطور خاص برای وظایف ایجنتیک طولانی توسعه یافته است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Kimi_K3 #Mixture_of_Experts
❤1
💻 اجرای مدل ۲.۷۸ تریلیون پارامتری Kimi K3 روی پردازنده معمولی و ۸ گیگابایت رم
یک دستاورد فنی شگفتانگیز در حوزه هوش مصنوعی محلی نشان میدهد که چطور میتوان مدلهای بسیار عظیم را بدون نیاز به پردازندههای گرافیکی گرانقیمت یا فریمورکهای سنگین اجرا کرد. پروژه kimi-k3-in-c موفق شده است فرآیند استنتاج (Inference) مدل زبانی غولپیکر Kimi K3 با ۲.۷۸ تریلیون پارامتر را تقریباً از صفر و با زبان استاندارد C99 روی پردازنده (CPU) پیادهسازی کند. فایل چکپوینت این مدل حدود ۱.۵۶ ترابایت حجم دارد، اما حداکثر رم مصرفی در زمان اجرا تنها ۸.۲۴ گیگابایت است.
#Kimi_K3 #Mixture_of_Experts
یک دستاورد فنی شگفتانگیز در حوزه هوش مصنوعی محلی نشان میدهد که چطور میتوان مدلهای بسیار عظیم را بدون نیاز به پردازندههای گرافیکی گرانقیمت یا فریمورکهای سنگین اجرا کرد. پروژه kimi-k3-in-c موفق شده است فرآیند استنتاج (Inference) مدل زبانی غولپیکر Kimi K3 با ۲.۷۸ تریلیون پارامتر را تقریباً از صفر و با زبان استاندارد C99 روی پردازنده (CPU) پیادهسازی کند. فایل چکپوینت این مدل حدود ۱.۵۶ ترابایت حجم دارد، اما حداکثر رم مصرفی در زمان اجرا تنها ۸.۲۴ گیگابایت است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Kimi_K3 #Mixture_of_Experts
❤1
🚀 بهروزرسانی منابع درسی مدلهای زبانی بزرگ
دانشگاه جورجیا تک، سرفصلهای دوره پیشرفته
برخی از مهمترین مباحث مطرحشده در این دوره شامل موارد زیر است:
- پیشآموزش (Pre-training) و معماریهای Mixture of Experts
- روشهای استنتاج (Reasoning) و یادگیری تقویتی
- ساختار سیستمهای عاملی (Agents) و مدلهای Diffusion
- مقیاسپذیری در زمان استنتاج و مدیریت متنهای طولانی
- مباحث ایمنی، تفسیرپذیری و اخلاق در هوش مصنوعی
شما میتوانید جزئیات کامل سیلابس و منابع مطالعاتی را از طریق وبسایت رسمی دوره مشاهده کنید. همچنین برای دسترسی به لیست کامل مقالات و متریال آموزشی، این جدول مرجع در دسترس علاقهمندان قرار گرفته است.
#Mixture_of_Experts #Diffusion_Language_Models
دانشگاه جورجیا تک، سرفصلهای دوره پیشرفته
Large Language Models خود برای بهار ۲۰۲۶ را بهروزرسانی کرده است. این دوره مجموعهای جامع از مباحث کلیدی و لبه دانش در حوزه هوش مصنوعی را پوشش میدهد.برخی از مهمترین مباحث مطرحشده در این دوره شامل موارد زیر است:
- پیشآموزش (Pre-training) و معماریهای Mixture of Experts
- روشهای استنتاج (Reasoning) و یادگیری تقویتی
- ساختار سیستمهای عاملی (Agents) و مدلهای Diffusion
- مقیاسپذیری در زمان استنتاج و مدیریت متنهای طولانی
- مباحث ایمنی، تفسیرپذیری و اخلاق در هوش مصنوعی
شما میتوانید جزئیات کامل سیلابس و منابع مطالعاتی را از طریق وبسایت رسمی دوره مشاهده کنید. همچنین برای دسترسی به لیست کامل مقالات و متریال آموزشی، این جدول مرجع در دسترس علاقهمندان قرار گرفته است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Mixture_of_Experts #Diffusion_Language_Models
❤1
🧩 معماری Mixture of Experts (MoE) در مدلهای زبانی
چه میشود اگر یک مدل زبانی بزرگ (LLM) بیش از ۱۰۰ میلیارد پارامتر داشته باشد، اما نیازی نباشد برای پردازش هر توکن از همه آنها استفاده کند؟ این ایمهمترین محورهای معماری Mixture of Experts (MoE) است. معماری، ظرفیتها و ملاحظات فنی در تحلیل تخصصی مدل با جزئیات بیشتری آمده است.
به جای یک شبکه عصبی غولپیکر واحد، معماری MoE از چندین زیرشبکه تخصصی به نام «متخصص» (Expert) استفاده میکند:
این رویکرد درست مانند یک سازمان بزرگ است؛ شما برای حل هر مسئلهای کل شرکت را بسیج نمیکنید، بلکه کار را به متخصصان همان حوزه میسپارید. با استفاده از تکنیک MoE، ظرفیت و دانش مدل به شدت افزایش مییابد، در حالی که هزینه و زمان محاسبات به ازای هر توکن بهینه باقی میماند.
#Mixture_of_Experts #Router
چه میشود اگر یک مدل زبانی بزرگ (LLM) بیش از ۱۰۰ میلیارد پارامتر داشته باشد، اما نیازی نباشد برای پردازش هر توکن از همه آنها استفاده کند؟ این ایمهمترین محورهای معماری Mixture of Experts (MoE) است. معماری، ظرفیتها و ملاحظات فنی در تحلیل تخصصی مدل با جزئیات بیشتری آمده است.
به جای یک شبکه عصبی غولپیکر واحد، معماری MoE از چندین زیرشبکه تخصصی به نام «متخصص» (Expert) استفاده میکند:
۱. یک Router تصمیم میگیرد کدام متخصصان برای توکن ورودی مناسبترند.
۲. تنها تعداد معدودی از متخصصان فعال شده و توکن را پردازش میکنند.
۳. خروجی آنها با هم ترکیب میشود.
این رویکرد درست مانند یک سازمان بزرگ است؛ شما برای حل هر مسئلهای کل شرکت را بسیج نمیکنید، بلکه کار را به متخصصان همان حوزه میسپارید. با استفاده از تکنیک MoE، ظرفیت و دانش مدل به شدت افزایش مییابد، در حالی که هزینه و زمان محاسبات به ازای هر توکن بهینه باقی میماند.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Mixture_of_Experts #Router