هوش مصنوعی و علم داده به فارسی
6.06K subscribers
2.09K photos
512 videos
366 files
2.26K links
DataPlusScience | هوش مصنوعی و علم داده به فارسی
اخبار، تحلیل، آموزش و ابزارهای کاربردی

🌐 DataPlusScience.ir

📩 ارتباط با ما: @Contact2Mebot

📂 کانال فایل‌ها: @Datascientists_Files

💎 بله: ble.ir/dataplusscience

💡 ایتا: eitaa.com/DataPlusScience
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 ‏ عرضه مدل قدرتمند Kimi K3 با ۲.۸ تریلیون پارامتر

🚨 ‏ شرکت Moonshot AI مدل جدید Kimi K3 را با ۲.۸ تریلیون پارامتر در پلتفرم Hugging Face منتشر کرد. این نخستین مدل در کلاس ۳ تریلیون پارامتر است که به صورت Open-weights در دسترس عموم قرار می‌گیرد. به لطف معماری MoE (مدل ترکیبی متخصصان)، در هر توکن تنها ۱۰۴ میلیارد پارامتر فعال می‌شوند که شامل ۱۶ متخصص از مجموع ۸۹۶ متخصص موجود است.

🧠 ‏ این مدل از کانتکست یک میلیون توکنی پشتیبانی کرده و به‌صورت بومی با متن و تصویر کار می‌کند. ساختار فنی آن شامل ۹۳ لایه است که از ۶۹ لایه Kimi Delta Attention (مکانیزم توجه بهینه) و ۲۴ لایه Gated MLA تشکیل شده است. استفاده از فرمت‌های MXFP4 برای وزن‌ها و MXFP8 برای اکتیویشن‌ها، باعث شده تا بهره‌وری مقیاس‌پذیری آن ۲.۵ برابر نسبت به نسخه K2 افزایش یابد.

⚡ ‏ مدل Kimi K3 به‌طور خاص برای وظایف ایجنتیک طولانی توسعه یافته است.

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Kimi_K3 #Mixture_of_Experts
❤1
‏💻 اجرای مدل ۲.۷۸ تریلیون پارامتری Kimi K3 روی پردازنده معمولی و ۸ گیگابایت رم

‏یک دستاورد فنی شگفت‌انگیز در حوزه هوش مصنوعی محلی نشان می‌دهد که چطور می‌توان مدل‌های بسیار عظیم را بدون نیاز به پردازنده‌های گرافیکی گران‌قیمت یا فریم‌ورک‌های سنگین اجرا کرد. پروژه kimi-k3-in-c موفق شده است فرآیند استنتاج (Inference) مدل زبانی غول‌پیکر Kimi K3 با ۲.۷۸ تریلیون پارامتر را تقریباً از صفر و با زبان استاندارد C99 روی پردازنده (CPU) پیاده‌سازی کند. فایل چک‌پوینت این مدل حدود ۱.۵۶ ترابایت حجم دارد، اما حداکثر رم مصرفی در زمان اجرا تنها ۸.۲۴ گیگابایت است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما

#Kimi_K3 #Mixture_of_Experts
❤1
‏🚀 به‌روزرسانی منابع درسی مدل‌های زبانی بزرگ

‏دانشگاه جورجیا تک، سرفصل‌های دوره پیشرفته Large Language Models خود برای بهار ۲۰۲۶ را به‌روزرسانی کرده است. این دوره مجموعه‌ای جامع از مباحث کلیدی و لبه دانش در حوزه هوش مصنوعی را پوشش می‌دهد.

‏برخی از مهم‌ترین مباحث مطرح‌شده در این دوره شامل موارد زیر است:

‏- پیش‌آموزش (Pre-training) و معماری‌های Mixture of Experts
‏- روش‌های استنتاج (Reasoning) و یادگیری تقویتی
‏- ساختار سیستم‌های عاملی (Agents) و مدل‌های Diffusion
‏- مقیاس‌پذیری در زمان استنتاج و مدیریت متن‌های طولانی
‏- مباحث ایمنی، تفسیرپذیری و اخلاق در هوش مصنوعی

‏شما می‌توانید جزئیات کامل سیلابس و منابع مطالعاتی را از طریق وب‌سایت رسمی دوره مشاهده کنید. همچنین برای دسترسی به لیست کامل مقالات و متریال آموزشی، این جدول مرجع در دسترس علاقه‌مندان قرار گرفته است.

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Mixture_of_Experts #Diffusion_Language_Models
❤1
‏🧩 معماری Mixture of Experts (MoE) در مدل‌های زبانی

‏چه می‌شود اگر یک مدل زبانی بزرگ (LLM) بیش از ۱۰۰ میلیارد پارامتر داشته باشد، اما نیازی نباشد برای پردازش هر توکن از همه آن‌ها استفاده کند؟ این ایمهم‌ترین محورهای معماری Mixture of Experts (MoE) است. معماری، ظرفیت‌ها و ملاحظات فنی در تحلیل تخصصی مدل با جزئیات بیشتری آمده است.

‏به جای یک شبکه عصبی غول‌پیکر واحد، معماری MoE از چندین زیرشبکه تخصصی به نام «متخصص» (Expert) استفاده می‌کند:

‏
۱. یک Router تصمیم می‌گیرد کدام متخصصان برای توکن ورودی مناسب‌ترند.
‏۲. تنها تعداد معدودی از متخصصان فعال شده و توکن را پردازش می‌کنند.
‏۳. خروجی آن‌ها با هم ترکیب می‌شود.


‏این رویکرد درست مانند یک سازمان بزرگ است؛ شما برای حل هر مسئله‌ای کل شرکت را بسیج نمی‌کنید، بلکه کار را به متخصصان همان حوزه می‌سپارید. با استفاده از تکنیک MoE، ظرفیت و دانش مدل به شدت افزایش می‌یابد، در حالی که هزینه و زمان محاسبات به ازای هر توکن بهینه باقی می‌ماند.

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Mixture_of_Experts #Router