آموزش LLM و VLM
2.72K subscribers
39 photos
24 videos
19 files
98 links
آموزش تخصصی LLM و Hugging face

گروه مباحثه:

@llm_group
Download Telegram
Forwarded from Tensorflow(@CVision)
📊 بهره‌وری توکن در Agent Arena

بنچ مارک Agent Arena عملکرد ایجنت‌های هوش مصنوعی رو روی تسک‌های واقعی (نوشتن کد، ساخت اسلاید، تحقیق وب، توسعه اپ، تحلیل اسناد) با ابزارهای search، filesystem و terminal می‌سنجه.

نکته کلیدی اینه که مصرف توکن بیشتر همیشه به کیفیت بهتر منجر نمی‌شه. این نمودار هر مدل را نشون می‌ده
بهبود عملکرد (عمودی) در برابر میانه توکن مصرفی (افقی) — و یک خط روند کلی ترسیم می‌کنه. فاصله از این خط، بخش جالب ماجراست.

یافته‌ها:

مدل Opus با توکن کمتر کیفیت بالاتری می‌ده. Fable با +۱۴.۱٪ بهترین کیفیت رو داره، در برابر +۹.۲٪ برای Opus 4.8 Thinking با مصرف توکن مشابه.

هر سه مدل GPT-5.5 (بین +۶.۲٪ تا +۸.۶٪) بالای خط بهره‌وری قرار دارن، با توکن کمتر از مدل‌های پیشروی Claude.

مدل GLM-5.2 با +۵.۱٪ تقریباً دقیق روی خط روند قرار می‌گیره.

⚠️ توکن مساوی بازده نیست: Gemini-3.5 Flash بیشترین توکن رو مصرف می‌کنه ولی فاصله زیادی تا فرانتیر داره، و Grok Build 0.1 با ۲۰هزار+ توکن، بهبود منفی نشون می‌ده.

⚠️ گوشه پایین-چپ (مصرف کم، بازده کم): Grok-4.3، Nemotron 3 Ultra و Gemma-4 31B.

@cvision
14
This media is not supported in your browser
VIEW IN TELEGRAM
مدل LocateAnything از NVIDIA؛ حذف یکی از بزرگ‌ترین گلوگاه‌های مدل‌های Vision-Language

مدل جدید LocateAnything انویدیا مشکل کندی مدل‌های تشخیص اشیاء رو با یه ایده ساده و هوشمندانه حل کرده:
Parallel Box Decoding (PBD).

مسئله چی بود؟ مدل‌های VLM معمولاً مختصات هر باکس (x1,y1,x2,y2) رو توکن به توکن و به‌صورت متوالی تولید می‌کنن. وقتی صحنه پر از اشیاء باشه (مثلاً ۱۰۰ آبجکت)، این یعنی هزاران توکن قبل از رسیدن به جواب نهایی! هم کند، هم چون مختصات یک باکس مستقل از هم پیش‌بینی می‌شن، کاهش دقت هندسی.

راه‌حل PBD: کل باکس به‌عنوان یک واحد اتمیک (block) با طول ثابت در یک گام موازی پیش‌بینی می‌شه، نه توکن به توکن. این کار هم‌زمانی همون‌قدر که سرعت رو بالا می‌بره، دقت رو هم بهتر می‌کنه چون چهار مختصه با آگاهی از هم پیش‌بینی می‌شن (نه کور و مستقل).

📄 مقاله:
https://research.nvidia.com/labs/lpr/locate-anything/LocateAnything.pdf

🌐 پروژه:
https://research.nvidia.com/labs/lpr/locate-anything/

💻 دمو :
https://huggingface.co/spaces/nvidia/LocateAnything

🤗مدل:
https://huggingface.co/spaces/nvidia/LocateAnything
18
مدل SenseNova-Vision-7B-MoT از تیم SenseNova

برخلاف VLMهای معمول (مثل Qwen-VL) که فقط تصویر می‌گیرن و متن تولید می‌کنن، این مدل هم متن تولید می‌کنه هم تصویر — یعنی می‌تونه خروجی‌هایی مثل نقشه عمق، ماسک سگمنتیشن یا نقشه نقاط سه‌بعدی رو مستقیماً و بدون هد اختصاصی برای هر تسک بسازه


- تشخیص اشیا، لوکالیزیشن، OCR، گراندینگ رابط کاربری، کی‌پوینت

- تخمین عمق و نرمال سطح

- سگمنتیشن (رفرنسی، استدلالی، تعاملی، GCG)

- بازسازی هندسه چندنمایی و تخمین پوز دوربین


📊 عملکرد:

در مقایسه با Qwen3-VL-8B-Instruct، در اکثر تسک‌های تشخیص و لوکالیزیشن جلوتره؛ مثلاً OCR (ICDAR15): ۴۹.۵ در برابر ۲۵.۴، و RefCOCOg: ~80 در برابر ~72.

البته در مقابل، توی درک عمومی تصویر (MMMU) با نمره ۰.۴۲ از Bagel (۰.۵۵) عقب‌تره — یعنی این مدل تخصصیِ کارهای ساختاریافته بینایی‌ست، نه مکالمه و استدلال عمومی.


🔗 مدل در هاگینگ فیس
🔗 گیت‌هاب
📄 مقاله

___
@llm_huggingface
@cvision
5
پارت ۱

تو دوره‌ی LLM مکتب‌خونه با مفهوم knowledge distillation آشنا شدیم؛ ایده‌ی ساده و آشنا: یه مدل معلمِ بزرگ و گرون، یه مدل دانش‌آموزِ کوچیک‌تر رو آموزش می‌ده تا رفتارش رو تقلید کنه.
اما واقعیت اینه که این روش خیلی متنوع‌تره. تو پست زیر نشون می‌ده مدل‌های فرانتیر ۲۰۲۶ دقیقاً از چه نسخه‌هایی از distillation استفاده می‌کنن:

1️⃣ معلم بزرگ و دانش‌آموز کوچیک (روش کلاسیک):
مثل Gemma 3 و DeepSeek-R1-Distill که یا روی logit‌های معلم match می‌کنن (soft label) یا مستقیم روی متن تولیدشده‌ی معلم fine-tune می‌شن.
👍63
آموزش LLM و VLM
پارت ۱ تو دوره‌ی LLM مکتب‌خونه با مفهوم knowledge distillation آشنا شدیم؛ ایده‌ی ساده و آشنا: یه مدل معلمِ بزرگ و گرون، یه مدل دانش‌آموزِ کوچیک‌تر رو آموزش می‌ده تا رفتارش رو تقلید کنه. اما واقعیت اینه که این روش خیلی متنوع‌تره. تو پست زیر نشون می‌ده مدل‌های…
پارت ۲

2️⃣ ادغام چند متخصص RL در یک مدل (on-policy distillation):
به‌جای اینکه یک مدل رو با RL روی همه‌چی خوب کنیم (که باعث فراموشی مهارت‌های قبلی می‌شه)، برای هر حوزه (ریاضی، کد، ایجنت) یه معلمِ متخصص جدا با RL می‌سازن، بعد همه رو تو یه دانش‌آموز واحد distill می‌کنن؛ در حالی که خودِ دانش‌آموز داره rollout تولید می‌کنه. جالبه که این معلم‌ها لزوماً بزرگ‌تر نیستن، فقط تخصصی‌ترن. این الگو رو DeepSeek-V4، MiMo (با نام MOPD)، GLM-5 و Nemotron 3 Ultra استفاده کردن.

3️⃣ خود مدل، معلم خودش (self-distillation):
مثل Cursor Composer 2.5 که یه hint به context اضافه می‌کنه، نسخه‌ی hint‌دار مدل می‌شه معلم نسخه‌ی بدون‌hint. یا روش Thinking Machines که برای جلوگیری از فراموشی، از چک‌پوینتِ قبل از fine-tune به‌عنوان معلم استفاده می‌کنن.


نکته‌ی مشترک همه‌شون: معلم لزوماً بزرگ‌تر نیست، فقط تو یه context یا حوزه بهتره. گاهی اون معلم، خودِ مدله.

🔗 منبع: huggingface.co/blog/sergiopaniego/distillation-2026
👍12
🚀 مون‌شات از کیمی K3 رونمایی کرد

شرکت چینی Moonshot AI امروز قدرتمندترین مدل پرچمدار خودش، Kimi K3، رو رسما معرفی کرد.


🔹 پنجره‌ی زمینه تا ۱ میلیون توکن
🔹 بهبود قابل‌توجه در کدنویسی، تولید سه‌بعدی و وظایف دانشی پیچیده
🔹 طبق برخی نشت‌ها و تست‌های کاربران، حدود ۲.۵ تریلیون پارامتر دارد (این رقم هنوز رسما تأیید نشده)
🔹 در برخی بنچمارک‌های کدنویسی از GPT-5.5 جلو زده

این عرضه فقط ۳ ماه بعد از متن‌باز شدن K2.6 اتفاق افتاد و نشون‌دهنده‌ی شتاب چشمگیر در چرخه‌ی توسعه‌ی موشن‌شاته.

💰 هم‌زمان، موشن‌شات دور جدید تأمین مالی با ارزش‌گذاری ۲۰ میلیارد دلاری رو بسته و درآمد سالانه‌ی خانواده‌ی مدل‌های کیمی از ۳۰۰ میلیون دلار عبور کرده.

بازار پیش‌بینی Polymarket پیش از رونمایی، احتمال عرضه‌ی K3 در جولای رو تا ۹۸٪ برآورد کرده بود.

📎 منبع: finance.biggo.com
🔥51
Forwarded from Tensorflow(@CVision)
Media is too big
VIEW IN TELEGRAM
مقدمه کورس Agentic AI که در روزهای پیش رو منتشر خواهد شد...
🔥287👍2
🧠 مایکروسافت مدل جدید Mage-VL رو منتشر کرد؛ یک مدل چندوجهیِ «کدک-محور» برای درک ویدیو و استریم زنده

مایکروسافت دو مدل به‌هم‌مرتبط رو روی HuggingFace منتشر کرده:

🔹 مدل Mage-VL — مدل چندوجهیِ ۴ میلیارد پارامتری (بر پایه‌ی Qwen3-4B) که هم‌زمان تصویر، ویدیوی کوتاه/بلند و استریم زنده رو درک می‌کنه.
🔹 مدل Mage-ViT — انکودر بصری همین مدل، که کاملاً از صفر (بدون هیچ پیش‌آموزش تصویر-متنِ میلیاردی) آموزش دیده.

ایده‌
به‌جای اینکه ویدیو رو به فریم‌های یکنواخت تبدیل کنن و همه‌شون رو به مدل بدن (که پرهزینه‌ست)، از منطق کدک‌های ویدیویی (مثل H.264/HEVC) الهام گرفتن: فقط فریم‌های کلیدی (I-frame) کامل نگه داشته می‌شن و از فریم‌های پیش‌بینی‌شده (P-frame) فقط بخش‌هایی که واقعاً حرکت/تغییر دارن انتخاب می‌شن. نتیجه؟

• کاهش بیش از ۷۵٪ در تعداد توکن‌های بصری
• تا ۳.۵ برابر سرعت بیشتر در inference
• آموزش روی ویدیوهایی تا ۸ برابر طولانی‌تر با همون بودجه‌ی محاسباتی

📊 عملکرد:
با همون بک‌بون ۴B، در تقریباً همه‌ی بنچمارک‌های ویدیویی و درک مکانی از Qwen3-VL-4B جلوتره (مثلاً +۲۲.۵ در QVHighlight و +۱۱ در VSI-Bench)، و در تصاویر استاتیک هم‌سطح یا کمی بهتره.

🎙️ یه قابلیت جالب دیگه: یک «گیت شناختی» سبک داره که مدل رو در حالت استریم فقط وقتی «رویداد قابل‌توجهی» رخ بده فعال می‌کنه (مثلاً روی گزارش زنده‌ی فوتبال تست شده) — بدون نیاز به چند مدل جدا.


🔗 Mage-VL: https://huggingface.co/microsoft/Mage-VL
🔗 Mage-ViT: https://huggingface.co/microsoft/Mage-ViT
6👍2
Forwarded from َAgenticAI
Media is too big
VIEW IN TELEGRAM
🤖 دوره «Agentic AI با پایتون» منتشر شد!

اگه دنبال این هستی که از حرف زدن با یه مدل زبانی، بری سراغ ساختن عامل‌هایی (Agent) که واقعاً کار انجام می‌دن، ابزار صدا می‌زنن، با هم تیم می‌شن و پروژه‌های واقعی رو پیش می‌برن، این دوره برای شماست!

توی ۸ فصل، از صفر تا ساخت یک پروژه‌ی نهایی کامل جلو می‌ریم:

📘 مقدمه 📗 فصل ۱ - مقدمه‌ای بر گردش‌کارهای عامل‌محور 📗 فصل ۲ - الگوی طراحی Reflection 📗 فصل ۳ - استفاده از ابزار (Tool Use) 📗 فصل ۴ - MCP (پروتکل ارتباط مدل با ابزارها) 📗 فصل ۵ - نکات عملی برای ساخت Agentic AI 📗 فصل ۶ - الگوهای عامل‌های با خودمختاری بالا 📗 فصل ۷ - سیستم‌های چندعامله با crewAI 📗 فصل ۸ - LangChain

🎯 پروژه نهایی: پیاده‌سازی سامانه‌ی Text-to-SQL

تمام کدهای دوره روی گیت‌هاب در دسترس است:
👉 github.com/Alireza-Akhavan/agentic_ai


🎁 تخفیف ویژه
1️⃣برای ۱۰۰ نفر اول، کد تخفیف ۷۰٪ی: COUPON-EAA61
2️⃣ برای ۱۰۰ نفر بعدی، کد تخفیف ۶۰٪ی: COUPON-6EE77

تعداد کدها محدوده، پس اگر می‌خواهی Agentic AI را اصولی یاد بگیری، همین امروز ثبت‌نام کن.



سرفصلهای این دوره |برای مشاهده اسلاید؛ تمرین، پروژه 👈 @agentic_llm
🔥62
Forwarded from َAgenticAI
در صورتی که به مدرک مکتب‌خونه نیاز ندارید، می‌توانید کوییزها، و تمرین‌ها و پروژه‌ها را از طریق کانال دانلود کنید:

لینک کانال: https://xn--r1a.website/agentic_llm

لینک دوره: https://mktb.me/m6tt/

هنگام خرید، کافیست گزینه‌ی «دسترسی پایه» را تیک بزنید تا فقط به ویدیوها دسترسی داشته باشید و بتوانید با هزینه‌ی کمتری ثبت‌نام کنید.

@agentic_llm
👍72
Forwarded from Tensorflow(@CVision)
📢 اگر پست دیروز را ندیدید...

دوره Agentic AI با پایتون منتشر شده و از مفاهیم پایه تا ساخت Agentهای حرفه‌ای، MCP، Tool Use، سیستم‌های چندعامله با crewAI، LangChain و پروژه‌ی نهایی Text-to-SQL را به‌صورت عملی آموزش می‌دهد.

🎁 هنوز کد تخفیف ۶۰٪ برای تعداد محدودی از ثبت‌نام‌ها فعال است:

COUPON-6EE77

https://mktb.me/m6tt/

اگر قصد یادگیری Agentic AI را دارید، پیشنهاد می‌کنم فرصت باقی‌مانده را از دست ندهید.

📚 سرفصل‌ها، اسلایدها، تمرین‌ها و پروژه‌ها:
👉 @agentic_llm
👍3