Forwarded from RandRng
RandRng
دیروز یا پیروز GLM5.2 روی وبسایت chat.z.ai اضافه شد و این یعنی نسخه نهایی هست (نسخهای که قبلتر روی api اومده بود نهایی نشده بود) بعنوان یک مدل رایگان و opensource باید بگم هیولا هست؛ برای من نصف تستهام که روی کدها انجام میدادم رو با همون تلاش اول بطور…
This media is not supported in your browser
VIEW IN TELEGRAM
اینم یک تست دیگه از این مدل هست؛ خواستم برای ویدئوهای یوتیوب یک تیکه ویدئو کوچیک بسازم از لوگو
رو تست کردم ولی هیچکدوم نتونستند این کار رو بکنند (با کد این ویدئو ساخته شده)
چندتا تست فرانت روی این مدل زدم و دیدم خیلی عالی روی کدهای فرانت اند کار میکنه (فوقالعاده هست برای طراحی) به ذهنم رسید همین کار رو با این مدل هم تست کنم.
همون پرامپت جزئی که به مدلهای قبلی دادم رو به این مدل هم دادم و خروجی رو میتونید خودتون مقایسه کنید.
پینوشت:
این مدل با پرامپت خوب؛ هیولاتر از چیزی هست که بنچمارکها دارند گزارش میدهند
جالبترین نکته:
بنچمارکهای خصوصی نتایج بهتری نسبت به بنچمارکهای منتشر شده توسط خود تیم
Gemini, ChatGPT, Claude, Grok, Qwen رو تست کردم ولی هیچکدوم نتونستند این کار رو بکنند (با کد این ویدئو ساخته شده)
چندتا تست فرانت روی این مدل زدم و دیدم خیلی عالی روی کدهای فرانت اند کار میکنه (فوقالعاده هست برای طراحی) به ذهنم رسید همین کار رو با این مدل هم تست کنم.
همون پرامپت جزئی که به مدلهای قبلی دادم رو به این مدل هم دادم و خروجی رو میتونید خودتون مقایسه کنید.
پینوشت:
این مدل با پرامپت خوب؛ هیولاتر از چیزی هست که بنچمارکها دارند گزارش میدهند
جالبترین نکته:
بنچمارکهای خصوصی نتایج بهتری نسبت به بنچمارکهای منتشر شده توسط خود تیم
GLM داره❤16
این ادعای بنچمارک یک مدل ۳ میلیارد پارامتری هست؛ تخصصی برای تسکهایی که نیاز به Thinking دارند.
و نتایجی نزدیک به مدلهای بیش از
Hugging face
Paper
و نتایجی نزدیک به مدلهای بیش از
300x بزرگترHugging face
Paper
❤18👍3
Forwarded from RandRng
نسل بعدی مدلها بنظرم خیلی بهتر خواهند شد :
Qwen AgentWorld
بنظرم این حرکت در راستای
Qwen AgentWorld
بنظرم این حرکت در راستای
JEPA خواهد بود و این Gap بین LLM و JEPA رو برای مدتی میپوشونه تا نتایج مدلهای بر پایه JEPA خیلی بهتر بشه.❤11👍3
Forwarded from RandRng
95% of enterprise AI deployments fail to deliver value
در یک حرکتی چندتا از این شرکتهای
AI فروش داخلی (کاسبان تحریم) روی موجهای اخیر درحال تلاش برای خوروندن LLM به شرکتهای دیگر هستند. شرکتهایی که همینطوری بخاطر تحریم؛ جنگ؛ قطعی اینترنت و تعطیلی به زور سرپا موندند.برای همین خواستم دوتا مورد رو یادآوری کنم:
اولین مورد گزارش
MIT روی میزان سودآوری AI (که ۹۵٪ میزان بازگشت 0 داشتند) legal.io
مورد دوم؛
تجربه شخصی بنده توی کار با تیمی از مهندسها که مدتی قبل منتور اونها بودم.
( استفاده درست از LLM ها برای مهندسی کامپیوتر )
با نهایت احترام به شرکتهای
AI داخلی که واقعا innovation دارند و در تلاش برای پیشرفت جامعهی ایرانی هم هستند.Telegram
RandRng
#تجربه@per3onnel
این موضوع برداشت من براساس دادههای گروهی از افراد هست که منتور اونها هستم (قبلتر گفتم راجبش)
با این بحث شروع کنم که، من برای توسعه کدهام neovim, vscode رو دارم و اکثر وقتم توی neovim هست.
روی هیچکدوم ai, agent هم ندارم.
cursor, gravity…
این موضوع برداشت من براساس دادههای گروهی از افراد هست که منتور اونها هستم (قبلتر گفتم راجبش)
با این بحث شروع کنم که، من برای توسعه کدهام neovim, vscode رو دارم و اکثر وقتم توی neovim هست.
روی هیچکدوم ai, agent هم ندارم.
cursor, gravity…
👍10❤3
Needle: We Distilled Gemini Tool Calling into a 26M Model
این مدل برای تخصصی برای
البته ابزارهای من ساده و قدیمی هست (خیلی وقت هست از این پروژه استفاده نکردم) اما بنظرم مدلی هست که ارزش تست کردن داشته باشه واقعا؛ اگر برای
این مدل برای تخصصی برای
tool calling ساخته شده؛ من جایگزین مدل ۴ میلیارد پارامتری کردم و همچنان به درستی از ابزارهایی که داشتم استفاده میکنه.البته ابزارهای من ساده و قدیمی هست (خیلی وقت هست از این پروژه استفاده نکردم) اما بنظرم مدلی هست که ارزش تست کردن داشته باشه واقعا؛ اگر برای
tool calling نیاز به مدل دارید یک تستی هم روی این انجام بدید اما بیشتر از tool call ازش توقع نداشته باشید.Cactuscompute
Needle: We Distilled Gemini Tool Calling into a 26M Model
An open-source 26M parameter function-calling model that runs at 6000 tok/s prefill and 1200 tok/s decode on consumer devices.
👍10❤2
Forwarded from RandRng
LLM قراره جای برنامه نویسهارو بگیره ؟
من که کدم رو + دستورالعمل ریفکتور دادم تا برام تمیز کنه و خروجی که توی تصویر هست
نصف باگهای مدلهای
LLM رو من درآوردم باید بهم هزینه پرداخت کنند واقعاپینوشت:
تازه ۳۵ دقیقه هم طول کشید. خودم میزدم ۲۰ دقیقهای تموم میشد.
👍12❤3
یک پستی از دوست و همکار قدیمی توی لینکدین دیدم راجب یک کتابی که درحال نوشته شدن و تکمیل هست مخصوص کسانی که به
علاقمند هستند گفتم اینجا هم به اشتراک بذارم
Linked In
شخصا درحال خالی کردن وقت برای خوندنش هستم چون موارد جالبی پوشش داده شده
مثلا اینکه بدون نیاز به سیستمعامل بتونید کار دیپلرنینگ انجام بدید چیزی نیست که روی فریمورکها و پایتون و ... آموزش داده بشه
Deep Learning + Rust علاقمند هستند گفتم اینجا هم به اشتراک بذارم
Linked In
شخصا درحال خالی کردن وقت برای خوندنش هستم چون موارد جالبی پوشش داده شده
مثلا اینکه بدون نیاز به سیستمعامل بتونید کار دیپلرنینگ انجام بدید چیزی نیست که روی فریمورکها و پایتون و ... آموزش داده بشه
LinkedIn
Data Scientists: Burn Framework Solves Inference and Deployment Issues | Omid Safarzadeh posted on the topic | LinkedIn
Six complaints I hear from #data #scientists:
All six have the same answer, and it #isn't a #faster #GPU.
1. "Inference is fast, but the #service is #slow"
2."Deployment is a 4 GB #Docker image and a #dependency hell"
3. "It needs to run #on the #device…
All six have the same answer, and it #isn't a #faster #GPU.
1. "Inference is fast, but the #service is #slow"
2."Deployment is a 4 GB #Docker image and a #dependency hell"
3. "It needs to run #on the #device…
❤16👍5
Forwarded from RandRng
مدلهای
https://telegram.me/per3onnel/263
یک سری افراد نشستند و همین کار رو برای
بطور خیلی ساده کاری که میکنه اینه که یک
البته دنبال بهترین سرعتها نباشید
اما این روش بنظرم خیلی جواب خواهد بود من ۳ سال قبل گفتم که روی یک پروژه قدیمیتر (الان حساب کنیم شاید ۷-۸ سال قبل) از
https://telegram.me/pytens/1087
حالا فرض کنید یک نفر همچین کاری رو بکنه :
هرچند بنظرم تا استاندارد شدن این روش شاید راه طولانی رو در پیش نداشته باشیم حتی؛ سالهاست که
برای بررسی دقیقتر به گیتهاب پروژه سر بزنید :
Colibri Github
MoE خیلی جذابتر از مدلهای Dense هستند بنظرم چون میتونی یک مدل خیلی بزرگتر رو روی یک GPU خیلی کوچکتر با سرعت بالا اجرا کنی مثل :https://telegram.me/per3onnel/263
یک سری افراد نشستند و همین کار رو برای
GLM.5-2 با فشرده سازی و اپیتیمایز کردن بسیار انجام دادند بطوری که طبق ادعا خودشون مدل 774 میلیارد پارامتری رو روی سیستم با 25GB رم و بدون نیاز به GPU اجرا کردند (همه چیز روی C نوشته شده) بطور خیلی ساده کاری که میکنه اینه که یک
backbone اصلی رو توی رم نگه میداره و باقی رو روی SSD - اگر یادتون باشه توی اون پستها من توضیح دادم که MoE میشه بخش اصلی که نیاز به پردازش داره رو روی VRAM نگهداشت و باقی موارد رو روی RAM حالا این افراد یک قدم جلوتر رفتند و بخش زیادی رو روی SSD نگهداری میکنند؛ برعکس llamacpp که از memory mapping استفاده میکنه این کتابخونه صبر میکنه تا مدل تصمیم بگیره برای پرامپت دقیقا کدوم expert هارو نیاز داره و بعد همونارو روی SSD بخونهالبته دنبال بهترین سرعتها نباشید
0.1tok/sec چیزی هست که نویسنده گزارش داده روی لپتاپ خودشاما این روش بنظرم خیلی جواب خواهد بود من ۳ سال قبل گفتم که روی یک پروژه قدیمیتر (الان حساب کنیم شاید ۷-۸ سال قبل) از
Redis برای نگهداری embedding هام استفاده میکردم https://telegram.me/pytens/1087
حالا فرض کنید یک نفر همچین کاری رو بکنه :
VRAM - RAM - SSD هرچند بنظرم تا استاندارد شدن این روش شاید راه طولانی رو در پیش نداشته باشیم حتی؛ سالهاست که
CPU ها دارند اینکار رو میکنند L1, L2, L3, RAM, SSD برای بررسی دقیقتر به گیتهاب پروژه سر بزنید :
Colibri Github
Telegram
RandRng
17.91 token/sec
برای شروع عدد خوبی هست ؟
روی GTX 1060 با ۶ گیگ گرافیک فکر کنم این GPU الان ۳۰ دلار قیمتش باشه
ولی داره Qwen3.6 با ۳۵ میلیارد پارامتر رو اجرا میکنه
docker run --gpus all --cap-add=IPC_LOCK \
-p 8080:8080 \
-v ~/.ai_models:/models:ro…
برای شروع عدد خوبی هست ؟
روی GTX 1060 با ۶ گیگ گرافیک فکر کنم این GPU الان ۳۰ دلار قیمتش باشه
ولی داره Qwen3.6 با ۳۵ میلیارد پارامتر رو اجرا میکنه
docker run --gpus all --cap-add=IPC_LOCK \
-p 8080:8080 \
-v ~/.ai_models:/models:ro…
❤18👍2
Forwarded from RandRng
این رو معرفی کنم
OKF (by google)
وقتی مدلها با کانتکستهای بالای
توی یک سری از ابزارهای چت شما میتونید مشخص کنید چت با چه پیامهایی از قبل مشخص شدهای شروع بشه و ماهم از همین تکنیک استفاده میکردیم.
مثلا برای نیروهای تازه وارد به شرکت؛ شماتیک دیتابیس رو توی چت اول میذاشتیم و نیرو همزمان با خوندن کدها اگر سوالی روی دیتابیس براش پیش میومد میتونست از مدل لوکال استفاده کنه و جلو بره.
برای بچههای سنیور هم خیلی خوب بود؛ هم سوالات خیلی کم شده بود؛ هم کمکی بود برای یادآوری و هم اگر کوئری بود که یادشون میرفت میتونستند از مدل بپرسند و تقریبا مطمئن باشند که بهترین جواب رو احتمالا خواهند گرفت.
حالا گوگل توی یک حرکت خیلی خفن اومده و یک استاندارد رو ارائه داده برای فرمت فایلها و ...
بجای اینکه یک چت هیستوری خیلی بزرگ به سیستم بدید (مثل کاری که ما میکردیم) اونها رو توی فایلهای
تقریبا دو روزی هست که دارم روی یک دیتابیس پروداکشن استفادهاش میکنم و بنظرم این از
مثلا:
توی سورس کد یک کوئری کند داشتیم و فکر میکردیم این دیگه ازین بهتر نمیشه؛ اما شد چون ما یک view ایی که ایجاد شده بود رو فراموش کردیم بودیم که همچین دیتایی رو داره و میتونه این کوئری رو هم اپتیمایز کنه و مدل این کوئری جدید رو بهمون داد.
برای استفادههای این شکلی بنظرم خیلی تکنیک تمیز و خوبی هست.
Github
توجه کنید هیچ تکنولوژی یا ... جدیدی پشت این نیست دنبال ابزار نباشید یک استاندارد برای نوشتن فایل
OKF (by google)
وقتی مدلها با کانتکستهای بالای
128K و حالا بیش از 1M استاندارد شدند واقعا هزینه توسعه و نگهداری سیستمهای RAG برام قابل درک نبود.توی یک سری از ابزارهای چت شما میتونید مشخص کنید چت با چه پیامهایی از قبل مشخص شدهای شروع بشه و ماهم از همین تکنیک استفاده میکردیم.
مثلا برای نیروهای تازه وارد به شرکت؛ شماتیک دیتابیس رو توی چت اول میذاشتیم و نیرو همزمان با خوندن کدها اگر سوالی روی دیتابیس براش پیش میومد میتونست از مدل لوکال استفاده کنه و جلو بره.
برای بچههای سنیور هم خیلی خوب بود؛ هم سوالات خیلی کم شده بود؛ هم کمکی بود برای یادآوری و هم اگر کوئری بود که یادشون میرفت میتونستند از مدل بپرسند و تقریبا مطمئن باشند که بهترین جواب رو احتمالا خواهند گرفت.
حالا گوگل توی یک حرکت خیلی خفن اومده و یک استاندارد رو ارائه داده برای فرمت فایلها و ...
بجای اینکه یک چت هیستوری خیلی بزرگ به سیستم بدید (مثل کاری که ما میکردیم) اونها رو توی فایلهای
markdown مختلف بشکونید ولی ابتدای هر فایل یک استاندارد رو رعایت کنید.تقریبا دو روزی هست که دارم روی یک دیتابیس پروداکشن استفادهاش میکنم و بنظرم این از
RAG, chat history خیلی بهتره (حداقل توی استفاده من) مثلا:
توی سورس کد یک کوئری کند داشتیم و فکر میکردیم این دیگه ازین بهتر نمیشه؛ اما شد چون ما یک view ایی که ایجاد شده بود رو فراموش کردیم بودیم که همچین دیتایی رو داره و میتونه این کوئری رو هم اپتیمایز کنه و مدل این کوئری جدید رو بهمون داد.
برای استفادههای این شکلی بنظرم خیلی تکنیک تمیز و خوبی هست.
Github
توجه کنید هیچ تکنولوژی یا ... جدیدی پشت این نیست دنبال ابزار نباشید یک استاندارد برای نوشتن فایل
Markdown هست بیشتر که مدل هوش مصنوعی شما راحت تر بفهمه چیکار کنه که بنظرم استاندارد تمیز و خوبی هم هست.Google Cloud Blog
How the Open Knowledge Format can improve data sharing | Google Cloud Blog
Learn how the Open Knowledge Format helps secure data sharing and improves collaboration across teams with standardized documentation.
👍16❤6
Forwarded from RandRng
Claude Leak
داستان چیه ؟ یک اتفاق تکراری دیگه.
هرکسی روی
یک نفر هم اومده توی گوگل زده
site:claude.ai/share
و دیده بله گوگل تمام و کمال همرو ایندکس کرده.
که خب یعنی خیلی شرکتهای دیگه هم اینکار رو کردند و البته خیلی جاهای دیگه هم دیتاهای مهم رو خوندند.
خیلی از بیزینسها ابراز نگرانی کردند و گوگل نتایج رو حذف کرد و گفته میشه که کلاد هم باگ رو برطرف کرده.
ولی همه میدونیم که ترین دیتای خوبی برای همه مدلها آماده شد.
داستان چیه ؟ یک اتفاق تکراری دیگه.
هرکسی روی
Calude چت خودش رو لینک Share براش گرفته چت بصورت کامل عمومی شده.یک نفر هم اومده توی گوگل زده
site:claude.ai/share
و دیده بله گوگل تمام و کمال همرو ایندکس کرده.
که خب یعنی خیلی شرکتهای دیگه هم اینکار رو کردند و البته خیلی جاهای دیگه هم دیتاهای مهم رو خوندند.
خیلی از بیزینسها ابراز نگرانی کردند و گوگل نتایج رو حذف کرد و گفته میشه که کلاد هم باگ رو برطرف کرده.
ولی همه میدونیم که ترین دیتای خوبی برای همه مدلها آماده شد.
ZDNET
Claude AI shared chats indexed by Google - see if your conversations were exposed - ZDNET
Google wasn't supposed to see them, but then everyone on Reddit did. Here's how to handle the situation.
👍14❤1
Forwarded from RandRng
لطفا ایشون رو برای همکاری استخدام کنید
AI developer runs 28.9-million-parameter model on $10 ESP32-S3 microcontroller — uses Google's Per-Layer Embeddings technique, stores table on 16MB Flash memory
اگر انقدر دیوونه هست که جنین کدی رو توی وقتهای خالی خودش بزنه؛ ببین توی کار چه کدهایی میزنه.
پینوشت:
خروجیش ۱ توکن در ثانیه هست مهم کاری هست که کرده و کدی که زده
AI developer runs 28.9-million-parameter model on $10 ESP32-S3 microcontroller — uses Google's Per-Layer Embeddings technique, stores table on 16MB Flash memory
اگر انقدر دیوونه هست که جنین کدی رو توی وقتهای خالی خودش بزنه؛ ببین توی کار چه کدهایی میزنه.
پینوشت:
خروجیش ۱ توکن در ثانیه هست مهم کاری هست که کرده و کدی که زده
Tom's Hardware
AI developer runs 28.9-million-parameter model on $10 ESP32-S3 microcontroller — uses Google's Per-Layer Embeddings technique,…
Local model running on a sub-$10 microcontroller is impressive despite its obvious limitations.
👍23❤3
Forwarded from RandRng
زده من اینکار رو کردم بعدش دیگه چه کارهایی میشه کرد باهاش ؟
هیچی تلاش کردی چندتاش رو بهم وصل کنی ببینی چی میده یا اصلا چطوری باید کد بزنی برای اتصال چندتاش به هم دیگه ؟
سریعتر میشه؛ کندتر میشه ؟
حالا
اگر مدل بزرگتر باشه چی میشه ؟
اصلا چطوری میشه چندتاش رو بهم وصل کرد (کارت شبکه که نداره)
مدل
اگر همه این کارها رو کردی و جواب همش رو درست متوجه شدی یک سری به این سایت بزن
Tenstorrent
برای موقعیت های شغلی که دارند رزومه بده؛ من قبلا فرستادم ولی چون معماری
پینوشت:
چندتا از بچهها این کار رو کردند و سوال پرسیدند.
هیچی تلاش کردی چندتاش رو بهم وصل کنی ببینی چی میده یا اصلا چطوری باید کد بزنی برای اتصال چندتاش به هم دیگه ؟
سریعتر میشه؛ کندتر میشه ؟
حالا
bottleneck کجاس ؟اگر مدل بزرگتر باشه چی میشه ؟
اصلا چطوری میشه چندتاش رو بهم وصل کرد (کارت شبکه که نداره)
مدل
P4 که روی RiscV هست چطوری کار میکنه ؟اگر همه این کارها رو کردی و جواب همش رو درست متوجه شدی یک سری به این سایت بزن
Tenstorrent
برای موقعیت های شغلی که دارند رزومه بده؛ من قبلا فرستادم ولی چون معماری
RISC-V بود و من بلدش نبودم رزومهام رد شد.پینوشت:
چندتا از بچهها این کار رو کردند و سوال پرسیدند.
Tenstorrent
Careers | Tenstorrent
We are looking for flexible thinkers who are excited by the future of AI to join our team.
👍6❤2
Forwarded from RandRng
در ادامه پروسههای باگ یابی من از شرکتهای هوش مصنوعی.
الان متوجه شدم چرا خیلی از بچهها میگن که فقط با
رو تست کردم؛ این مدلهای پارسر ضعیفتری دارند.
اول اینکه بنظر میاد همشون کد رو هم مثل
حجم زیادی کد بهشون دادم با پرامپت سختگیرانه (خیلی بیادبی هست وگرنه میذاشتم) و همشون چون رو حالت سخت گیری هست ارورهای پارسر رو نادیده نمیگیرند.
این نادیده گرفتن یک تکنیکی هست که ما هم توی پروداکشن استفاده میکنیم؛ اینطوری هست که اگر ببینید طرف راجب چیزی صحبت میکنه که به اندازه کافی علم داره ازش به مدل میگیم بعضی خطاها ممکنه اشتباه پارسر یا سرویس
ولی اینجا مدلهای بالا با پرامپتی که من دادم دیگه اینطوری نشد و کلی ایراد الکی گرفتند.
بعنوان مثال :
Bug 1: __main__.py entrypoint is broken
You have:
That is wrong.
It must be:
بدتر از اون اینکه بعضی مدلها حتی اینطوری میبیننش :
من تمام مدلهایی که اسم بردم رو توی ۳ حالت استفاده کردم :
۱- با پرامپت سختگیرانه که بالاتر گفتم
۲- پرامپت ساده که فقط یک
۳-پرامپت سختگیرانه + استفاده از محیط چت و کپی پیست کد بعد از توضیح اینکه مطلب ارسالی کد پایتون هست.
و بهترین جواب رو حالت سوم داد؛ اگر به اندازه کافی کانال رو دنبال کرده باشید میدونید که من اصلا به هیچ ابزار و
با دیدن این نتابج الان میفهمم چرا برای خیلی از شما سوال میشه که من چطوری از
استفاده میکنم و انقدر از خروجیهاش راضی هستم.
بنظرم شما هم این رو تست کنید- من فقط روی ۴ مدلی که اسم بردم تست کردم.
الان متوجه شدم چرا خیلی از بچهها میگن که فقط با
Claude میتونند کد بزنند؛ من یک باگ جدید پیدا کردم.Qwen, Grok, ChatGpt, GLM5.2 رو تست کردم؛ این مدلهای پارسر ضعیفتری دارند.
اول اینکه بنظر میاد همشون کد رو هم مثل
markdown باهاش برخورد میکنند و پارس میکنند چرا ؟حجم زیادی کد بهشون دادم با پرامپت سختگیرانه (خیلی بیادبی هست وگرنه میذاشتم) و همشون چون رو حالت سخت گیری هست ارورهای پارسر رو نادیده نمیگیرند.
این نادیده گرفتن یک تکنیکی هست که ما هم توی پروداکشن استفاده میکنیم؛ اینطوری هست که اگر ببینید طرف راجب چیزی صحبت میکنه که به اندازه کافی علم داره ازش به مدل میگیم بعضی خطاها ممکنه اشتباه پارسر یا سرویس
OCR باشه و نادیدهاش بگیر.ولی اینجا مدلهای بالا با پرامپتی که من دادم دیگه اینطوری نشد و کلی ایراد الکی گرفتند.
بعنوان مثال :
Bug 1: __main__.py entrypoint is broken
You have:
if name == "main":
main()
That is wrong.
It must be:
if __name__ == "__main__":
main()
بدتر از اون اینکه بعضی مدلها حتی اینطوری میبیننش :
if name
من تمام مدلهایی که اسم بردم رو توی ۳ حالت استفاده کردم :
۱- با پرامپت سختگیرانه که بالاتر گفتم
۲- پرامپت ساده که فقط یک
role بهش دادم (این مشکلات وجود نداشت)۳-پرامپت سختگیرانه + استفاده از محیط چت و کپی پیست کد بعد از توضیح اینکه مطلب ارسالی کد پایتون هست.
و بهترین جواب رو حالت سوم داد؛ اگر به اندازه کافی کانال رو دنبال کرده باشید میدونید که من اصلا به هیچ ابزار و
agent ایی که دسترسی به سیستمم داشته باشه اعتماد ندارم و همیشه از محیطهای چت مرورگر استفاده میکنم و کدهام رو اونجا بهشون میدم.با دیدن این نتابج الان میفهمم چرا برای خیلی از شما سوال میشه که من چطوری از
Qwen, Duck.ai , ... استفاده میکنم و انقدر از خروجیهاش راضی هستم.
بنظرم شما هم این رو تست کنید- من فقط روی ۴ مدلی که اسم بردم تست کردم.
👍13❤10
Forwarded from RandRng
چون به این علاقه داشتید و
گفتم براتون یک آموزش دیگه هم بذارم؛
این یکی برای اونهایی که به deep learning علاقهدارند تازه شروع کردند یا میخوان شروع کنند و مباحث زیاد هست و پیشنیازها بیشتر.
من این کانال رو چندسالی هست که خودم دنبال میکنم؛ همینجا بگم که بهترین لهجه انگلیسی توی این کانال نیست اما یک نگاهی به ویدئوهای اخیرشون برای دوره
Intro to deep learning Fall 2026
بندازیم (تایتلها)
0.1 Python Fundamentals
0.2 OOP
0.3 Numpy
0.4 Pytorch
0.5 Notebooks and conda
0.6 Tensordot & Einsum
0.7 Differentiation/Calculus Part 1
0.7 Differentiation/Calculus Part 2
0.8 Git and Github
0.9 Google colab
0.10 Google cloud
0.11 Kaggle
...
0.14 Linux
0.15 Datasets
0.16 DataLoaders
0.17 Data Preprocessing
0.18 Wandb
0.19 Debugging your model
0.21 Losses
0.22 Block processing
0.23 Pipelines
0.24 Distributed training
0.25 Saving and loading model
همونطوری که میبینید از صفر میتونید شروع کنید؛ میخواید خیلی قوی بشید ؟
تمرینهای دورهای قبلی رو حل کنید (خودشون هم حلش رو گذاشتن)
موضوعی هم میتونید توی کانال سرچ کنید و مباحث رو پیدا کنید
من هیچ دورهای رو ندیدم انقدر سرفصلهای کاملی داشته باشه؛ فقط یک دوره رو ببیند و تمرینات دورههای قبلی رو حل کنید
بعدش شروع کنید پروژه زدن؛ کل این دورهها هم رایگان هست.
وقتی پیش نیازها تموم بشه همهی ویدئوهایی که با 0. شروع میشه؛ اونوقت اصل آموزش دانشگاهی شروع میشه و هیچکس توی این آموزش سردرگم نیست که چی باید یاد بگیره یا پیش نیازی بوده که بلد نیست و ...
۱۰۰٪ پیشنهاد میکنم؛ من اولین بار ۷ سال پیش ویدئوهای این دانشگاه رو دیدم و الان ۱۰۰ بار از اون موقع بهتر هست.
share کردید (بیش از ۴۰۰ بار)گفتم براتون یک آموزش دیگه هم بذارم؛
این یکی برای اونهایی که به deep learning علاقهدارند تازه شروع کردند یا میخوان شروع کنند و مباحث زیاد هست و پیشنیازها بیشتر.
Carnegie Mellon University Deep Learningمن این کانال رو چندسالی هست که خودم دنبال میکنم؛ همینجا بگم که بهترین لهجه انگلیسی توی این کانال نیست اما یک نگاهی به ویدئوهای اخیرشون برای دوره
Intro to deep learning Fall 2026
بندازیم (تایتلها)
0.1 Python Fundamentals
0.2 OOP
0.3 Numpy
0.4 Pytorch
0.5 Notebooks and conda
0.6 Tensordot & Einsum
0.7 Differentiation/Calculus Part 1
0.7 Differentiation/Calculus Part 2
0.8 Git and Github
0.9 Google colab
0.10 Google cloud
0.11 Kaggle
...
0.14 Linux
0.15 Datasets
0.16 DataLoaders
0.17 Data Preprocessing
0.18 Wandb
0.19 Debugging your model
0.21 Losses
0.22 Block processing
0.23 Pipelines
0.24 Distributed training
0.25 Saving and loading model
همونطوری که میبینید از صفر میتونید شروع کنید؛ میخواید خیلی قوی بشید ؟
تمرینهای دورهای قبلی رو حل کنید (خودشون هم حلش رو گذاشتن)
موضوعی هم میتونید توی کانال سرچ کنید و مباحث رو پیدا کنید
من هیچ دورهای رو ندیدم انقدر سرفصلهای کاملی داشته باشه؛ فقط یک دوره رو ببیند و تمرینات دورههای قبلی رو حل کنید
بعدش شروع کنید پروژه زدن؛ کل این دورهها هم رایگان هست.
وقتی پیش نیازها تموم بشه همهی ویدئوهایی که با 0. شروع میشه؛ اونوقت اصل آموزش دانشگاهی شروع میشه و هیچکس توی این آموزش سردرگم نیست که چی باید یاد بگیره یا پیش نیازی بوده که بلد نیست و ...
۱۰۰٪ پیشنهاد میکنم؛ من اولین بار ۷ سال پیش ویدئوهای این دانشگاه رو دیدم و الان ۱۰۰ بار از اون موقع بهتر هست.
❤33👍3
Forwarded from RandRng
تقریبا میتونم بگم تمام بنچمارکهای معروف هوش مصنوعی از رده خارج شده حساب میشه مثلا توی یکی از موارد
رسما (توییتر) قبول کرد که بنچمارکهاش قدیمی شده و اکثر مواردی که داره مربوط به چالش بسیار قدیمی
هست یا مواردی توی بنچمارکهای
و پیشرفتهای اخیر مدلها رو ببینید؛ اکثرا دارند توی
توی همون تسک خوندن لاگ و پیدا کردن مشکل مجبور شدم یک سری کد بزنم که کارم رو سریعتر کنم
https://xn--r1a.website/per3onnel/629
شاید باورتون نشه ولی
بهترین نتایج رو بهم میداد
من همیشه مدلها رو با کدهای خودم تست میکنم الان چندسال هست و بنظرم توی زمان حال شما هم باید همین کار رو انجام بدید؛ خیلی از مدلهایی که از نظر بنچمارکها
چطوری بنچمارک خودتون رو بسازید (من اینطوری ساختم) :
یک کد یا تسک یا کانفیگ دارم که مشکل داره و درست کار نمیکنه به مدلهای هوش مصنوعی موجود میدم و جوابها رو بررسی میکنم ولی هیچکدوم جواب درست رو نمیده
این رو ذخیره میکنم کد/کانفیگ اشتباه رو + پرامپت رو بعنوان ورودی برای تست ذخیره میکنم.
وقتی بعد از چندساعت به راه حل رسیدم اون راه حل رو هم ذخیره میکنم (خلاصه شده و تمیز شده فقط راه حل رو بدون توضیحات)
چندماه بعد که مدل جدیدی معرفی میشه همین کار رو تکرار میکنم؛ امتیاز مدل رو مینویسم :
مثلا از ۳۰ تا سوال چندتارو درست جواب داده - جندتا رو جوابی که داده راهنمای خوبی برای رسیدن به راه حل و درک مشکل هست ولی جواب نهاییش درست نیست - چندتارو کاملا گمراه کننده جواب داده
و اینکه برای هیچ مدلی پرامپت ورودی رو تغییر نمیدم؛ این استاندارد پرامپت نویسی منه شاید مدل خیلی خفن باشه ولی اگر پرامپت ذخیره شده من نتونه ازش جواب بگیره احتمال اینکه موقع استفاده من بتونم از اون مدل جواب بگیرم هم خیلی پایین هست (چون من به این تکنیک پرامپت نوشتن عادت کردم)
اینکار رو بنظرم هرکسی که بیش از روزانه ۱ ساعت از
من یوتیوبری رو نمیشناسم که مثلا بیاد پیادهسازی یک سرویس بکند (جدید نه چیزی که هزاران کد براش توی گیتهاب هست) یا پیاده سازی
برای خودم واقعا شکه کننده بود که
تمام کدهایی که ازش میخواستم روی توی همون بار اول درست تحویل میداد (البته من خیلی میشکوندم تسک رو و با جزئیات بهش میگفتم چطوری باید باشه) ولی این مدل حتی توی ۳۰ مدل اول
تنها مشکلی که من دیدم:
توی پروژه بزرگتر حتما باید خودتون بعدش
Artificial Analysisرسما (توییتر) قبول کرد که بنچمارکهاش قدیمی شده و اکثر مواردی که داره مربوط به چالش بسیار قدیمی
needle in haystackهست یا مواردی توی بنچمارکهای
software engineering هم من گزارشاتی خوندم که بیشتر تسکهاشون برای Frontend, 3Dو پیشرفتهای اخیر مدلها رو ببینید؛ اکثرا دارند توی
Game development, Frontend و ... تست میشوند روی یوتیوب و همهی اونهایی که توی این تسکها نتایج خوبی داشتند توی بنچمارکهای معروف هم بسیار خوب عمل میکنند.توی همون تسک خوندن لاگ و پیدا کردن مشکل مجبور شدم یک سری کد بزنم که کارم رو سریعتر کنم
https://xn--r1a.website/per3onnel/629
شاید باورتون نشه ولی
gemini 3.6 Flash (Fast) بهترین نتایج رو بهم میداد
من همیشه مدلها رو با کدهای خودم تست میکنم الان چندسال هست و بنظرم توی زمان حال شما هم باید همین کار رو انجام بدید؛ خیلی از مدلهایی که از نظر بنچمارکها
rank بالا میگیرند ممکنه برای کار شما اصلا مناسب نباشه و برعکس این موضوع هم هست.چطوری بنچمارک خودتون رو بسازید (من اینطوری ساختم) :
یک کد یا تسک یا کانفیگ دارم که مشکل داره و درست کار نمیکنه به مدلهای هوش مصنوعی موجود میدم و جوابها رو بررسی میکنم ولی هیچکدوم جواب درست رو نمیده
این رو ذخیره میکنم کد/کانفیگ اشتباه رو + پرامپت رو بعنوان ورودی برای تست ذخیره میکنم.
وقتی بعد از چندساعت به راه حل رسیدم اون راه حل رو هم ذخیره میکنم (خلاصه شده و تمیز شده فقط راه حل رو بدون توضیحات)
چندماه بعد که مدل جدیدی معرفی میشه همین کار رو تکرار میکنم؛ امتیاز مدل رو مینویسم :
مثلا از ۳۰ تا سوال چندتارو درست جواب داده - جندتا رو جوابی که داده راهنمای خوبی برای رسیدن به راه حل و درک مشکل هست ولی جواب نهاییش درست نیست - چندتارو کاملا گمراه کننده جواب داده
و اینکه برای هیچ مدلی پرامپت ورودی رو تغییر نمیدم؛ این استاندارد پرامپت نویسی منه شاید مدل خیلی خفن باشه ولی اگر پرامپت ذخیره شده من نتونه ازش جواب بگیره احتمال اینکه موقع استفاده من بتونم از اون مدل جواب بگیرم هم خیلی پایین هست (چون من به این تکنیک پرامپت نوشتن عادت کردم)
اینکار رو بنظرم هرکسی که بیش از روزانه ۱ ساعت از
LLM برای کد نویسی یا حل مشکلات فنی استفاده میکنه باید انجام بده؛ بخصوص اینکه ۹۰٪ یوتیوبرها برای بنچمارک دارند از تسکهای دارای گرافیک استفاده میکنند چون بازدید اینها بیشتر هست.من یوتیوبری رو نمیشناسم که مثلا بیاد پیادهسازی یک سرویس بکند (جدید نه چیزی که هزاران کد براش توی گیتهاب هست) یا پیاده سازی
driver یا embed system رو تست کنه چون این موارد بازدید نداره ولی احتمالا شغل اکثر شمایی که عضو این کانال هستید به این موارد بستگی داره.برای خودم واقعا شکه کننده بود که
gemini 3.6 flash (fast) تمام کدهایی که ازش میخواستم روی توی همون بار اول درست تحویل میداد (البته من خیلی میشکوندم تسک رو و با جزئیات بهش میگفتم چطوری باید باشه) ولی این مدل حتی توی ۳۰ مدل اول
DeepSWE هم نیست و انقدر هم سریع خروجی بهتون میده که سرعت برنامهنویسی شما رو اصلا کم نمیکنه.تنها مشکلی که من دیدم:
توی پروژه بزرگتر حتما باید خودتون بعدش
refactor کنید.Telegram
RandRng
بیش از ۱ سال پیش با یک شرکتی یک قرارداد همکاری موقت نوشتیم (بعدش به همکاری طولانی نرسید هرچند من خیلی دوس داشتم که برسه) توی همون مدت من بسیاری از pipeline داده و دپلوی و سرورها رو طبق تغییراتی که روی کدها همراه با تیم اعمال کردیم تغییر دادم؛ چون نیروی DevOps…
👍13❤4
Forwarded from RandRng
دلیل اینکه راجب حل مسئلهی
چرا ؟
اونایی که از قبل من رو میشناسند میدونند من علاقهای هم به فیزیک دارم (شاید متوجهش نشم ولی بهش علاقه دارم و دنبال میکنم)
مسائل زیادی اونجا بهینهسازی یا حل شده توی ۱ سال اخیر و با کمک AI اما توی تمام موارد نقش AI استفاده از ترکیبهای متفاوت فرمولها بوده و یک فیزیکدان پشت داستان بوده.
دلیل اصلی که هیچکدوم از شرکتهای AI هم روش مانور نمیدن همین هست که چیزی برای اونها نداره.
تکنیکی که استفاده میشه هم مثل روشی هست که باعث کشف
Urbain Le Verrier, who calculated the predicted position of Neptune.
داستان پشت
با توجه به چیزهایی که من توی ۱ سال گذشته توی کامیونیتی فیزیک دیدم؛ کاملا حرف ریاضیدانها رو قبول میکنم.
More on Youtube
Navier-Stokes چیزی ننوشتم این بود که گفتههای OpenAI رو باور نداشتم.چرا ؟
اونایی که از قبل من رو میشناسند میدونند من علاقهای هم به فیزیک دارم (شاید متوجهش نشم ولی بهش علاقه دارم و دنبال میکنم)
مسائل زیادی اونجا بهینهسازی یا حل شده توی ۱ سال اخیر و با کمک AI اما توی تمام موارد نقش AI استفاده از ترکیبهای متفاوت فرمولها بوده و یک فیزیکدان پشت داستان بوده.
دلیل اصلی که هیچکدوم از شرکتهای AI هم روش مانور نمیدن همین هست که چیزی برای اونها نداره.
تکنیکی که استفاده میشه هم مثل روشی هست که باعث کشف
Neptune شدUrbain Le Verrier, who calculated the predicted position of Neptune.
داستان پشت
Open AI هم بنظر میاد همین باشه؛ agentها از دیتای دو نفر ریاضیدان استفاده کردند که دقیقا داشتند روی این مسئله کار میکردند و بسیار هم پیشرفت داشتند.با توجه به چیزهایی که من توی ۱ سال گذشته توی کامیونیتی فیزیک دیدم؛ کاملا حرف ریاضیدانها رو قبول میکنم.
More on Youtube
NASA
175 Years Ago: Astronomers Discover Neptune, the Eighth Planet - NASA
On the night of Sept. 23-24, 1846, astronomers discovered Neptune, the eighth planet orbiting around the Sun. The discovery was made based on mathematical
❤11👍4
RandRng
Urbain Le Verrier, who calculated the predicted position of Neptune.
این داستان رو قدیما سر آموزشهای مربوط به دیتاساینس تعریف میکردم.
اهمیت
train/test split
یادش بخیر
اهمیت
train/test split
یادش بخیر
❤12
گوگل مغز یک حشره رو مپ کرده و بصورت open source هم منتشرش کرده تا اینجا یک کار تحقیقاتی هست.
بعد یک سری آدم اومدند؛ این حشره رو توی کارهای مختلف شبیهسازی کردند
حشره توی بازیهای مختلف
حشره توی دنیای کریپتو
حشره توی معاملات بورسی
و ...
بعضیهاش واقعا نتایج جالبی داره و ایدههای خندهدار هم توش بسیار بسیار زیاده.
Google Research
Github
پینوشت:
قدرتش توی بعضی کارها از
حالا که به این موضوع علاقهمند شدید باید بگم که؛ جاندارانی با مغز بزرگتر هم توی صف هستند برای این تحقیقات.
بعد یک سری آدم اومدند؛ این حشره رو توی کارهای مختلف شبیهسازی کردند
حشره توی بازیهای مختلف
حشره توی دنیای کریپتو
حشره توی معاملات بورسی
و ...
بعضیهاش واقعا نتایج جالبی داره و ایدههای خندهدار هم توش بسیار بسیار زیاده.
Google Research
Github
پینوشت:
قدرتش توی بعضی کارها از
LLMها بیشتره 😂😂حالا که به این موضوع علاقهمند شدید باید بگم که؛ جاندارانی با مغز بزرگتر هم توی صف هستند برای این تحقیقات.
Google Research
A connectomics milestone: Mapping the complete male fruit fly brain
We partnered with HHMI Janelia and collaborators to publish a complete map of the male fruit fly’s brain and central nervous system, creating the largest brain map to date. Together with ongoing research on other species, such as fish and mice, these wiring…
❤32👍8
.
روی این یکی میتونید به خودم رفرنس بدید.
what is Jev ?Bullshit
simple classifier + Pydantic that people used to practice when they start learning AI. But now that nobody use their brain anymore, people think it's a breakthrough in AI and computer science.
روی این یکی میتونید به خودم رفرنس بدید.
👍18