اگر کسی وب و کلاینت کار میکنه، این دوره را نیز به مدت محدود میتوانید رایگان ببینید:
مینی دوره ساخت هوش مصنوعی شخصی در مرورگر
مینی دوره ساخت هوش مصنوعی شخصی در مرورگر
COUPON-B7F7Cمکتبخونه
مینی دوره ساخت هوش مصنوعی شخصی در مرورگر با Web AI
با «مینی دوره ساخت هوش مصنوعی شخصی در مرورگر» مکتبخونه، اجرای Local LLM/VLM، پرامپتنویسی و ساخت یک AI خصوصی بدون سرور را قدمبهقدم یاد بگیرید.
❤7
ممنون میشم دوستانی که دوره های بنده، خصوصا دوره جدید Agentic AI با پایتون رو تهیه کردن، چند دقیقه وقت ارزشمندشان را بذارن و رای و نظرشون رو در مکتبخونه ثبت کنن. 🙏
بازخوردهای شما هم برای من بسیار ارزشمنده و هم کمک میکنه افرادی که قصد تهیه دوره رو دارن، با اطمینان بیشتری تصمیم بگیرن. ❤️
بازخوردهای شما هم برای من بسیار ارزشمنده و هم کمک میکنه افرادی که قصد تهیه دوره رو دارن، با اطمینان بیشتری تصمیم بگیرن. ❤️
❤28👌7
یادداشت شماره ۱:
درباره «مدلهای جهانی به عنوان بنیانهای شناختی برای AGI»
من یک مجموعه جدید درباره #WorldModels به عنوان زیربنای هوش_مصنوعی_عمومی (#AGI) شروع میکنم.
هوش مصنوعی فراتر از یادگیری ماشین سنتی و حتی #مدلهای_زبانی_بزرگ (#LLMs) امروزی به سرعت در حال تکامل است. یکی از هیجانانگیزترین پرسشها این است:
چگونه سیستمهای هوش_مصنوعی میتوانند یک درک درونی از جهان بسازند، درباره موقعیتهای جدید استدلال کنند، و پیش از اقدام، تصمیمهای بهتری بگیرند؟
WorldModels به عنوان گامی امیدوارکننده به سوی پاسخ به این پرسش ظهور کردهاند.
در این مجموعه، هم مبانی و هم پیشرفتهای اخیر در #WorldModels از #یادگیری_بازنمایی، #JEPA، و بازنماییهای نهان جهانی تا #MultimodalAI #Reasoning, #Planning, #Memory, #ReinforcementLearning #AutonomousAgents را بررسی خواهم کرد.
همچنین درباره تأثیر این ایدهها بر آینده #مدلهای_بنیادی، #رباتیک، #هوش_مصنوعی_در_سلامت، #هوش_مصنوعی_علمی و دیگر کاربردهای دنیای واقعی بحث خواهم کرد.
هدف من این است که این مفاهیم را با پیوند دادن نظریه زیربنایی با پژوهشهای روز، چالشهای مهندسی و پیادهسازیهای واقعی، عملی و قابل درک کنم. چه محقق باشید، چه #دانشمند_داده، چه #مهندس_یادگیری_ماشین، چه #مهندس_هوش_مصنوعی، یا صرفاً به آینده هوش مصنوعی علاقهمند باشید، امیدوارم این مجموعه برایتان باشد. مشتاقم تا در این مسیر با هم یاد بگیریم و نظراتتان را بشنوم.
مرجع تصویر: Y. LeCun, A Path Towards Autonomous Machine Intelligence (2022)
درباره «مدلهای جهانی به عنوان بنیانهای شناختی برای AGI»
من یک مجموعه جدید درباره #WorldModels به عنوان زیربنای هوش_مصنوعی_عمومی (#AGI) شروع میکنم.
هوش مصنوعی فراتر از یادگیری ماشین سنتی و حتی #مدلهای_زبانی_بزرگ (#LLMs) امروزی به سرعت در حال تکامل است. یکی از هیجانانگیزترین پرسشها این است:
چگونه سیستمهای هوش_مصنوعی میتوانند یک درک درونی از جهان بسازند، درباره موقعیتهای جدید استدلال کنند، و پیش از اقدام، تصمیمهای بهتری بگیرند؟
WorldModels به عنوان گامی امیدوارکننده به سوی پاسخ به این پرسش ظهور کردهاند.
در این مجموعه، هم مبانی و هم پیشرفتهای اخیر در #WorldModels از #یادگیری_بازنمایی، #JEPA، و بازنماییهای نهان جهانی تا #MultimodalAI #Reasoning, #Planning, #Memory, #ReinforcementLearning #AutonomousAgents را بررسی خواهم کرد.
همچنین درباره تأثیر این ایدهها بر آینده #مدلهای_بنیادی، #رباتیک، #هوش_مصنوعی_در_سلامت، #هوش_مصنوعی_علمی و دیگر کاربردهای دنیای واقعی بحث خواهم کرد.
هدف من این است که این مفاهیم را با پیوند دادن نظریه زیربنایی با پژوهشهای روز، چالشهای مهندسی و پیادهسازیهای واقعی، عملی و قابل درک کنم. چه محقق باشید، چه #دانشمند_داده، چه #مهندس_یادگیری_ماشین، چه #مهندس_هوش_مصنوعی، یا صرفاً به آینده هوش مصنوعی علاقهمند باشید، امیدوارم این مجموعه برایتان باشد. مشتاقم تا در این مسیر با هم یاد بگیریم و نظراتتان را بشنوم.
مرجع تصویر: Y. LeCun, A Path Towards Autonomous Machine Intelligence (2022)
LinkedIn
LinkedIn Login, Sign in | LinkedIn
Login to LinkedIn to keep in touch with people you know, share ideas, and build your career.
👍6❤3👌2
هز چه قدر پول بدی آش میخوری :)
چند روز داشتم یه پروژهی RAG با Neo4j و LangChain کار میکردم. یه جای کار retriever همیشه نتیجهی خالی برمیگردوند — امبدینگها سالم، ایندکس سالم، ولی هرچی میگشتم هیچی پیدا نمیشد.
توی یه دیسکاشن طولانی با Sonnet، کلی فرضیه و راهحل امتحان کردیم: نسخهی پکیج، نوع مدل امبدینگ، search_type، حتی رفتیم سراغ ساخت retriever سفارشی و full-text index دستی — هرکدوم یه گوشه از مشکل رو حل میکرد ولی ریشهی اصلی پیدا نمیشد.
راستش از اول تعمداً سراغ Fable نرفته بودم، چون نمیخواستم هزینهی توکنم بالا بره. ولی بعد از حدود دو ساعت کلنجار رفتن، خسته شدم و گفتم یه امتحانی بکنم.
بردمش رو Fable، و تقریباً بلافاصله رسید به یه نکتهی ساده که تا اون لحظه هیچکس (نه من، نه Sonnet) بهش دقت نکرده بود: توی ساخت
البته Fable واقعا گرونه، و به درد همین مواقع که آدم گیر میکنه میخوره...
چند روز داشتم یه پروژهی RAG با Neo4j و LangChain کار میکردم. یه جای کار retriever همیشه نتیجهی خالی برمیگردوند — امبدینگها سالم، ایندکس سالم، ولی هرچی میگشتم هیچی پیدا نمیشد.
توی یه دیسکاشن طولانی با Sonnet، کلی فرضیه و راهحل امتحان کردیم: نسخهی پکیج، نوع مدل امبدینگ، search_type، حتی رفتیم سراغ ساخت retriever سفارشی و full-text index دستی — هرکدوم یه گوشه از مشکل رو حل میکرد ولی ریشهی اصلی پیدا نمیشد.
راستش از اول تعمداً سراغ Fable نرفته بودم، چون نمیخواستم هزینهی توکنم بالا بره. ولی بعد از حدود دو ساعت کلنجار رفتن، خسته شدم و گفتم یه امتحانی بکنم.
بردمش رو Fable، و تقریباً بلافاصله رسید به یه نکتهی ساده که تا اون لحظه هیچکس (نه من، نه Sonnet) بهش دقت نکرده بود: توی ساخت
Neo4jVector`، پارامتر `database رو ست نکرده بودم! یعنی داشت به دیتابیس پیشفرض Neo4j وصل میشد، نه به دیتابیسی که واقعاً داده توش بود. همهی اون رفتارهای عجیب (نتیجهی خالی، جوابهای نامرتبط) از همین یه پارامتر جامونده بود.البته Fable واقعا گرونه، و به درد همین مواقع که آدم گیر میکنه میخوره...
❤32👍10⚡4🤔3👀1
install-watch.md
18.5 KB
👁 درک عمیق و هوشمند ویدیوها با اسکیل
با اضافه کردن این اسکیل قدرتمند، Agentهای هوش مصنوعی شما (مثل Claude Code و Codex) قابلیت تماشا و تحلیل جامع ویدیوها رو پیدا میکنن!
ویژگیهای کلیدی:
🎞 آنالیز فریمبهفریم: درک دقیق و بصری از اتفاقات داخل تصویر.
🗣 تشخیص هوشمند گفتار: فهم کامل دیالوگها و صدای روی ویدیو.
⚡️ راهاندازی تمامخودکار: بدون درگیری با مراحل نصب؛ فقط فایل رو به Agent خودتون بدید تا خودش پیشنیازها رو بررسی کنه و تمام ابزارهای لازم رو نصب و اجرا کنه.
/watchبا اضافه کردن این اسکیل قدرتمند، Agentهای هوش مصنوعی شما (مثل Claude Code و Codex) قابلیت تماشا و تحلیل جامع ویدیوها رو پیدا میکنن!
ویژگیهای کلیدی:
🎞 آنالیز فریمبهفریم: درک دقیق و بصری از اتفاقات داخل تصویر.
🗣 تشخیص هوشمند گفتار: فهم کامل دیالوگها و صدای روی ویدیو.
⚡️ راهاندازی تمامخودکار: بدون درگیری با مراحل نصب؛ فقط فایل رو به Agent خودتون بدید تا خودش پیشنیازها رو بررسی کنه و تمام ابزارهای لازم رو نصب و اجرا کنه.
❤15
🚀 معرفی مدل ویدیوساز قدرتمند و جدید MiniMax H3
مدل هوش مصنوعی MiniMax H3 (که به عنوان Hailuo 3.0 هم شناخته میشود) به تازگی به صورت Open-Weights منتشر شده و امکانات بینظیری را برای تولید محتوای ویدیویی در اختیار کاربران قرار داده است. این مدل توانایی رقابت با بهترین مدلهای بسته بازار را دارد و حتی روی سیستمهای لوکال (مثل ComfyUI) هم قابل اجراست.
*خبرخوب : به زودی براتون بصورت اختصاصی ورک فلو ها و مدل های خوبش رو قرار میدهیم*
مدل هوش مصنوعی MiniMax H3 (که به عنوان Hailuo 3.0 هم شناخته میشود) به تازگی به صورت Open-Weights منتشر شده و امکانات بینظیری را برای تولید محتوای ویدیویی در اختیار کاربران قرار داده است. این مدل توانایی رقابت با بهترین مدلهای بسته بازار را دارد و حتی روی سیستمهای لوکال (مثل ComfyUI) هم قابل اجراست.
*خبرخوب : به زودی براتون بصورت اختصاصی ورک فلو ها و مدل های خوبش رو قرار میدهیم*
❤16👌2👍1
🎙 ـTypeless؛ ابزاری که تایپ کردن رو خیلی کمتر میکنه
ـTypeless یک ابزار مبتنی بر هوش مصنوعیه که صحبت شما رو به متن تبدیل میکنه، اما نه به شکل سادهی Voice to Text.
هنگام صحبت، تپقها، تکرارها و اصلاحاتی که وسط جمله انجام میدید رو تشخیص میده و در نهایت یک متن مرتب و قابل استفاده تحویل میده.
مثلاً اگر بگید:
«جلسه رو بذاریم فردا... نه، بهتره پسفردا ساعت ۱۰ باشه»
خروجی نهایی میتونه این باشه:
«جلسه را برای پسفردا ساعت ۱۰ تنظیم کنیم.»
یکی از قابلیتهای جالبش اینه که میتونه متن رو متناسب با فضای کاری شما تنظیم کنه؛ مثلاً برای ایمیل، پیام یا متنهای روزمره.
همچنین از بیش از ۱۰۰ زبان پشتیبانی میکنه و نسخههای Windows، macOS، iOS و Android هم داره.
اگر زیاد با ایمیل، پیام، تولید محتوا یا نوشتن متنهای کاری سروکار دارید، Typeless میتونه ابزار جالبی برای امتحان کردن باشه.
🔗 typeless.com
🌀 @cvision 🌀
ـTypeless یک ابزار مبتنی بر هوش مصنوعیه که صحبت شما رو به متن تبدیل میکنه، اما نه به شکل سادهی Voice to Text.
هنگام صحبت، تپقها، تکرارها و اصلاحاتی که وسط جمله انجام میدید رو تشخیص میده و در نهایت یک متن مرتب و قابل استفاده تحویل میده.
مثلاً اگر بگید:
«جلسه رو بذاریم فردا... نه، بهتره پسفردا ساعت ۱۰ باشه»
خروجی نهایی میتونه این باشه:
«جلسه را برای پسفردا ساعت ۱۰ تنظیم کنیم.»
یکی از قابلیتهای جالبش اینه که میتونه متن رو متناسب با فضای کاری شما تنظیم کنه؛ مثلاً برای ایمیل، پیام یا متنهای روزمره.
همچنین از بیش از ۱۰۰ زبان پشتیبانی میکنه و نسخههای Windows، macOS، iOS و Android هم داره.
اگر زیاد با ایمیل، پیام، تولید محتوا یا نوشتن متنهای کاری سروکار دارید، Typeless میتونه ابزار جالبی برای امتحان کردن باشه.
🔗 typeless.com
🌀 @cvision 🌀
🔥18❤3
Forwarded from 🚀 کلاسویژن | یادگیری هوش مصنوعی از پایه تا پیشرفته
یک خبر خوب برای اونایی که مدتهاست میخوان یه مهارت جدید یاد بگیرن 👇
با همکاری مکتبخونه، ۵۰۰ دوره آموزشی بهصورت رایگان در طرح «ایرانماهر» در دسترس قرار گرفته. 🎓
چند تا از دورههای #کلاس_ویژن هم در این طرح قرار دادیم تا اگر تا امروز فرصت یا امکان تهیهشون رو نداشتید، بتونید با یکی از اونها شروع کنید. 🌱
🔹 آموزش جامع یادگیری عمیق
🔹 ساخت هوش مصنوعی شخصی در مرورگر
🔹 آموزش مدلهای زبانی-تصویری
🔹 آموزش پردازش تصویر
برای استفاده از این طرح، کافیه موقع ثبتنام کد
اگر مدتهاست دنبال یه فرصت برای یادگیری و شروع یک مهارت جدید هستید، این فرصت میتونه شروع خوبی باشه. ❤️
https://mktb.me/szs2/
با همکاری مکتبخونه، ۵۰۰ دوره آموزشی بهصورت رایگان در طرح «ایرانماهر» در دسترس قرار گرفته. 🎓
چند تا از دورههای #کلاس_ویژن هم در این طرح قرار دادیم تا اگر تا امروز فرصت یا امکان تهیهشون رو نداشتید، بتونید با یکی از اونها شروع کنید. 🌱
🔹 آموزش جامع یادگیری عمیق
🔹 ساخت هوش مصنوعی شخصی در مرورگر
🔹 آموزش مدلهای زبانی-تصویری
🔹 آموزش پردازش تصویر
برای استفاده از این طرح، کافیه موقع ثبتنام کد
IRANMAHER رو وارد کنید.اگر مدتهاست دنبال یه فرصت برای یادگیری و شروع یک مهارت جدید هستید، این فرصت میتونه شروع خوبی باشه. ❤️
https://mktb.me/szs2/
❤23❤🔥2👏1
گوگل یک قدم جدیتر وارد رقابت تبدیل صدا به متن شد 🎙🧠
گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفتهی گوگل، دقیقترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمهبهکلمهی صدا نیست؛ مدل تلاش میکند خروجی را به شکل تمیز، ساختاریافته و قابل استفاده تحویل دهد.
🌀 @cvision 🌀
گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفتهی گوگل، دقیقترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمهبهکلمهی صدا نیست؛ مدل تلاش میکند خروجی را به شکل تمیز، ساختاریافته و قابل استفاده تحویل دهد.
🌀 @cvision 🌀
❤10🔥4👍1
Tensorflow(@CVision)
گوگل یک قدم جدیتر وارد رقابت تبدیل صدا به متن شد 🎙🧠 گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفتهی گوگل، دقیقترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمهبهکلمهی…
مدل جدید در مکالمههای واقعی میتواند مکثها و کلمات اضافه مثل «اِمم» را حذف کند، اصلاح جمله توسط گوینده را متوجه شود و متن را بهصورت خودکار فرمت کند. همچنین امکان تعریف Custom Vocabulary برای اصطلاحات تخصصی و نامهای خاص هم وجود دارد؛ قابلیتی که برای کاربردهای سازمانی و فنی اهمیت زیادی دارد. 📝⚡️
یکی از جذابترین بخشها، پشتیبانی از بیش از ۸۵ زبان، تشخیص لهجهها و جابهجایی بین زبانهاست. برای فایلهای ضبطشده هم قابلیت تشخیص گوینده و Word-level Timestamp در نظر گرفته شده و مدل میتواند تا سه گوینده را تفکیک کند؛ پشتیبانی از تعداد بیشتر فعلاً آزمایشی است. 🌍🎧
برای کاربردهای Real-time هم گوگل نسخهی جداگانهی
از نظر بنچمارک هم اعداد جالباند؛ طبق دادهای که گوگل با استناد به Artificial Analysis منتشر کرده، میانگین WER حدود ۴٪ در حالت Streaming و ۲.۶٪ در حالت Non-streaming گزارش شده و زمان رسیدن به متن نهایی نسبت به Chirp 3 حدود ۷۰٪ بهبود داشته است. 📊
نکتهی مهمتر این است که گوگل Transcribe را صرفاً به چشم یک موتور STT نمیبیند. این مدل در بعضی تجربههای Gemini میتواند با Context صفحه و مدلهای دیگر ترکیب شود؛ یعنی فرمان صوتی در آینده فقط برای «تایپ با صدا» نیست و میتواند بخشی از رابط اصلی تعامل با AI Agentها باشد. 🤖🎤
فعلاً دسترسی توسعهدهندگان به Gemini 3.5 Transcribe از طریق Gemini API و Google AI Studio بهصورت Public Preview فراهم شده؛ این فناوری در Gemini روی macOS و قابلیت Rambler اندروید هم استفاده میشود و گوگل گفته پشتیبانی آن در Chrome نیز در راه است. 🧪🌐
بهنظر میرسد رقابت مدلهای صوتی حالا از «چه کسی دقیقتر صدا را متن میکند؟» عبور کرده و به سؤال بزرگتری رسیده: چه کسی بهتر میتواند منظور کاربر را از صدا بفهمد و آن را مستقیماً به عمل تبدیل کند؟ 👀
🌀 @cvision 🌀
یکی از جذابترین بخشها، پشتیبانی از بیش از ۸۵ زبان، تشخیص لهجهها و جابهجایی بین زبانهاست. برای فایلهای ضبطشده هم قابلیت تشخیص گوینده و Word-level Timestamp در نظر گرفته شده و مدل میتواند تا سه گوینده را تفکیک کند؛ پشتیبانی از تعداد بیشتر فعلاً آزمایشی است. 🌍🎧
برای کاربردهای Real-time هم گوگل نسخهی جداگانهی
gemini-3.5-transcribe-live را از طریق Live API ارائه کرده که برای Voice Agentها، زیرنویس زنده و اپلیکیشنهای تعاملی طراحی شده و Latency زیر یک ثانیه را هدف قرار میدهد. نسخهی دیگر هم برای پردازش فایلهای ضبطشده، جلسات و تماسها در دسترس است. 🚀از نظر بنچمارک هم اعداد جالباند؛ طبق دادهای که گوگل با استناد به Artificial Analysis منتشر کرده، میانگین WER حدود ۴٪ در حالت Streaming و ۲.۶٪ در حالت Non-streaming گزارش شده و زمان رسیدن به متن نهایی نسبت به Chirp 3 حدود ۷۰٪ بهبود داشته است. 📊
نکتهی مهمتر این است که گوگل Transcribe را صرفاً به چشم یک موتور STT نمیبیند. این مدل در بعضی تجربههای Gemini میتواند با Context صفحه و مدلهای دیگر ترکیب شود؛ یعنی فرمان صوتی در آینده فقط برای «تایپ با صدا» نیست و میتواند بخشی از رابط اصلی تعامل با AI Agentها باشد. 🤖🎤
فعلاً دسترسی توسعهدهندگان به Gemini 3.5 Transcribe از طریق Gemini API و Google AI Studio بهصورت Public Preview فراهم شده؛ این فناوری در Gemini روی macOS و قابلیت Rambler اندروید هم استفاده میشود و گوگل گفته پشتیبانی آن در Chrome نیز در راه است. 🧪🌐
بهنظر میرسد رقابت مدلهای صوتی حالا از «چه کسی دقیقتر صدا را متن میکند؟» عبور کرده و به سؤال بزرگتری رسیده: چه کسی بهتر میتواند منظور کاربر را از صدا بفهمد و آن را مستقیماً به عمل تبدیل کند؟ 👀
🌀 @cvision 🌀
❤9🔥3
� مدعی جدید دنیای تولید ویدیو از راه رسید! 🎬🔥
هوش مصنوعی جدید علیبابا، Wan 3.0، با قابلیت تولید ویدیوهای سینمایی و واقعگرایانه وارد رقابت شده؛ مدلی که میتونه از متن و تصویر، ویدیوهای باکیفیت و جذاب تولید کنه و کنترل بیشتری روی حرکت، دوربین و جزئیات صحنه در اختیار کاربر بذاره.
اگه دنبال ساخت ویدیوهای حرفهای با هوش مصنوعی هستی، Wan 3.0 یکی از مدلهاییه که ارزش امتحان کردن داره. �
@cvision
هوش مصنوعی جدید علیبابا، Wan 3.0، با قابلیت تولید ویدیوهای سینمایی و واقعگرایانه وارد رقابت شده؛ مدلی که میتونه از متن و تصویر، ویدیوهای باکیفیت و جذاب تولید کنه و کنترل بیشتری روی حرکت، دوربین و جزئیات صحنه در اختیار کاربر بذاره.
اگه دنبال ساخت ویدیوهای حرفهای با هوش مصنوعی هستی، Wan 3.0 یکی از مدلهاییه که ارزش امتحان کردن داره. �
@cvision
❤8👍1
Tensorflow(@CVision)
گوگل یک قدم جدیتر وارد رقابت تبدیل صدا به متن شد 🎙🧠 گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفتهی گوگل، دقیقترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمهبهکلمهی…
from google import genai
client = genai.Client()
# Upload audio file via the Files API
audio_file = client.files.upload(file="path/to/audio.wav")
# Transcribe with speaker diarization and word timestamps
interaction = client.interactions.create(
model="gemini-3.5-transcribe",
input=[{
"type": "audio",
"uri": audio_file.uri,
"mime_type": audio_file.mime_type,
}],
generation_config={
"transcription_config": {
"language_codes": ["en-US"],
"custom_vocabulary": ["Gemini", "Transcribe"],
"mode": {
"type": "verbatim",
"diarization_mode": "speaker",
"timestamp_granularities": ["word"],
}
}
}
)
print(interaction.output_text)
دریافت api key
❤16👍2
This media is not supported in your browser
VIEW IN TELEGRAM
🔥 رقابت غولهای تولید ویدئو با هوش مصنوعی!
چند روز پیش یک رقابت جذاب بین تعدادی از مطرحترین مدلهای تولید ویدئوی AI برگزار شد:
🎬 Seedance 2.5
🎬 WAN 3
🎬 FLUX 3
🎬 Minimax H3
🎬 Seedance 2.0
🎬 Seedance 2.0 Mini
🎬 Kling 3 Omni
🎬 Grok Imagine 1.5
اما نکته جذاب اینجاست که شرایط برای همه کاملاً یکسان بود:
✅ یک پرامپت مشترک
✅ ۷ تصویر مرجع یکسان
✅ انتخاب اولین ویدئوی تولیدشده توسط هر مدل
❌ بدون گزینش دستی
❌ بدون تدوین و ویرایش
❌ بدون تقویت یا اصلاح صدا
یعنی چیزی که میبینید، خروجی واقعی مدلها در یک شرایط برابر است. 👀
حالا سؤال اصلی:
🏆 کدوم مدل تونست بهترین خروجی رو ارائه بده؟
🌀 @cvision 🌀
چند روز پیش یک رقابت جذاب بین تعدادی از مطرحترین مدلهای تولید ویدئوی AI برگزار شد:
🎬 Seedance 2.5
🎬 WAN 3
🎬 FLUX 3
🎬 Minimax H3
🎬 Seedance 2.0
🎬 Seedance 2.0 Mini
🎬 Kling 3 Omni
🎬 Grok Imagine 1.5
اما نکته جذاب اینجاست که شرایط برای همه کاملاً یکسان بود:
✅ یک پرامپت مشترک
✅ ۷ تصویر مرجع یکسان
✅ انتخاب اولین ویدئوی تولیدشده توسط هر مدل
❌ بدون گزینش دستی
❌ بدون تدوین و ویرایش
❌ بدون تقویت یا اصلاح صدا
یعنی چیزی که میبینید، خروجی واقعی مدلها در یک شرایط برابر است. 👀
حالا سؤال اصلی:
🏆 کدوم مدل تونست بهترین خروجی رو ارائه بده؟
🌀 @cvision 🌀
👏11👍5👀3
Media is too big
VIEW IN TELEGRAM
معرفی 🚀 GPT-6 Astra
اوپنایآی امروز از GPT-6 Astra رونمایی کرد؛ مدلی که این شرکت آن را هوشمندترین و همراستاترین مدل خود تا امروز معرفی میکند.
آسترا 🧠 در حوزههایی مثل برنامهنویسی، کار با کامپیوتر و مرورگر، پژوهش علمی، امنیت سایبری و انجام کارهای حرفهای چندمرحلهای پیشرفت قابلتوجهی داشته است.
یکی از مهمترین تغییرات این نسل، توانایی بسیار بهتر در انجام مستقل کارهاست؛ یعنی مدل میتواند با نرمافزارها و وبسایتها کار کند، فرمها را تکمیل کند، دادهها را تحلیل کند، سند و فایل اکسل بسازد، وبسایت ایجاد کند و بسیاری از فرایندهای چندمرحلهای را با دخالت کمتر کاربر پیش ببرد.
عملکرد 📊 آسترا در برخی بنچمارکها هم چشمگیر است؛ این مدل در FrontierMath Tier 4 حدود ۹۸٪، در ARC-AGI-3 حدود ۹۹٫۹٪ و در ExploitBench امتیاز ۱۰۰٪ کسب کرده است.
دسترسی آن طی روزهای آینده برای کاربران Plus، Pro، Business و Enterprise نیز گستردهتر خواهد شد.
🔗 منبع OpenAI 🔗
🌀 @cvision 🌀
اوپنایآی امروز از GPT-6 Astra رونمایی کرد؛ مدلی که این شرکت آن را هوشمندترین و همراستاترین مدل خود تا امروز معرفی میکند.
آسترا 🧠 در حوزههایی مثل برنامهنویسی، کار با کامپیوتر و مرورگر، پژوهش علمی، امنیت سایبری و انجام کارهای حرفهای چندمرحلهای پیشرفت قابلتوجهی داشته است.
یکی از مهمترین تغییرات این نسل، توانایی بسیار بهتر در انجام مستقل کارهاست؛ یعنی مدل میتواند با نرمافزارها و وبسایتها کار کند، فرمها را تکمیل کند، دادهها را تحلیل کند، سند و فایل اکسل بسازد، وبسایت ایجاد کند و بسیاری از فرایندهای چندمرحلهای را با دخالت کمتر کاربر پیش ببرد.
عملکرد 📊 آسترا در برخی بنچمارکها هم چشمگیر است؛ این مدل در FrontierMath Tier 4 حدود ۹۸٪، در ARC-AGI-3 حدود ۹۹٫۹٪ و در ExploitBench امتیاز ۱۰۰٪ کسب کرده است.
دسترسی آن طی روزهای آینده برای کاربران Plus، Pro، Business و Enterprise نیز گستردهتر خواهد شد.
🔗 منبع OpenAI 🔗
🌀 @cvision 🌀
❤7👀5👏2
🎨 GPT Image 2.5 منتشر شد؛ چه چیزی بهتر شده؟
OpenAI نسل جدید مدل تصویرسازش را با تمرکز روی سرعت و ویرایش دقیقتر تصاویر عرضه کرده.
مهمترین تغییرات 👇
⚡️ تولید تصویر تا حدود ۲ برابر سریعتر
🖼️ حفظ بهتر چهره، محصول و سوژهی تصویر مرجع
✏️ ویرایشهای چندمرحلهای با تغییر کمتر در بخشهای دیگر تصویر
✨ نور، بافت و پسزمینه شفاف بهتر
💰 قیمت هر توکن نسبت به GPT Image 2 تغییر نکرده
در API هم دو نسخه داریم:
Flare → سریعتر و مناسب استفاده روزمره
Sunburst → مناسب خروجی نهایی و ویرایشهای دقیقتر
نکته مهم برای توسعهدهندهها:
اگر از API استفاده میکنید، مقدار
در مجموع GPT Image 2.5 یک انقلاب جدید نیست؛ بیشتر یک ارتقای جدی در سرعت، ثبات و کنترل ویرایش تصویر است. 🚀
🌀 @cvision 🌀
OpenAI نسل جدید مدل تصویرسازش را با تمرکز روی سرعت و ویرایش دقیقتر تصاویر عرضه کرده.
مهمترین تغییرات 👇
⚡️ تولید تصویر تا حدود ۲ برابر سریعتر
🖼️ حفظ بهتر چهره، محصول و سوژهی تصویر مرجع
✏️ ویرایشهای چندمرحلهای با تغییر کمتر در بخشهای دیگر تصویر
✨ نور، بافت و پسزمینه شفاف بهتر
💰 قیمت هر توکن نسبت به GPT Image 2 تغییر نکرده
در API هم دو نسخه داریم:
Flare → سریعتر و مناسب استفاده روزمره
Sunburst → مناسب خروجی نهایی و ویرایشهای دقیقتر
نکته مهم برای توسعهدهندهها:
اگر از API استفاده میکنید، مقدار
quality را حتماً مشخص کنید؛ چون سطحهای کیفیت در نسخه 2.5 نسبت به نسل قبل تغییر کردهاند.در مجموع GPT Image 2.5 یک انقلاب جدید نیست؛ بیشتر یک ارتقای جدی در سرعت، ثبات و کنترل ویرایش تصویر است. 🚀
🌀 @cvision 🌀
❤5👍2
Forwarded from 🚀 کلاسویژن | یادگیری هوش مصنوعی از پایه تا پیشرفته
Media is too big
VIEW IN TELEGRAM
🤖 میخوای Agent بسازی، نه فقط با AI چت کنی؟
تصور کن مدلی داشته باشی که ابزار صدا بزنه، مسئله رو مرحلهبهمرحله بشکنه و برای انجام یه کار واقعی خودش تصمیم بگیره.
توی دوره Agentic AI با پایتون قدمبهقدم یاد میگیری:
🔹 Workflow و Tool Use
🔹 MCP
🔹 سیستمهای چندعامله (Multi-Agent)
🔹 LangChain
اگه پایتون بلدی و میخوای وارد دنیای ساخت AI Agentها بشی، این دوره برات ساخته شده.
🎁 تخفیف ۷۰٪ فقط تا اول مهر (تعداد محدود)
🎟 کد تخفیف:
👇 ثبتنام:
🔗 https://mktb.me/m6tt/
💻 کدهای دوره روی گیتهاب:
https://github.com/Alireza-Akhavan/agentic_ai
@agentic_llm
تصور کن مدلی داشته باشی که ابزار صدا بزنه، مسئله رو مرحلهبهمرحله بشکنه و برای انجام یه کار واقعی خودش تصمیم بگیره.
توی دوره Agentic AI با پایتون قدمبهقدم یاد میگیری:
🔹 Workflow و Tool Use
🔹 MCP
🔹 سیستمهای چندعامله (Multi-Agent)
🔹 LangChain
اگه پایتون بلدی و میخوای وارد دنیای ساخت AI Agentها بشی، این دوره برات ساخته شده.
🎁 تخفیف ۷۰٪ فقط تا اول مهر (تعداد محدود)
🎟 کد تخفیف:
COUPON-8759A👇 ثبتنام:
🔗 https://mktb.me/m6tt/
💻 کدهای دوره روی گیتهاب:
https://github.com/Alireza-Akhavan/agentic_ai
@agentic_llm
❤3👍2
دنیایی از منابع برنامهنویسی توی این کانال بصورت دستهبندی شده با هشتگ بصورت روزانه قرار داده میشه.
@pythony
@pythony
❤5
Forwarded from 🚀 کلاسویژن | یادگیری هوش مصنوعی از پایه تا پیشرفته
🍂 به مناسبت شروع ماه مهر
تا پایان هفته اول مهر، ۴ دوره آموزشی کلاس ویژن را با ۷۰٪ تخفیف میتوانید تهیه کنید:
📌 ۱ دوره از سایت کلاس ویژن
🧠 دوره آموزشی ویدیویی Graph Neural Network
📚 3 دوره از کلاس ویژن در مکتبخونه
🤖 آموزش Agentic AI با پایتون
🧠 آموزش هوش مصنوعی مولد با مدلهای زبانی بزرگ (LLM)
👁 آموزش مدلهای زبانی-تصویری (VLM): از درک تصویر و ویدیو تا فاینتیون پیشرفته
⏳ تخفیف ۷۰٪ فقط تا پایان هفته اول مهر (با کلیک روی هر لینک کد تخفیف را مشاهده نمایید.)
تا پایان هفته اول مهر، ۴ دوره آموزشی کلاس ویژن را با ۷۰٪ تخفیف میتوانید تهیه کنید:
📌 ۱ دوره از سایت کلاس ویژن
🧠 دوره آموزشی ویدیویی Graph Neural Network
📚 3 دوره از کلاس ویژن در مکتبخونه
🤖 آموزش Agentic AI با پایتون
🧠 آموزش هوش مصنوعی مولد با مدلهای زبانی بزرگ (LLM)
👁 آموزش مدلهای زبانی-تصویری (VLM): از درک تصویر و ویدیو تا فاینتیون پیشرفته
⏳ تخفیف ۷۰٪ فقط تا پایان هفته اول مهر (با کلیک روی هر لینک کد تخفیف را مشاهده نمایید.)
❤6