Tensorflow(@CVision)
15.1K subscribers
1.31K photos
318 videos
91 files
2.59K links
اخبار حوزه یادگیری عمیق و هوش مصنوعی
مقالات و یافته های جدید یادگیری عمیق
بینایی ماشین و پردازش تصویر

TensorFlow, Keras, Deep Learning, Computer Vision

سایت:
http://class.vision

👨‍💻👩‍💻پشتیبان دوره ها:
@classvision_support

لینک گروه:
@tf2keras
Download Telegram
ممنون می‌شم دوستانی که دوره های بنده، خصوصا دوره جدید Agentic AI با پایتون رو تهیه کردن، چند دقیقه وقت ارزشمندشان را بذارن و رای و نظرشون رو در مکتب‌خونه ثبت کنن. 🙏

بازخوردهای شما هم برای من بسیار ارزشمنده و هم کمک می‌کنه افرادی که قصد تهیه دوره رو دارن، با اطمینان بیشتری تصمیم بگیرن. ❤️
28👌7
یادداشت شماره ۱:
درباره «مدلهای جهانی به عنوان بنیانهای شناختی برای AGI»
من یک مجموعه جدید درباره #WorldModels به عنوان زیربنای هوش_مصنوعی_عمومی (#AGI) شروع میکنم.

هوش مصنوعی فراتر از یادگیری ماشین سنتی و حتی #مدلهای_زبانی_بزرگ (#LLMs) امروزی به سرعت در حال تکامل است. یکی از هیجانانگیزترین پرسشها این است:
چگونه سیستمهای هوش_مصنوعی میتوانند یک درک درونی از جهان بسازند، درباره موقعیتهای جدید استدلال کنند، و پیش از اقدام، تصمیمهای بهتری بگیرند؟
WorldModels به عنوان گامی امیدوارکننده به سوی پاسخ به این پرسش ظهور کردهاند.
در این مجموعه، هم مبانی و هم پیشرفتهای اخیر در #WorldModels از #یادگیری_بازنمایی، #JEPA، و بازنماییهای نهان جهانی تا #MultimodalAI #Reasoning, #Planning, #Memory, #ReinforcementLearning #AutonomousAgents را بررسی خواهم کرد.
همچنین درباره تأثیر این ایدهها بر آینده #مدلهای_بنیادی، #رباتیک، #هوش_مصنوعی_در_سلامت، #هوش_مصنوعی_علمی و دیگر کاربردهای دنیای واقعی بحث خواهم کرد.
هدف من این است که این مفاهیم را با پیوند دادن نظریه زیربنایی با پژوهشهای روز، چالشهای مهندسی و پیادهسازیهای واقعی، عملی و قابل درک کنم. چه محقق باشید، چه #دانشمند_داده، چه #مهندس_یادگیری_ماشین، چه #مهندس_هوش_مصنوعی، یا صرفاً به آینده هوش مصنوعی علاقهمند باشید، امیدوارم این مجموعه برایتان باشد. مشتاقم تا در این مسیر با هم یاد بگیریم و نظراتتان را بشنوم.
مرجع تصویر: Y. LeCun, A Path Towards Autonomous Machine Intelligence (2022)
👍63👌2
هز چه قدر پول بدی آش میخوری :)

چند روز داشتم یه پروژه‌ی RAG با Neo4j و LangChain کار می‌کردم. یه جای کار retriever همیشه نتیجه‌ی خالی برمی‌گردوند — امبدینگ‌ها سالم، ایندکس سالم، ولی هرچی می‌گشتم هیچی پیدا نمی‌شد.

توی یه دیسکاشن طولانی با Sonnet، کلی فرضیه و راه‌حل امتحان کردیم: نسخه‌ی پکیج، نوع مدل امبدینگ، search_type، حتی رفتیم سراغ ساخت retriever سفارشی و full-text index دستی — هرکدوم یه گوشه از مشکل رو حل می‌کرد ولی ریشه‌ی اصلی پیدا نمی‌شد.

راستش از اول تعمداً سراغ Fable نرفته بودم، چون نمی‌خواستم هزینه‌ی توکنم بالا بره. ولی بعد از حدود دو ساعت کلنجار رفتن، خسته شدم و گفتم یه امتحانی بکنم.

بردمش رو Fable، و تقریباً بلافاصله رسید به یه نکته‌ی ساده که تا اون لحظه هیچ‌کس (نه من، نه Sonnet) بهش دقت نکرده بود: توی ساخت Neo4jVector`، پارامتر `database رو ست نکرده بودم! یعنی داشت به دیتابیس پیش‌فرض Neo4j وصل می‌شد، نه به دیتابیسی که واقعاً داده توش بود. همه‌ی اون رفتارهای عجیب (نتیجه‌ی خالی، جواب‌های نامرتبط) از همین یه پارامتر جا‌مونده بود.

البته Fable واقعا گرونه، و به درد همین مواقع که آدم گیر میکنه میخوره...
32👍104🤔3👀1
install-watch.md
18.5 KB
👁 درک عمیق و هوشمند ویدیوها با اسکیل /watch
با اضافه کردن این اسکیل قدرتمند، Agentهای هوش مصنوعی شما (مثل Claude Code و Codex) قابلیت تماشا و تحلیل جامع ویدیوها رو پیدا می‌کنن!
ویژگی‌های کلیدی:
🎞 آنالیز فریم‌به‌فریم: درک دقیق و بصری از اتفاقات داخل تصویر.
🗣 تشخیص هوشمند گفتار: فهم کامل دیالوگ‌ها و صدای روی ویدیو.
⚡️ راه‌اندازی تمام‌خودکار: بدون درگیری با مراحل نصب؛ فقط فایل رو به Agent خودتون بدید تا خودش پیش‌نیازها رو بررسی کنه و تمام ابزارهای لازم رو نصب و اجرا کنه.
15
🚀 معرفی مدل ویدیوساز قدرتمند و جدید MiniMax H3
مدل هوش مصنوعی MiniMax H3 (که به عنوان Hailuo 3.0 هم شناخته می‌شود) به تازگی به صورت Open-Weights منتشر شده و امکانات بی‌نظیری را برای تولید محتوای ویدیویی در اختیار کاربران قرار داده است. این مدل توانایی رقابت با بهترین مدل‌های بسته بازار را دارد و حتی روی سیستم‌های لوکال (مثل ComfyUI) هم قابل اجراست.
*خبرخوب : به زودی براتون بصورت اختصاصی ورک فلو ها و مدل های خوبش رو قرار میدهیم*
16👌2👍1
🎙 ـTypeless؛ ابزاری که تایپ کردن رو خیلی کمتر می‌کنه
ـTypeless یک ابزار مبتنی بر هوش مصنوعیه که صحبت شما رو به متن تبدیل می‌کنه، اما نه به شکل ساده‌ی Voice to Text.
هنگام صحبت، تپق‌ها، تکرارها و اصلاحاتی که وسط جمله انجام می‌دید رو تشخیص می‌ده و در نهایت یک متن مرتب و قابل استفاده تحویل می‌ده.
مثلاً اگر بگید:
«جلسه رو بذاریم فردا... نه، بهتره پس‌فردا ساعت ۱۰ باشه»
خروجی نهایی می‌تونه این باشه:
«جلسه را برای پس‌فردا ساعت ۱۰ تنظیم کنیم.»
یکی از قابلیت‌های جالبش اینه که می‌تونه متن رو متناسب با فضای کاری شما تنظیم کنه؛ مثلاً برای ایمیل، پیام یا متن‌های روزمره.
همچنین از بیش از ۱۰۰ زبان پشتیبانی می‌کنه و نسخه‌های Windows، macOS، iOS و Android هم داره.
اگر زیاد با ایمیل، پیام، تولید محتوا یا نوشتن متن‌های کاری سروکار دارید، Typeless می‌تونه ابزار جالبی برای امتحان کردن باشه.
🔗 typeless.com

🌀 @cvision 🌀
🔥183
یک خبر خوب برای اونایی که مدت‌هاست می‌خوان یه مهارت جدید یاد بگیرن 👇

با همکاری مکتب‌خونه، ۵۰۰ دوره آموزشی به‌صورت رایگان در طرح «ایران‌ماهر» در دسترس قرار گرفته. 🎓

چند تا از دوره‌های #کلاس_ویژن هم در این طرح قرار دادیم تا اگر تا امروز فرصت یا امکان تهیه‌شون رو نداشتید، بتونید با یکی از اون‌ها شروع کنید. 🌱

🔹 آموزش جامع یادگیری عمیق
🔹 ساخت هوش مصنوعی شخصی در مرورگر
🔹 آموزش مدل‌های زبانی-تصویری
🔹 آموزش پردازش تصویر

برای استفاده از این طرح، کافیه موقع ثبت‌نام کد IRANMAHER رو وارد کنید.

اگر مدت‌هاست دنبال یه فرصت برای یادگیری و شروع یک مهارت جدید هستید، این فرصت می‌تونه شروع خوبی باشه. ❤️

https://mktb.me/szs2/
23❤‍🔥2👏1
گوگل یک قدم جدی‌تر وارد رقابت تبدیل صدا به متن شد 🎙🧠

گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفته‌ی گوگل، دقیق‌ترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمه‌به‌کلمه‌ی صدا نیست؛ مدل تلاش می‌کند خروجی را به شکل تمیز، ساختاریافته و قابل استفاده تحویل دهد.

🌀 @cvision 🌀
10🔥4👍1
Tensorflow(@CVision)
گوگل یک قدم جدی‌تر وارد رقابت تبدیل صدا به متن شد 🎙🧠 گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفته‌ی گوگل، دقیق‌ترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمه‌به‌کلمه‌ی…
مدل جدید در مکالمه‌های واقعی می‌تواند مکث‌ها و کلمات اضافه مثل «اِمم» را حذف کند، اصلاح جمله توسط گوینده را متوجه شود و متن را به‌صورت خودکار فرمت کند. همچنین امکان تعریف Custom Vocabulary برای اصطلاحات تخصصی و نام‌های خاص هم وجود دارد؛ قابلیتی که برای کاربردهای سازمانی و فنی اهمیت زیادی دارد. 📝⚡️

یکی از جذاب‌ترین بخش‌ها، پشتیبانی از بیش از ۸۵ زبان، تشخیص لهجه‌ها و جابه‌جایی بین زبان‌هاست. برای فایل‌های ضبط‌شده هم قابلیت تشخیص گوینده و Word-level Timestamp در نظر گرفته شده و مدل می‌تواند تا سه گوینده را تفکیک کند؛ پشتیبانی از تعداد بیشتر فعلاً آزمایشی است. 🌍🎧
برای کاربردهای Real-time هم گوگل نسخه‌ی جداگانه‌ی gemini-3.5-transcribe-live را از طریق Live API ارائه کرده که برای Voice Agentها، زیرنویس زنده و اپلیکیشن‌های تعاملی طراحی شده و Latency زیر یک ثانیه را هدف قرار می‌دهد. نسخه‌ی دیگر هم برای پردازش فایل‌های ضبط‌شده، جلسات و تماس‌ها در دسترس است. 🚀

از نظر بنچمارک هم اعداد جالب‌اند؛ طبق داده‌ای که گوگل با استناد به Artificial Analysis منتشر کرده، میانگین WER حدود ۴٪ در حالت Streaming و ۲.۶٪ در حالت Non-streaming گزارش شده و زمان رسیدن به متن نهایی نسبت به Chirp 3 حدود ۷۰٪ بهبود داشته است. 📊
نکته‌ی مهم‌تر این است که گوگل Transcribe را صرفاً به چشم یک موتور STT نمی‌بیند. این مدل در بعضی تجربه‌های Gemini می‌تواند با Context صفحه و مدل‌های دیگر ترکیب شود؛ یعنی فرمان صوتی در آینده فقط برای «تایپ با صدا» نیست و می‌تواند بخشی از رابط اصلی تعامل با AI Agentها باشد. 🤖🎤
فعلاً دسترسی توسعه‌دهندگان به Gemini 3.5 Transcribe از طریق Gemini API و Google AI Studio به‌صورت Public Preview فراهم شده؛ این فناوری در Gemini روی macOS و قابلیت Rambler اندروید هم استفاده می‌شود و گوگل گفته پشتیبانی آن در Chrome نیز در راه است. 🧪🌐

به‌نظر می‌رسد رقابت مدل‌های صوتی حالا از «چه کسی دقیق‌تر صدا را متن می‌کند؟» عبور کرده و به سؤال بزرگ‌تری رسیده: چه کسی بهتر می‌تواند منظور کاربر را از صدا بفهمد و آن را مستقیماً به عمل تبدیل کند؟ 👀

🌀 @cvision 🌀
9🔥3
� مدعی جدید دنیای تولید ویدیو از راه رسید! 🎬🔥

هوش مصنوعی جدید علی‌بابا، Wan 3.0، با قابلیت تولید ویدیوهای سینمایی و واقع‌گرایانه وارد رقابت شده؛ مدلی که می‌تونه از متن و تصویر، ویدیوهای باکیفیت و جذاب تولید کنه و کنترل بیشتری روی حرکت، دوربین و جزئیات صحنه در اختیار کاربر بذاره.

اگه دنبال ساخت ویدیوهای حرفه‌ای با هوش مصنوعی هستی، Wan 3.0 یکی از مدل‌هاییه که ارزش امتحان کردن داره. �
@cvision
8👍1
Tensorflow(@CVision)
گوگل یک قدم جدی‌تر وارد رقابت تبدیل صدا به متن شد 🎙🧠 گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفته‌ی گوگل، دقیق‌ترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمه‌به‌کلمه‌ی…
from google import genai

client = genai.Client()

# Upload audio file via the Files API
audio_file = client.files.upload(file="path/to/audio.wav")

# Transcribe with speaker diarization and word timestamps
interaction = client.interactions.create(
model="gemini-3.5-transcribe",
input=[{
"type": "audio",
"uri": audio_file.uri,
"mime_type": audio_file.mime_type,
}],
generation_config={
"transcription_config": {
"language_codes": ["en-US"],
"custom_vocabulary": ["Gemini", "Transcribe"],
"mode": {
"type": "verbatim",
"diarization_mode": "speaker",
"timestamp_granularities": ["word"],
}
}
}
)

print(interaction.output_text)


دریافت api key
16👍2
This media is not supported in your browser
VIEW IN TELEGRAM
🔥 رقابت غول‌های تولید ویدئو با هوش مصنوعی!

چند روز پیش یک رقابت جذاب بین تعدادی از مطرح‌ترین مدل‌های تولید ویدئوی AI برگزار شد:

🎬 Seedance 2.5
🎬 WAN 3
🎬 FLUX 3
🎬 Minimax H3
🎬 Seedance 2.0
🎬 Seedance 2.0 Mini
🎬 Kling 3 Omni
🎬 Grok Imagine 1.5

اما نکته جذاب اینجاست که شرایط برای همه کاملاً یکسان بود:

یک پرامپت مشترک
۷ تصویر مرجع یکسان
انتخاب اولین ویدئوی تولیدشده توسط هر مدل
بدون گزینش دستی
بدون تدوین و ویرایش
بدون تقویت یا اصلاح صدا

یعنی چیزی که می‌بینید، خروجی واقعی مدل‌ها در یک شرایط برابر است. 👀

حالا سؤال اصلی:

🏆 کدوم مدل تونست بهترین خروجی رو ارائه بده؟
🌀 @cvision 🌀
👏11👍5👀3
Media is too big
VIEW IN TELEGRAM
معرفی 🚀 GPT-6 Astra

اوپن‌ای‌آی امروز از GPT-6 Astra رونمایی کرد؛ مدلی که این شرکت آن را هوشمندترین و هم‌راستاترین مدل خود تا امروز معرفی می‌کند.
آسترا 🧠 در حوزه‌هایی مثل برنامه‌نویسی، کار با کامپیوتر و مرورگر، پژوهش علمی، امنیت سایبری و انجام کارهای حرفه‌ای چندمرحله‌ای پیشرفت قابل‌توجهی داشته است.
یکی از مهم‌ترین تغییرات این نسل، توانایی بسیار بهتر در انجام مستقل کارهاست؛ یعنی مدل می‌تواند با نرم‌افزارها و وب‌سایت‌ها کار کند، فرم‌ها را تکمیل کند، داده‌ها را تحلیل کند، سند و فایل اکسل بسازد، وب‌سایت ایجاد کند و بسیاری از فرایندهای چندمرحله‌ای را با دخالت کمتر کاربر پیش ببرد.
عملکرد 📊 آسترا در برخی بنچمارک‌ها هم چشمگیر است؛ این مدل در FrontierMath Tier 4 حدود ۹۸٪، در ARC-AGI-3 حدود ۹۹٫۹٪ و در ExploitBench امتیاز ۱۰۰٪ کسب کرده است.
دسترسی آن طی روزهای آینده برای کاربران Plus، Pro، Business و Enterprise نیز گسترده‌تر خواهد شد.

🔗 منبع OpenAI 🔗

🌀 @cvision 🌀
7👀5👏2
🎨 GPT Image 2.5 منتشر شد؛ چه چیزی بهتر شده؟

OpenAI نسل جدید مدل تصویرسازش را با تمرکز روی سرعت و ویرایش دقیق‌تر تصاویر عرضه کرده.

مهم‌ترین تغییرات 👇

⚡️ تولید تصویر تا حدود ۲ برابر سریع‌تر
🖼️ حفظ بهتر چهره، محصول و سوژه‌ی تصویر مرجع
✏️ ویرایش‌های چندمرحله‌ای با تغییر کمتر در بخش‌های دیگر تصویر
نور، بافت و پس‌زمینه شفاف بهتر
💰 قیمت هر توکن نسبت به GPT Image 2 تغییر نکرده

در API هم دو نسخه داریم:

Flare
→ سریع‌تر و مناسب استفاده روزمره
Sunburst
→ مناسب خروجی نهایی و ویرایش‌های دقیق‌تر

نکته مهم برای توسعه‌دهنده‌ها:
اگر از API استفاده می‌کنید، مقدار quality را حتماً مشخص کنید؛ چون سطح‌های کیفیت در نسخه 2.5 نسبت به نسل قبل تغییر کرده‌اند.

در مجموع GPT Image 2.5 یک انقلاب جدید نیست؛ بیشتر یک ارتقای جدی در سرعت، ثبات و کنترل ویرایش تصویر است. 🚀

🌀 @cvision 🌀
5👍2
Media is too big
VIEW IN TELEGRAM
🤖 می‌خوای Agent بسازی، نه فقط با AI چت کنی؟
تصور کن مدلی داشته باشی که ابزار صدا بزنه، مسئله رو مرحله‌به‌مرحله بشکنه و برای انجام یه کار واقعی خودش تصمیم بگیره.
توی دوره Agentic AI با پایتون قدم‌به‌قدم یاد می‌گیری:
🔹 Workflow و Tool Use
🔹 MCP
🔹 سیستم‌های چندعامله (Multi-Agent)
🔹 LangChain
اگه پایتون بلدی و می‌خوای وارد دنیای ساخت AI Agentها بشی، این دوره برات ساخته شده.
🎁 تخفیف ۷۰٪ فقط تا اول مهر (تعداد محدود)
🎟 کد تخفیف: COUPON-8759A
👇 ثبت‌نام:
🔗 https://mktb.me/m6tt/
💻 کدهای دوره روی گیت‌هاب:
https://github.com/Alireza-Akhavan/agentic_ai
@agentic_llm
3👍2
دنیایی از منابع برنامه‌نویسی توی این کانال بصورت دسته‌بندی شده با هشتگ بصورت روزانه قرار داده میشه.

@pythony
5
🍂 به مناسبت شروع ماه مهر
تا پایان هفته اول مهر، ۴ دوره آموزشی کلاس ویژن را با ۷۰٪ تخفیف میتوانید تهیه کنید:

📌 ۱ دوره از سایت کلاس ویژن
🧠 دوره آموزشی ویدیویی Graph Neural Network

📚 3 دوره از کلاس ویژن در مکتب‌خونه

🤖 آموزش Agentic AI با پایتون

🧠 آموزش هوش مصنوعی مولد با مدل‌های زبانی بزرگ (LLM)

👁 آموزش مدل‌های زبانی-تصویری (VLM): از درک تصویر و ویدیو تا فاین‌تیون پیشرفته

تخفیف ۷۰٪ فقط تا پایان هفته اول مهر (با کلیک روی هر لینک کد تخفیف را مشاهده نمایید.)
6