🤖 نفوذ ناخواسته هوش مصنوعی گوگل به سه شرکت واقعی
مدل هوش مصنوعی Gemini گوگل در جریان یک تست امنیت سایبری که قرار بود در یک محیط شبیهسازیشده و ایزوله انجام شود، به سیستمهای سه شرکت واقعی نفوذ کرد.
قرار بود این مدل به یک شرکت فرضی در چالش «تسخیر پرچم» (Capture the Flag) حمله کند، اما یک اشتباه پیکربندی باعث شد Gemini به اینترنت عمومی دسترسی پیدا کند. این هوش مصنوعی با استفاده از اطلاعات عمومی، حدس زدن رمزهای عبور و یافتن اعتبارنامههای افشاشده در مخازن عمومی، توانست به زیرساختهای سه شرکت واقعی نفوذ کند.
طبق گزارش والاستریت ژورنال، به محض اینکه Gemini متوجه شد اهدافش واقعی هستند، عملیات خود را متوقف کرد. گوگل اعلام کرده است که این حادثه خسارتی به بار نیاورده و موضوع به شرکتهای آسیبدیده و مقامات فدرال اطلاعرسانی شده است.
نفوذ ناخواسته جمینای گوگل به سیستمهای سه شرکت واقعی در یک تست امنیتی
مدل هوش مصنوعی Gemini گوگل در جریان یک تست امنیت سایبری که قرار بود در یک محیط شبیهسازیشده و ایزوله انجام شود، به سیستمهای سه شرکت واقعی نفوذ کرد.
قرار بود این مدل به یک شرکت فرضی در چالش «تسخیر پرچم» (Capture the Flag) حمله کند، اما یک اشتباه پیکربندی باعث شد Gemini به اینترنت عمومی دسترسی پیدا کند. این هوش مصنوعی با استفاده از اطلاعات عمومی، حدس زدن رمزهای عبور و یافتن اعتبارنامههای افشاشده در مخازن عمومی، توانست به زیرساختهای سه شرکت واقعی نفوذ کند.
طبق گزارش والاستریت ژورنال، به محض اینکه Gemini متوجه شد اهدافش واقعی هستند، عملیات خود را متوقف کرد. گوگل اعلام کرده است که این حادثه خسارتی به بار نیاورده و موضوع به شرکتهای آسیبدیده و مقامات فدرال اطلاعرسانی شده است.
نفوذ ناخواسته جمینای گوگل به سیستمهای سه شرکت واقعی در یک تست امنیتی
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
This media is not supported in your browser
VIEW IN TELEGRAM
🐍 اجرای محلی و فوقسریع هوش مصنوعی با laya-mlx
پروژه متنباز laya-mlx یک سیستم طبقهبندی مبتنی بر احتمال خروجی متنی است که برای فریمورک MLX اپل پورت و بهینهسازی شده و حدود ۵۰ برابر سریعتر از سیستم Jev عمل میکند.
این ابزار سبک، حداکثر ۱ گیگابایت از حافظه رم دستگاه شما را اشغال میکند و به صورت کاملاً محلی قابل اجراست. در ارزیابیهای اولیه روی تراشه M3 Max، این مدل توانسته است با سرعت فوقالعادهی ۶۰ تصمیم در ثانیه، بازی کلاسیک مار (Snake) را به صورت خودکار هدایت کند.
معرفی پروژه laya-mlx؛ تحول در اجرای محلی سیستمهای طبقهبندی هوش مصنوعی
پروژه متنباز laya-mlx یک سیستم طبقهبندی مبتنی بر احتمال خروجی متنی است که برای فریمورک MLX اپل پورت و بهینهسازی شده و حدود ۵۰ برابر سریعتر از سیستم Jev عمل میکند.
این ابزار سبک، حداکثر ۱ گیگابایت از حافظه رم دستگاه شما را اشغال میکند و به صورت کاملاً محلی قابل اجراست. در ارزیابیهای اولیه روی تراشه M3 Max، این مدل توانسته است با سرعت فوقالعادهی ۶۰ تصمیم در ثانیه، بازی کلاسیک مار (Snake) را به صورت خودکار هدایت کند.
معرفی پروژه laya-mlx؛ تحول در اجرای محلی سیستمهای طبقهبندی هوش مصنوعی
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
🧠 خلاصه تحولات 24 ساعت گذشته هوش مصنوعی و علوم داده
🗂 گزارش #120 | 📌 8 آیتم گزارش | 🧾 از 13 پست بررسیشده
🕐 یکشنبه 1405/06/29 ساعت 14:00 تا دوشنبه 1405/06/30 ساعت 14:00
🔎 تحلیل کوتاه
🤖 نوآوری در مدلهای هوش مصنوعی
⚙️ معماری تصمیمگیری و بهینهسازی
🗂 گزارش #120 | 📌 8 آیتم گزارش | 🧾 از 13 پست بررسیشده
🕐 یکشنبه 1405/06/29 ساعت 14:00 تا دوشنبه 1405/06/30 ساعت 14:00
🔎 تحلیل کوتاه
تحولات اخیر نشاندهنده گذار از مدلهای صرفاً مولد به سوی سیستمهای تخصصی با کارایی فیزیکی و محاسباتی بالا است. همزمان با توسعه مدلهای تصمیمگیر، تمرکز بر ارزیابی مستقل و امنیت سایبری در مواجهه با چالشهای دنیای واقعی به اولویتهای استراتژیک در این حوزه تبدیل شده است.
🤖 نوآوری در مدلهای هوش مصنوعی
انتشار مدل متنباز Alice AI یاندکس
یاندکس مدل Alice AI-T5-35B-A0.6B را با معماری انکودر-دیکودر و MoE منتشر کرد. انتشار مدل متنباز Alice AI یاندکس
🔗 مشاهده پست
معرفی مدل Qwen-Image-2.1
مدل جدید Qwen با ۷ میلیارد پارامتر برای ترکیب تولید و ویرایش تصویر ارائه شد. معرفی مدل Qwen-Image-2.1
🔗 مشاهده پست
تلاش Anthropic برای رقابت با Astra
گزارشها از بررسی عرضه نسل جدید Claude توسط Anthropic برای حفظ جایگاه رقابتی حکایت دارد.
🔗 نسخه مفصل در سایت
ScientistTwo؛ هوش مصنوعی محقق
سیستم جدید گوگل با هدایت خودمختار تحقیقات ML، در بنچمارکها از انسان پیشی گرفت. ScientistTwo؛ هوش مصنوعی محقق
🔗 مشاهده پست
⚙️ معماری تصمیمگیری و بهینهسازی
معرفی Jev برای تصمیمگیری ساختاریافته
مدل Jev با تمرکز بر امتیازدهی و دستهبندی، جایگزینی برای مدلهای زبانی است.
🔗 مطالعه کامل در سایت
تمایز مدلهای مولد از مدلهای تصمیمگیر
مدل Jev با جداسازی تصمیمگیری از تولید متن، دقت اجرای عملیات را افزایش میدهد. تمایز مدلهای مولد از مدلهای تصمیمگیر
🔗 مشاهده پست
اجرای محلی فوقسریع با laya-mlx
پروژه laya-mlx برای فریمورک MLX اپل، ۵۰ برابر سریعتر از Jev عمل میکند. اجرای محلی فوقسریع با laya-mlx
🔗 مشاهده پست
تکنیکهای بهینهسازی LLM
بررسی تفاوتهای کلیدی در متدهای LoRA، LoRA-FA و QLoRA برای کاهش هزینه آموزش. تکنیکهای بهینهسازی LLM
🔗 مشاهده پست
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
⚠️ پایان عصر ریاضیات با هوش مصنوعی؟
سدریک ویلانی، برنده مدال فیلدز، در واکنش به توانایی خیرهکننده مدلهای جدید OpenAI در حل مسائل پیچیده «جایزه هزاره» (Millennium Prize) تعبیر تکاندهندهای به کار برده است. او میگوید: «من ویران شدم. فضایی شبیه به پایان تاریخ حاکم شده است؛ این فاجعهای است که ریاضیات هرگز مشابه آن را تجربه نکرده بود.»
ما اکنون در آستانه حل یکی دیگر از مسائل دشوار ریاضی توسط ماشینها هستیم. این پیشرفتها فراتر از سرعت محاسباتی است و نشان میدهد که هوش مصنوعی در حال نفوذ به لایههای خلاقانه و انتزاعی تفکر انسانی است. جامعه ریاضی در حال تجربهی تغییری پارادایمی است که احتمالاً تعاریف ما از «کشف علمی» را برای همیشه تغییر خواهد داد. آیا هوش مصنوعی در حال تبدیل شدن به اولین ریاضیدانِ غیرانسانی تاریخ است؟
تاثیر هوش مصنوعی بر مسائل جایزه هزاره؛ دیدگاه سدریک ویلانی درباره آینده ریاضیات
#OpenAI #Millennium_Prize
سدریک ویلانی، برنده مدال فیلدز، در واکنش به توانایی خیرهکننده مدلهای جدید OpenAI در حل مسائل پیچیده «جایزه هزاره» (Millennium Prize) تعبیر تکاندهندهای به کار برده است. او میگوید: «من ویران شدم. فضایی شبیه به پایان تاریخ حاکم شده است؛ این فاجعهای است که ریاضیات هرگز مشابه آن را تجربه نکرده بود.»
ما اکنون در آستانه حل یکی دیگر از مسائل دشوار ریاضی توسط ماشینها هستیم. این پیشرفتها فراتر از سرعت محاسباتی است و نشان میدهد که هوش مصنوعی در حال نفوذ به لایههای خلاقانه و انتزاعی تفکر انسانی است. جامعه ریاضی در حال تجربهی تغییری پارادایمی است که احتمالاً تعاریف ما از «کشف علمی» را برای همیشه تغییر خواهد داد. آیا هوش مصنوعی در حال تبدیل شدن به اولین ریاضیدانِ غیرانسانی تاریخ است؟
تاثیر هوش مصنوعی بر مسائل جایزه هزاره؛ دیدگاه سدریک ویلانی درباره آینده ریاضیات
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#OpenAI #Millennium_Prize
❤2
🌐 ترجمه همزمان با هوش مصنوعی Qwen
شرکت علیبابا از مدل جدید Qwen3.8-LiveTranslate رونمایی کرد که انقلابی در ترجمه گفتار ایجاد کرده است. این مدل با کاهش تاخیر به ۲.۳ ثانیه، نه تنها متن را ترجمه میکند، بلکه صدای اصلی گوینده را نیز بازسازی میکند.
مهمترین ویژگیهای این نسخه جدید:
• تشخیص دقیق هویت افراد در مکالمههای چندنفره و حفظ ویژگیهای صوتی هر فرد.
• امکان نمایش همزمان متن اصلی و ترجمه شده بر روی صفحه.
• بهرهگیری از متون قبلی و نشانههای بصری برای ترجمه دقیقتر اصطلاحات تخصصی و عبارات مبهم.
این مدل در حال حاضر از تشخیص گفتار برای ۶۰ زبان و خروجی گفتار ترجمه شده برای ۲۹ زبان پشتیبانی میکند. برای بررسی فنی و استفاده از قابلیتها، میتوانید به Alibaba Cloud Model Studio مراجعه کنید.
آیا تاکنون از مدلهای ترجمه زنده برای کارهای روزمره یا حرفهای استفاده کردهاید؟
تحول در ترجمه همزمان با مدل Qwen3.8-LiveTranslate علیبابا
#Qwen3 #Alibaba_Cloud_Model_Studio
شرکت علیبابا از مدل جدید Qwen3.8-LiveTranslate رونمایی کرد که انقلابی در ترجمه گفتار ایجاد کرده است. این مدل با کاهش تاخیر به ۲.۳ ثانیه، نه تنها متن را ترجمه میکند، بلکه صدای اصلی گوینده را نیز بازسازی میکند.
مهمترین ویژگیهای این نسخه جدید:
• تشخیص دقیق هویت افراد در مکالمههای چندنفره و حفظ ویژگیهای صوتی هر فرد.
• امکان نمایش همزمان متن اصلی و ترجمه شده بر روی صفحه.
• بهرهگیری از متون قبلی و نشانههای بصری برای ترجمه دقیقتر اصطلاحات تخصصی و عبارات مبهم.
این مدل در حال حاضر از تشخیص گفتار برای ۶۰ زبان و خروجی گفتار ترجمه شده برای ۲۹ زبان پشتیبانی میکند. برای بررسی فنی و استفاده از قابلیتها، میتوانید به Alibaba Cloud Model Studio مراجعه کنید.
آیا تاکنون از مدلهای ترجمه زنده برای کارهای روزمره یا حرفهای استفاده کردهاید؟
تحول در ترجمه همزمان با مدل Qwen3.8-LiveTranslate علیبابا
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Qwen3 #Alibaba_Cloud_Model_Studio
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 بهینهسازی هوشمند Claude Code با مد Jev
قابلیت جدیدی برای Claude Code منتشر شده است که با انتخاب هوشمندانه مهارتها، میزان مصرف توکن در پرامپتها را بهشدت کاهش میدهد. این مد جدید به جای بارگذاری تمامی قابلیتها در کانتکست (Context)، تنها موارد ضروری را بر اساس نیاز شما فراخوانی میکند.
مهمترین ویژگیهای این بهروزرسانی:
• بارگذاری انتخابی مهارتها در زمان نیاز به جای اشغال کردن کانتکست
• تحلیل هوشمند درخواست توسط Jev برای انتخاب دقیقترین مهارت
• پشتیبانی کامل از TypeSafe API و Vercel AI Gateway
اگر از ابزارهای کدنویسی هوش مصنوعی استفاده میکنید، این مد میتواند هزینه توکن و دقت تعاملات شما با Claude را بهینه کند. برای نصب و فعالسازی این قابلیت میتوانید از دستور زیر در ترمینال خود استفاده کنید:
#ClaudeCode #Jev
قابلیت جدیدی برای Claude Code منتشر شده است که با انتخاب هوشمندانه مهارتها، میزان مصرف توکن در پرامپتها را بهشدت کاهش میدهد. این مد جدید به جای بارگذاری تمامی قابلیتها در کانتکست (Context)، تنها موارد ضروری را بر اساس نیاز شما فراخوانی میکند.
مهمترین ویژگیهای این بهروزرسانی:
• بارگذاری انتخابی مهارتها در زمان نیاز به جای اشغال کردن کانتکست
• تحلیل هوشمند درخواست توسط Jev برای انتخاب دقیقترین مهارت
• پشتیبانی کامل از TypeSafe API و Vercel AI Gateway
اگر از ابزارهای کدنویسی هوش مصنوعی استفاده میکنید، این مد میتواند هزینه توکن و دقت تعاملات شما با Claude را بهینه کند. برای نصب و فعالسازی این قابلیت میتوانید از دستور زیر در ترمینال خود استفاده کنید:
npx claude-code-templates --mod productivity/jev-skill-suggestion📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#ClaudeCode #Jev
🚀 آشنایی با اکوسیستم هوشمند Jev
مخزن Awesome Jev به عنوان یک مرجع جامع، تمامی ابزارها، اسناد و پروژههای مرتبط با مدل Jev را گردآوری کرده است تا توسعهدهندگان بتوانند به سادگی از قابلیتهای آن در حوزههای مختلف بهره ببرند.
برخی از مهمترین ابزارها و کاربردهای این اکوسیستم:
* Jev Ultrafast: یک ایجنت مرورگر بهینه که عملیاتهای پیچیده مانند رزرو پرواز را در چند ثانیه با استفاده از درک DOM انجام میدهد.
* jev-browser: ابزاری برای خودکارسازی مرورگر با پشتیبانی از سرور MCP که امکان اجرای دستورات با تأخیر بسیار کم را فراهم میکند.
* Mobile Jev: ایجنتی تخصصی برای سیستمعامل اندروید که بدون نیاز به ADB، تعاملات کاربری را به صورت هوشمند انجام میدهد.
* ابزارهای تحلیل و پاکسازی: شامل مواردی مثل
* مستندات و SDKها: دسترسی به راهنماهای فنی، کیتهای توسعه نرمافزار به زبانهای مختلف و دادههای پژوهشی مرتبط با عملکرد مدل.
مخزن Awesome Jev: راهنمای جامع ابزارها و پروژههای هوش مصنوعی Jev
📊 Data➕Science
مخزن Awesome Jev به عنوان یک مرجع جامع، تمامی ابزارها، اسناد و پروژههای مرتبط با مدل Jev را گردآوری کرده است تا توسعهدهندگان بتوانند به سادگی از قابلیتهای آن در حوزههای مختلف بهره ببرند.
برخی از مهمترین ابزارها و کاربردهای این اکوسیستم:
* Jev Ultrafast: یک ایجنت مرورگر بهینه که عملیاتهای پیچیده مانند رزرو پرواز را در چند ثانیه با استفاده از درک DOM انجام میدهد.
* jev-browser: ابزاری برای خودکارسازی مرورگر با پشتیبانی از سرور MCP که امکان اجرای دستورات با تأخیر بسیار کم را فراهم میکند.
* Mobile Jev: ایجنتی تخصصی برای سیستمعامل اندروید که بدون نیاز به ADB، تعاملات کاربری را به صورت هوشمند انجام میدهد.
* ابزارهای تحلیل و پاکسازی: شامل مواردی مثل
TypeSafe AdBlock برای شناسایی هوشمند تبلیغات و Jev Web Analyzer برای تحلیل محتوای صفحات وب.* مستندات و SDKها: دسترسی به راهنماهای فنی، کیتهای توسعه نرمافزار به زبانهای مختلف و دادههای پژوهشی مرتبط با عملکرد مدل.
مخزن Awesome Jev: راهنمای جامع ابزارها و پروژههای هوش مصنوعی Jev
📊 Data➕Science
🚀 دستیار هوشمند خود را با ۳ میلیون مهارت ارتقا دهید
دنیای هوش مصنوعی به سمتی پیش میرود که مدلها فراتر از چت کردن، به «عامل» یا Agent تبدیل شوند. به تازگی مارکتپلیسی معرفی شده که دسترسی شما را به بیش از ۳ میلیون مهارت کاربردی برای مدلهایی مانند Claude و Codex فراهم میکند.
با استفاده از Skills Marketplace میتوانید ابزارهای تخصصی را بر اساس نیاز خود در حوزههای برنامهنویسی، DevOps، طراحی، تحلیل داده و بازاریابی جستجو کرده و به گردش کار خود اضافه کنید.
مهمترین قابلیتهای این پلتفرم:
- جستجوی هوشمند: یافتن مهارتها بر اساس نام یا کاربرد.
- شفافیت فنی: امکان بررسی مستندات دقیق هر مهارت در فایل
- طراحی رابط کاربری: دسترسی به مهارتهایی نظیر
- توسعه و بهینهسازی: استفاده از ابزار
معرفی Skills Marketplace؛ دسترسی به ۳ میلیون مهارت برای Claude و Codex
دنیای هوش مصنوعی به سمتی پیش میرود که مدلها فراتر از چت کردن، به «عامل» یا Agent تبدیل شوند. به تازگی مارکتپلیسی معرفی شده که دسترسی شما را به بیش از ۳ میلیون مهارت کاربردی برای مدلهایی مانند Claude و Codex فراهم میکند.
با استفاده از Skills Marketplace میتوانید ابزارهای تخصصی را بر اساس نیاز خود در حوزههای برنامهنویسی، DevOps، طراحی، تحلیل داده و بازاریابی جستجو کرده و به گردش کار خود اضافه کنید.
مهمترین قابلیتهای این پلتفرم:
- جستجوی هوشمند: یافتن مهارتها بر اساس نام یا کاربرد.
- شفافیت فنی: امکان بررسی مستندات دقیق هر مهارت در فایل
SKILL.md.- طراحی رابط کاربری: دسترسی به مهارتهایی نظیر
frontend-design برای بهبود زیباییشناسی و تایپوگرافی پروژهها.- توسعه و بهینهسازی: استفاده از ابزار
skill-creator برای ساخت مهارتهای شخصیسازی شده، ویرایش و تست عملکرد آنها.معرفی Skills Marketplace؛ دسترسی به ۳ میلیون مهارت برای Claude و Codex
🚀 معرفی مدل قدرتمند Step 5 Preview
شرکت StepFun بهتازگی از مدل پرچمدار جدید خود با نام
از ویژگیهای فنی کلیدی این مدل میتوان به موارد زیر اشاره کرد:
• بهرهگیری از ۶۰۰ میلیارد پارامتر (۲۷ میلیارد پارامتر فعال)
• پشتیبانی از پنجره متنی ۱ میلیون توکن
• قابلیتهای چندوجهی (Multimodal) پیشرفته
طبق اعلام تیم توسعهدهنده، این مدل قادر است وظایف خودمختار را تا ۲۴ ساعت بهصورت مستمر اجرا کرده و در حوزههای تخصصی نظیر کدنویسی، بهینهسازی هستههای GPU و تحلیلهای دقیق مالی فعالیت کند.
شما میتوانید هماکنون عملکرد این مدل را در پلتفرم StepFun آزمایش کنید. همچنین طبق زمانبندی اعلامشده، وزنهای این مدل در تاریخ ۱۵ اکتبر بهصورت عمومی منتشر خواهند شد.
معرفی مدل Step 5 Preview؛ پرچمدار جدید StepFun با معماری MoE
#Step_5_Preview #MoE
شرکت StepFun بهتازگی از مدل پرچمدار جدید خود با نام
Step 5 Preview رونمایی کرد. این مدل که بر پایه معماری MoE ساخته شده، با هدف انجام وظایف طولانیمدت عاملی، توسعه نرمافزار و تحلیلهای پیچیده داده طراحی شده است.از ویژگیهای فنی کلیدی این مدل میتوان به موارد زیر اشاره کرد:
• بهرهگیری از ۶۰۰ میلیارد پارامتر (۲۷ میلیارد پارامتر فعال)
• پشتیبانی از پنجره متنی ۱ میلیون توکن
• قابلیتهای چندوجهی (Multimodal) پیشرفته
طبق اعلام تیم توسعهدهنده، این مدل قادر است وظایف خودمختار را تا ۲۴ ساعت بهصورت مستمر اجرا کرده و در حوزههای تخصصی نظیر کدنویسی، بهینهسازی هستههای GPU و تحلیلهای دقیق مالی فعالیت کند.
شما میتوانید هماکنون عملکرد این مدل را در پلتفرم StepFun آزمایش کنید. همچنین طبق زمانبندی اعلامشده، وزنهای این مدل در تاریخ ۱۵ اکتبر بهصورت عمومی منتشر خواهند شد.
معرفی مدل Step 5 Preview؛ پرچمدار جدید StepFun با معماری MoE
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Step_5_Preview #MoE
❤1
📊 تحلیل عملکرد مدلهای کدنویس از نگاه کاربران
در دنیای هوش مصنوعی، علاوه بر بنچمارکهای استاندارد، «بازخورد کاربران» به یکی از شاخصهای کلیدی برای درک کیفیت واقعی Agentها تبدیل شده است. تیم Arena.ai با تحلیل بیش از ۲۰ هزار گزارش از عملکرد مدلهای مختلف، نتایج کاربردی و جالبی استخراج کرده است.
مهمترین یافتههای این تحقیق:
- مدلهای پیشرو (Frontier Models) به شکل معناداری بازخوردهای مثبت بیشتری دریافت میکنند و این بهبود کیفیت در نسخههای جدیدتر کاملاً مشهود است.
- «کد ناقص یا خراب» اصلیترین دلیل نارضایتی کاربران است که نزدیک به ۷۰ درصد از بازخوردهای منفی را شامل میشود.
- ضعف در تکمیل خروجیها، چالشهای مربوط به استفادهپذیری و نادیده گرفتن دستورالعملهای ارسالی از دیگر مشکلات رایج در مدلهاست.
- اگرچه اکثر مدلها نقاط ضعف مشترکی دارند، اما سطح پایداری و میزان «کد بیدقت» (slop) در هر مدل متفاوت است که این موضوع انتخاب بهترین ابزار برای سناریوهای خاص را حساستر میکند.
تحلیل دقیق عملکرد مدلهای کدنویس بر اساس بازخورد واقعی کاربران در Agent Arena
📊 Data➕Science
در دنیای هوش مصنوعی، علاوه بر بنچمارکهای استاندارد، «بازخورد کاربران» به یکی از شاخصهای کلیدی برای درک کیفیت واقعی Agentها تبدیل شده است. تیم Arena.ai با تحلیل بیش از ۲۰ هزار گزارش از عملکرد مدلهای مختلف، نتایج کاربردی و جالبی استخراج کرده است.
مهمترین یافتههای این تحقیق:
- مدلهای پیشرو (Frontier Models) به شکل معناداری بازخوردهای مثبت بیشتری دریافت میکنند و این بهبود کیفیت در نسخههای جدیدتر کاملاً مشهود است.
- «کد ناقص یا خراب» اصلیترین دلیل نارضایتی کاربران است که نزدیک به ۷۰ درصد از بازخوردهای منفی را شامل میشود.
- ضعف در تکمیل خروجیها، چالشهای مربوط به استفادهپذیری و نادیده گرفتن دستورالعملهای ارسالی از دیگر مشکلات رایج در مدلهاست.
- اگرچه اکثر مدلها نقاط ضعف مشترکی دارند، اما سطح پایداری و میزان «کد بیدقت» (slop) در هر مدل متفاوت است که این موضوع انتخاب بهترین ابزار برای سناریوهای خاص را حساستر میکند.
تحلیل دقیق عملکرد مدلهای کدنویس بر اساس بازخورد واقعی کاربران در Agent Arena
📊 Data➕Science
🩺 هوش مصنوعی در پزشکی: واقعیت یا همبستگی؟
نمودارهای اخیر نشان میدهند که مراکز درمانی با استفاده گسترده از هوش مصنوعی، نرخ مرگومیر کمتری را تجربه کردهاند. با این حال، نباید به سادگی بین این دو رابطه علت و معلولی برقرار کرد.
مراکز مجهزتر معمولاً بودجه بیشتری دارند، از کادر درمان متخصصتری برخوردارند و زیرساختهای مدرنتری فراهم کردهاند. این عوامل بهتنهایی میتوانند نتایج درمانی را بهبود بخشند. برای درک اثر واقعی AI، باید متغیرهایی مانند سن بیمار، نوع بیماری و شدت وضعیت سلامت را نیز در محاسبات لحاظ کرد.
با این حال، بزرگترین خدمت هوش مصنوعی در کوتاهمدت احتمالاً کاهش بار اداری است. مهمترین کاربردهای فعلی شامل موارد زیر است:
* ثبت دقیق اطلاعات بیمار و پر کردن فرمهای طولانی
* ساختارمند کردن تاریخچه پزشکی (Electronic Health Records)
* آمادهسازی پیشنویس خروجی و گزارشهای ترخیص
* بررسی خودکار دادههای آزمایشگاهی برای کاهش خطای انسانی
هوش مصنوعی در پزشکی: تحلیل دادهمحور رابطه تکنولوژی و کاهش نرخ مرگومیر
نمودارهای اخیر نشان میدهند که مراکز درمانی با استفاده گسترده از هوش مصنوعی، نرخ مرگومیر کمتری را تجربه کردهاند. با این حال، نباید به سادگی بین این دو رابطه علت و معلولی برقرار کرد.
مراکز مجهزتر معمولاً بودجه بیشتری دارند، از کادر درمان متخصصتری برخوردارند و زیرساختهای مدرنتری فراهم کردهاند. این عوامل بهتنهایی میتوانند نتایج درمانی را بهبود بخشند. برای درک اثر واقعی AI، باید متغیرهایی مانند سن بیمار، نوع بیماری و شدت وضعیت سلامت را نیز در محاسبات لحاظ کرد.
با این حال، بزرگترین خدمت هوش مصنوعی در کوتاهمدت احتمالاً کاهش بار اداری است. مهمترین کاربردهای فعلی شامل موارد زیر است:
* ثبت دقیق اطلاعات بیمار و پر کردن فرمهای طولانی
* ساختارمند کردن تاریخچه پزشکی (Electronic Health Records)
* آمادهسازی پیشنویس خروجی و گزارشهای ترخیص
* بررسی خودکار دادههای آزمایشگاهی برای کاهش خطای انسانی
هوش مصنوعی در پزشکی: تحلیل دادهمحور رابطه تکنولوژی و کاهش نرخ مرگومیر
🚀 عرضه Grok 4.7 و تحلیل بنچمارک مدلهای هوش مصنوعی
مدل
بر اساس جدیدترین تحلیلها در
* مدل
* مدل
* عملکرد
* مدل
بررسی فنی مدل Grok 4.7 و تحلیل رقابتی در بنچمارک CursorBench 4.0
مدل
Grok 4.7 به تازگی منتشر شد و با وجود حفظ قیمت و سرعت پیشین، شاهد بهبود عملکرد قابل توجهی در پردازشها هستیم. برخلاف گمانهزنیهای اولیه مبنی بر استفاده از یک مدل ۲.۱ تریلیون پارامتری، این نسخه با بهینهسازیهای جدید عرضه شده است. همچنین گزارشها حاکی از آن است که روند آموزش Grok 4.8 با ۲.۵ تریلیون پارامتر به پایان رسیده و این مدل در حال حاضر در مرحله آموزش تقویتی (RL) قرار دارد.بر اساس جدیدترین تحلیلها در
CursorBench 4.0، رقابت مدلهای هوش مصنوعی بر سر بهرهوری هزینه و دقت به اوج رسیده است. مهمترین یافتههای این ارزیابی عبارتند از:* مدل
Fable 5.1 با کسب امتیاز ۵۱٪ در بالاترین رده عملکردی قرار دارد.* مدل
Opus 5 با رویکردی متعادل، امتیاز ۴۵.۵٪ را در بهینهترین هزینه به دست آورده است.* عملکرد
Grok 4.7 در سطوح قیمتی میانی، رقابت نزدیکی با سایر مدلهای مطرح بازار دارد.* مدل
Sonnet 5 و GPT-5.6 Sol نیز با استراتژیهای متفاوت در جایگاههای بعدی بنچمارک قرار گرفتهاند.بررسی فنی مدل Grok 4.7 و تحلیل رقابتی در بنچمارک CursorBench 4.0
هوش مصنوعی و علم داده به فارسی
🚀 عرضه Grok 4.7 و تحلیل بنچمارک مدلهای هوش مصنوعی مدل Grok 4.7 به تازگی منتشر شد و با وجود حفظ قیمت و سرعت پیشین، شاهد بهبود عملکرد قابل توجهی در پردازشها هستیم. برخلاف گمانهزنیهای اولیه مبنی بر استفاده از یک مدل ۲.۱ تریلیون پارامتری، این نسخه با بهینهسازیهای…
🚀 ظهور Grok 4.7 در صدر مدلهای ایجنتیک
مدل جدید Grok 4.7 با جهشی قابلتوجه در بنچمارکهای هوش مصنوعی، جایگاه خود را به عنوان یکی از پیشروترین مدلها در حوزه کارهای دانشمحور ایجنتیک تثبیت کرد. طبق بررسیهای Artificial Analysis، این نسخه با کسب امتیازات بالا در پردازشهای پیچیده، اکنون در کنار مدلهای قدرتمندی مثل Claude Opus 5 قرار گرفته است.
مهمترین نکات درباره این بهروزرسانی:
➤ جهش در توانمندیهای ایجنتیک: مدل جدید با کسب ۱۶۵۷ امتیاز Elo در بنچمارک AA-Briefcase، عملکردی خیرهکننده در کارهای دانشمحور طولانیمدت از خود نشان داده است.
➤ تحول در برنامهنویسی ایجنتیک: ترکیب Grok 4.7 با ابزار Grok Build توانسته به امتیاز ۵۶ در Coding Agent Index دست یابد و در جمع ۴ مدل برتر دنیا در حوزه کدنویسی جای بگیرد.
➤ افزایش مصرف توکن: بهبود عملکرد این مدل با افزایش قابلتوجه مصرف توکن همراه بوده است؛ بهطوری که برای هر تسک بهطور میانگین ۸۱ هزار توکن خروجی مصرف میکند که بیش از دو برابر نسل قبلی است.
بررسی عمیق Grok 4.7: جهش در هوش مصنوعی ایجنتیک و کدنویسی
📊 Data➕Science
مدل جدید Grok 4.7 با جهشی قابلتوجه در بنچمارکهای هوش مصنوعی، جایگاه خود را به عنوان یکی از پیشروترین مدلها در حوزه کارهای دانشمحور ایجنتیک تثبیت کرد. طبق بررسیهای Artificial Analysis، این نسخه با کسب امتیازات بالا در پردازشهای پیچیده، اکنون در کنار مدلهای قدرتمندی مثل Claude Opus 5 قرار گرفته است.
مهمترین نکات درباره این بهروزرسانی:
➤ جهش در توانمندیهای ایجنتیک: مدل جدید با کسب ۱۶۵۷ امتیاز Elo در بنچمارک AA-Briefcase، عملکردی خیرهکننده در کارهای دانشمحور طولانیمدت از خود نشان داده است.
➤ تحول در برنامهنویسی ایجنتیک: ترکیب Grok 4.7 با ابزار Grok Build توانسته به امتیاز ۵۶ در Coding Agent Index دست یابد و در جمع ۴ مدل برتر دنیا در حوزه کدنویسی جای بگیرد.
➤ افزایش مصرف توکن: بهبود عملکرد این مدل با افزایش قابلتوجه مصرف توکن همراه بوده است؛ بهطوری که برای هر تسک بهطور میانگین ۸۱ هزار توکن خروجی مصرف میکند که بیش از دو برابر نسل قبلی است.
بررسی عمیق Grok 4.7: جهش در هوش مصنوعی ایجنتیک و کدنویسی
📊 Data➕Science
❤1
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 جهش در عملکرد با رویکرد Hybrid در هوش مصنوعی
اخیراً هریسون کینسلی (Sentdex) در تجربهای جالب، تفاوت عملکرد مدل زبانی GLM 5.3 Flash را به تنهایی در برابر ترکیب آن با ابزار Jev در بازی استراتژیک Halite 2 بررسی کرده است. نتایج این رویکرد ترکیبی نشان میدهد که چگونه میتوان با ترکیب قدرت استدلالی مدلهای بزرگ و ابزارهای تخصصی، به خروجیهای بهینهتری رسید.
در این مدل ترکیبی:
- مدل GLM 5.3 Flash وظیفه تصمیمگیریهای کلان استراتژیک مانند انتخاب سیارات و زمانبندی بازنگری در برنامهها را بر عهده دارد.
- ابزار Jev مسئولیت اجرای عملیات جزئی و هدایت تکتک کشتیها را انجام میدهد.
مهمترین نتایج این آزمایش عبارتند از:
- افزایش ۱۳ برابری سرعت اجرا در مقایسه با مدل خالص.
- کاهش ۴۴ درصدی هزینههای پردازشی API.
- بهبود جزئی در نرخ پیروزی و عملکرد نهایی در بازی.
این آزمایش نشان میدهد که چگونه اضافه کردن ابزارهای تخصصی به عنوان مکمل در کنار LLMها، نه تنها هزینهها و زمان اجرا را کاهش میدهد، بلکه دقت سیستم در محیطهای عملیاتی را به شدت بالا میبرد.
📊 Data➕Science
اخیراً هریسون کینسلی (Sentdex) در تجربهای جالب، تفاوت عملکرد مدل زبانی GLM 5.3 Flash را به تنهایی در برابر ترکیب آن با ابزار Jev در بازی استراتژیک Halite 2 بررسی کرده است. نتایج این رویکرد ترکیبی نشان میدهد که چگونه میتوان با ترکیب قدرت استدلالی مدلهای بزرگ و ابزارهای تخصصی، به خروجیهای بهینهتری رسید.
در این مدل ترکیبی:
- مدل GLM 5.3 Flash وظیفه تصمیمگیریهای کلان استراتژیک مانند انتخاب سیارات و زمانبندی بازنگری در برنامهها را بر عهده دارد.
- ابزار Jev مسئولیت اجرای عملیات جزئی و هدایت تکتک کشتیها را انجام میدهد.
مهمترین نتایج این آزمایش عبارتند از:
- افزایش ۱۳ برابری سرعت اجرا در مقایسه با مدل خالص.
- کاهش ۴۴ درصدی هزینههای پردازشی API.
- بهبود جزئی در نرخ پیروزی و عملکرد نهایی در بازی.
این آزمایش نشان میدهد که چگونه اضافه کردن ابزارهای تخصصی به عنوان مکمل در کنار LLMها، نه تنها هزینهها و زمان اجرا را کاهش میدهد، بلکه دقت سیستم در محیطهای عملیاتی را به شدت بالا میبرد.
📊 Data➕Science
⚡️ جهش بزرگ OpenAI در حل مسائل پیچیده ریاضی
شرکت OpenAI اعلام کرد که مدل داخلی جدید آنها تنها در ۲۴ روز توانسته است بیش از ۱۰۰ مسئله باز و قدیمی را در حوزههای مختلف ریاضیات حل کند. این سرعت خیرهکننده، حتی تیمهای داخلی را نیز شگفتزده کرده است.
از مهمترین دستاوردهای این مدل میتوان به حل مسئله Navier-Stokes Millennium Prize اشاره کرد. برای بررسی دقیق و اعتبارسنجی این نتایج، یک گروه مشاوره مستقل تشکیل شده است که شامل برجستهترین ریاضیدانان جهان است:
- ادوارد ویتن (Edward Witten)
- تیموتی گاورز (Timothy Gowers)
- مارتین هایرر (Martin Hairer)
- راوی واکیل (Ravi Vakil)
- ملانی میچت وود (Melanie Matchett Wood)
این متخصصان به صورت داوطلبانه و مستقل بر روند فعالیتها نظارت میکنند. در حال حاضر بسیاری از این راهکارها هنوز برای بررسی دقیق توسط جامعه علمی منتشر نشدهاند. جزئیات بیشتر این همکاری را میتوانید در وبسایت رسمی OpenAI مطالعه کنید.
جهش خیرهکننده OpenAI در حل مسائل پیچیده ریاضی با مدل داخلی جدید
#Navier_Stokes #OpenAI
شرکت OpenAI اعلام کرد که مدل داخلی جدید آنها تنها در ۲۴ روز توانسته است بیش از ۱۰۰ مسئله باز و قدیمی را در حوزههای مختلف ریاضیات حل کند. این سرعت خیرهکننده، حتی تیمهای داخلی را نیز شگفتزده کرده است.
از مهمترین دستاوردهای این مدل میتوان به حل مسئله Navier-Stokes Millennium Prize اشاره کرد. برای بررسی دقیق و اعتبارسنجی این نتایج، یک گروه مشاوره مستقل تشکیل شده است که شامل برجستهترین ریاضیدانان جهان است:
- ادوارد ویتن (Edward Witten)
- تیموتی گاورز (Timothy Gowers)
- مارتین هایرر (Martin Hairer)
- راوی واکیل (Ravi Vakil)
- ملانی میچت وود (Melanie Matchett Wood)
این متخصصان به صورت داوطلبانه و مستقل بر روند فعالیتها نظارت میکنند. در حال حاضر بسیاری از این راهکارها هنوز برای بررسی دقیق توسط جامعه علمی منتشر نشدهاند. جزئیات بیشتر این همکاری را میتوانید در وبسایت رسمی OpenAI مطالعه کنید.
جهش خیرهکننده OpenAI در حل مسائل پیچیده ریاضی با مدل داخلی جدید
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Navier_Stokes #OpenAI
❤1
🚀 معرفی مدلهای جدید هوش مصنوعی شیائومی: MiMo-V2.6
شیائومی بهتازگی خانواده مدلهای
* مدل Flash: دارای ۳۰۹ میلیارد پارامتر (۱۵ میلیارد فعال) که برای اجرا به ۱۷۷.۸ گیگابایت حافظه در فرمت FP8 نیاز دارد.
* مدل Pro: یک مدل عظیم با ۱.۰۲ تریلیون پارامتر (۴۲ میلیارد فعال) و ۵۷۳.۵ گیگابایت حافظه مورد نیاز در فرمت FP8.
با استفاده از تکنیک کوانتایزاسیون
برای بررسی فنی و دسترسی به نسخه تقطیر شده، میتوانید به مخزن رسمی در HuggingFace مراجعه کنید.
معرفی مدلهای هوش مصنوعی چندوجهی شیائومی MiMo-V2.6: قدرت و کارایی بیسابقه
شیائومی بهتازگی خانواده مدلهای
MiMo-V2.6 را با وزنهای باز معرفی کرده است. این سری شامل دو مدل پیشرفته از نوع MoE است که قابلیت پردازش همزمان متن، تصویر، ویدیو و صدا را دارند و از پنجره متنی تا ۱ میلیون توکن پشتیبانی میکنند:* مدل Flash: دارای ۳۰۹ میلیارد پارامتر (۱۵ میلیارد فعال) که برای اجرا به ۱۷۷.۸ گیگابایت حافظه در فرمت FP8 نیاز دارد.
* مدل Pro: یک مدل عظیم با ۱.۰۲ تریلیون پارامتر (۴۲ میلیارد فعال) و ۵۷۳.۵ گیگابایت حافظه مورد نیاز در فرمت FP8.
با استفاده از تکنیک کوانتایزاسیون
NVFP4، میتوان نیازهای حافظه این مدلها را تقریباً به نصف کاهش داد. همچنین نسخه تقطیر شده این خانواده بر پایه مدل Qwen 9B منتشر شده است که در بنچمارکهای مختلف، بهویژه در حوزههای کدنویسی و امنیت سایبری، عملکرد بهتری نسبت به نسخه پایه Qwen 3.5 نشان میدهد.برای بررسی فنی و دسترسی به نسخه تقطیر شده، میتوانید به مخزن رسمی در HuggingFace مراجعه کنید.
معرفی مدلهای هوش مصنوعی چندوجهی شیائومی MiMo-V2.6: قدرت و کارایی بیسابقه
🧠 خلاصه تحولات 24 ساعت گذشته هوش مصنوعی و علوم داده
🗂 گزارش #121 | 📌 8 آیتم گزارش | 🧾 از 16 پست بررسیشده
🕐 دوشنبه 1405/06/30 ساعت 14:00 تا سهشنبه 1405/06/31 ساعت 14:00
🔎 تحلیل کوتاه
🔬 هوش مصنوعی در مرزهای علم
⚙️ مدلها و زیرساختهای نوین
🗂 گزارش #121 | 📌 8 آیتم گزارش | 🧾 از 16 پست بررسیشده
🕐 دوشنبه 1405/06/30 ساعت 14:00 تا سهشنبه 1405/06/31 ساعت 14:00
🔎 تحلیل کوتاه
تحولات اخیر نشاندهنده تغییر پارادایمی در توانمندی مدلها برای حل مسائل پیچیده ریاضی و پیشبرد تحقیقات علمی است. در کنار این نفوذ به حوزههای انتزاعی، تمرکز توسعهدهندگان بر استفاده از رویکرد Hybrid با ترکیب ایجنتهای تخصصی و مدلهای زبانی کلان برای بهینهسازی عملکرد و کاهش مصرف توکن معطوف شده است.
🔬 هوش مصنوعی در مرزهای علم
هوش مصنوعی و پایان عصر ریاضیات
سدریک ویلانی نسبت به توانایی مدلهای OpenAI در حل مسائل پیچیده ریاضی ابراز نگرانی کرد. هوش مصنوعی و پایان عصر ریاضیات
🔗 مشاهده پست
حل مسائل هزاره توسط هوش مصنوعی
مدل جدید OpenAI طی ۲۴ روز موفق به حل بیش از ۱۰۰ مسئله باز ریاضی از جمله Navier-Stokes شد. حل مسائل هزاره توسط هوش مصنوعی
🔗 مشاهده پست
واقعیتسنجی هوش مصنوعی در پزشکی
کاهش مرگومیر در مراکز مجهز را نباید لزوماً به هوش مصنوعی نسبت داد و متغیرهای دیگر دخیلاند. واقعیتسنجی هوش مصنوعی در پزشکی
🔗 مشاهده پست
⚙️ مدلها و زیرساختهای نوین
معرفی مدل Step 5 Preview
مدل جدید بر پایه معماری MoE با ۱ میلیون توکن کانتکست برای وظایف خودمختار طولانیمدت. معرفی مدل Step 5 Preview
🔗 مشاهده پست
خانواده مدلهای MiMo-V2.6 شیائومی
مدلهای MoE چندوجهی با وزنهای باز و پشتیبانی از پنجره متنی ۱ میلیون توکن. خانواده مدلهای MiMo-V2.6 شیائومی
🔗 مشاهده پست
مدل Qwen-Image-2.1 برای تولید تصویر
نسل جدید هوش مصنوعی علیبابا با قابلیت پشتیبانی بومی از شفافیت تصویر (RGBA).
🔗 مطالعه کامل در سایت
تنش در توسعه هوش مصنوعی مدل Fable
گزارش Politico از تقابل Anthropic با دولت آمریکا بر سر آسیبپذیریهای مدل Fable.
🔗 جزئیات کامل در سایت
همکاری Universal Music و ElevenLabs
توافق برای تولید موسیقی هوش مصنوعی با استفاده از صداهای دارای مجوز رسمی.
🔗 جزئیات کامل در سایت
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
🚀 خیز بزرگ علیبابا در دنیای هوش مصنوعی
شرکت علیبابا از برنامههای توسعهای جسورانهای برای آینده مدلهای زبانی خود رونمایی کرد. طبق گزارش رویترز، این شرکت در حال آموزش مدل Qwen 4 است و قصد دارد نسلهای بعدی یعنی Qwen 4.5 و Qwen 5 را تا مقیاس ۱۰ تریلیون پارامتر توسعه دهد.
مهمترین نکات این نقشه راه عبارتند از:
• تمرکز بر خوداصلاحی بازگشتی: مدلها نقاط ضعف خود را شناسایی کرده، آزمایش طراحی میکنند و دادههای لازم برای آموزش نسل بعدی خود را تولید میکنند.
• استفاده از زیرساخت قدرتمند
• برنامهریزی برای ایجاد کلاسترهای عظیم روی پردازندههای جدید
ادی وو، مدیرعامل علیبابا، پیشبینی میکند که با این مقیاسپذیری، توان محاسباتی و قدرت «تفکر» ماشینها در آینده میتواند تا ۱۰۰۰ برابر از هوش انسانی پیشی بگیرد.
نقشه راه جاهطلبانه علیبابا: توسعه مدلهای Qwen تا ۱۰ تریلیون پارامتر و زیرساختهای نوین
📊 Data➕Science
شرکت علیبابا از برنامههای توسعهای جسورانهای برای آینده مدلهای زبانی خود رونمایی کرد. طبق گزارش رویترز، این شرکت در حال آموزش مدل Qwen 4 است و قصد دارد نسلهای بعدی یعنی Qwen 4.5 و Qwen 5 را تا مقیاس ۱۰ تریلیون پارامتر توسعه دهد.
مهمترین نکات این نقشه راه عبارتند از:
• تمرکز بر خوداصلاحی بازگشتی: مدلها نقاط ضعف خود را شناسایی کرده، آزمایش طراحی میکنند و دادههای لازم برای آموزش نسل بعدی خود را تولید میکنند.
• استفاده از زیرساخت قدرتمند
M890 برای استنتاج مدلهای بالای ۲ تریلیون پارامتر که در حال حاضر تنها در اختیار تعداد محدودی از شرکتهای پیشرو جهان است.• برنامهریزی برای ایجاد کلاسترهای عظیم روی پردازندههای جدید
V900 با قابلیت اتصال ۵۰۰ هزار شتابدهنده به یکدیگر.ادی وو، مدیرعامل علیبابا، پیشبینی میکند که با این مقیاسپذیری، توان محاسباتی و قدرت «تفکر» ماشینها در آینده میتواند تا ۱۰۰۰ برابر از هوش انسانی پیشی بگیرد.
نقشه راه جاهطلبانه علیبابا: توسعه مدلهای Qwen تا ۱۰ تریلیون پارامتر و زیرساختهای نوین
📊 Data➕Science