🤖 ظهور رقیب اقتصادی با مدل DeepSeek V4 Flash 0731
در حالی که غولهای تکنولوژی برای دسترسی به مدلهای پیشرفته مبالغ سنگینی دریافت میکنند، شرکت چینی دیپسیک با عرضه DeepSeek V4 Flash 0731 استراتژی بازار را تغییر داده است. این مدل جدید در پلتفرم Artificial Analysis امتیاز ۵۰ را کسب کرده که تنها یک واحد با مدلهای ردهبالای بازار فاصله دارد.
⚡ عملکرد فنی این مدل با ۲۸۴ میلیارد پارامتر و بهرهگیری از معماری MoE (مدل متشکل از متخصصان هوشمند) همراه است که تنها ۱۳ میلیارد پارامتر را در هر لحظه فعال میکند. این طراحی بهینهشده باعث شده تا مدل در مقایسه با نسخه قبلی، حدود ۱۲ درصد توکن کمتری برای خروجیهای مشابه مصرف کند.
📊 قیمتگذاری این مدل بسیار رقابتی است؛ هزینه هر میلیون توکن ورودی تنها ۰.۱۴ دلار و خروجی ۰.۲۸ دلار تعیین شده است. با استفاده از قابلیت کش، این هزینه به ۰.۰۰۲۸ دلار کاهش مییابد که نسبت به سرویسهای مشابه غربی، تا ۶۰ درصد صرفهجویی در پروژههای API به همراه دارد.
#DeepSeek_V4_Flash #Terminal_Bench
در حالی که غولهای تکنولوژی برای دسترسی به مدلهای پیشرفته مبالغ سنگینی دریافت میکنند، شرکت چینی دیپسیک با عرضه DeepSeek V4 Flash 0731 استراتژی بازار را تغییر داده است. این مدل جدید در پلتفرم Artificial Analysis امتیاز ۵۰ را کسب کرده که تنها یک واحد با مدلهای ردهبالای بازار فاصله دارد.
⚡ عملکرد فنی این مدل با ۲۸۴ میلیارد پارامتر و بهرهگیری از معماری MoE (مدل متشکل از متخصصان هوشمند) همراه است که تنها ۱۳ میلیارد پارامتر را در هر لحظه فعال میکند. این طراحی بهینهشده باعث شده تا مدل در مقایسه با نسخه قبلی، حدود ۱۲ درصد توکن کمتری برای خروجیهای مشابه مصرف کند.
📊 قیمتگذاری این مدل بسیار رقابتی است؛ هزینه هر میلیون توکن ورودی تنها ۰.۱۴ دلار و خروجی ۰.۲۸ دلار تعیین شده است. با استفاده از قابلیت کش، این هزینه به ۰.۰۰۲۸ دلار کاهش مییابد که نسبت به سرویسهای مشابه غربی، تا ۶۰ درصد صرفهجویی در پروژههای API به همراه دارد.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#DeepSeek_V4_Flash #Terminal_Bench
🚀 جهش هوش مصنوعی با استراتژی خود-ارزیابی
مدلهای متنباز اکنون به سطحی از توانایی رسیدهاند که میتوانند تعداد زیادی راهکار باکیفیت تولید کرده و خروجیهای خود را با هزینهای بسیار ناچیز ارزیابی کنند.
در یک بنچمارک اخیر بر روی Terminal-Bench 2.1، مدل
مهمترین نکات این روش:
• افزایش دقت مدل از ۷۹٪ به ۸۸٪ تنها با نمونهبرداری از ۵ راهکار.
• استفاده از خود مدل به عنوان داور (LLM-as-a-Verifier) برای رتبهبندی خروجیها.
• صرفه اقتصادی بالا در مقایسه با مدلهای بسته و تجاری.
این رویکرد نشان میدهد که چگونه ترکیب هوشمندانه استراتژیهای ارزیابی میتواند کارایی مدلهای فعلی را بدون نیاز به آموزش مجدد سنگین، ارتقا دهد.
#DeepSeek_V4_Flash #Terminal_Bench
مدلهای متنباز اکنون به سطحی از توانایی رسیدهاند که میتوانند تعداد زیادی راهکار باکیفیت تولید کرده و خروجیهای خود را با هزینهای بسیار ناچیز ارزیابی کنند.
در یک بنچمارک اخیر بر روی Terminal-Bench 2.1، مدل
DeepSeek V4 Flash موفق شد با استفاده از تکنیک خود-ارزیابی، عملکردی بهتر از Claude Fable 5 داشته باشد. نکته قابل توجه این است که این روش نه تنها دقت را به شکل چشمگیری افزایش میدهد، بلکه هزینههای اجرا را تا ۱۱ برابر کاهش میدهد.مهمترین نکات این روش:
• افزایش دقت مدل از ۷۹٪ به ۸۸٪ تنها با نمونهبرداری از ۵ راهکار.
• استفاده از خود مدل به عنوان داور (LLM-as-a-Verifier) برای رتبهبندی خروجیها.
• صرفه اقتصادی بالا در مقایسه با مدلهای بسته و تجاری.
این رویکرد نشان میدهد که چگونه ترکیب هوشمندانه استراتژیهای ارزیابی میتواند کارایی مدلهای فعلی را بدون نیاز به آموزش مجدد سنگین، ارتقا دهد.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#DeepSeek_V4_Flash #Terminal_Bench
هوش مصنوعی و علم داده به فارسی
🚀 معرفی مدل قدرتمند Claude Opus 5.5 شرکت Anthropic از جدیدترین پرچمدار خود یعنی Claude Opus 5.5 رونمایی کرد. این مدل نه تنها نسبت به نسل قبل هوشمندتر شده، بلکه با سرعت بالاتر و هزینهای بهمراتب کمتر در دسترس کاربران قرار گرفته است. مهمترین ویژگیهای…
🚀 تحلیل جامع مدل هوشمند Opus 5.5
نسخه جدید Opus 5.5 معرفی شد و عملکردی خیرهکننده در محیطهای توسعه و کدنویسی به نمایش گذاشته است. این مدل توانسته در بنچمارکهای تخصصی نظیر Terminal-Bench و Cursor-Bench، رقبای قدرتمندی مانند Fable 5.1 و Astra را پشت سر بگذارد.
مهمترین ویژگیهای این نسخه جدید عبارتند از:
- بهینهسازی هزینه: کاهش قیمت ورودی و خروجی به ترتیب به ۴ و ۲۰ دلار، همراه با مصرف کمتر توکن در پردازشها.
- سرعت بالاتر: افزایش ۳۰ درصدی سرعت تولید پاسخ نسبت به نسل قبلی.
- ارتقای هوشمندی: ارائه مکالمات طبیعیتر و فرمتبندی دقیقتر خروجیها.
- عملکرد در بنچمارک: بر اساس دادههای Terminal-Bench 4.0، این مدل در تمامی سطوح تلاش (از Low تا Max) بالاترین دقت و امتیاز را نسبت به مدلهایی چون GPT-6 Astra و Fable 5.1 کسب کرده است.
- تغییرات اشتراک: افزایش سقف محدودیتهای زمانی برای کاربران Pro و Max به همراه یک قابلیت Reset اضافه برای تمامی مشترکین.
معرفی Opus 5.5؛ عملکرد خیرهکننده در کدنویسی و بهینهسازی هزینهها
#Opus_5 #Terminal_Bench
نسخه جدید Opus 5.5 معرفی شد و عملکردی خیرهکننده در محیطهای توسعه و کدنویسی به نمایش گذاشته است. این مدل توانسته در بنچمارکهای تخصصی نظیر Terminal-Bench و Cursor-Bench، رقبای قدرتمندی مانند Fable 5.1 و Astra را پشت سر بگذارد.
مهمترین ویژگیهای این نسخه جدید عبارتند از:
- بهینهسازی هزینه: کاهش قیمت ورودی و خروجی به ترتیب به ۴ و ۲۰ دلار، همراه با مصرف کمتر توکن در پردازشها.
- سرعت بالاتر: افزایش ۳۰ درصدی سرعت تولید پاسخ نسبت به نسل قبلی.
- ارتقای هوشمندی: ارائه مکالمات طبیعیتر و فرمتبندی دقیقتر خروجیها.
- عملکرد در بنچمارک: بر اساس دادههای Terminal-Bench 4.0، این مدل در تمامی سطوح تلاش (از Low تا Max) بالاترین دقت و امتیاز را نسبت به مدلهایی چون GPT-6 Astra و Fable 5.1 کسب کرده است.
- تغییرات اشتراک: افزایش سقف محدودیتهای زمانی برای کاربران Pro و Max به همراه یک قابلیت Reset اضافه برای تمامی مشترکین.
معرفی Opus 5.5؛ عملکرد خیرهکننده در کدنویسی و بهینهسازی هزینهها
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Opus_5 #Terminal_Bench
🤖 عرضه مدل جدید Claude 3.5 Sonnet
شرکت Anthropic نسخه جدید مدل Claude 3.5 Sonnet را با تمرکز بر تواناییهای برنامهنویسی و انجام وظایف عاملی (agentic tasks) منتشر کرد.
ویژگیهای فنی و بهبودهای این نسخه عبارتند از:
- افزایش ۳۰ درصدی سرعت در پردازشها.
- کاهش ۳۰ درصدی هزینهها به ازای هر تسک.
- کسب امتیاز ۷۰.۶ درصد در بنچمارک Terminal-Bench 4.0.
- عملکرد ۵۵.۵ درصدی در CursorBench 4.0 که به مدل قدرتمندتر Opus 3.5 نزدیک است.
- بهبود چشمگیر در مدیریت کدهای طولانی، پردازش تصاویر و تحلیل اسناد و جداول.
در بخش برنامهنویسی، این مدل با کاهش تعداد فراخوانی ابزارها و مراحل کمتر برای تکمیل وظایف، کارایی بالاتری نسبت به نسل قبلی ارائه میدهد.
هزینه استفاده از API این مدل برای ورودی ۲ دلار و برای خروجی ۱۰ دلار به ازای هر میلیون توکن تعیین شده است. مدل جدید هماکنون از طریق وبسایت Claude، API اختصاصی و پلتفرمهای ابری AWS، Google Cloud و Azure در دسترس کاربران قرار دارد.
#Claude_3_5_Sonnet #Terminal_Bench
شرکت Anthropic نسخه جدید مدل Claude 3.5 Sonnet را با تمرکز بر تواناییهای برنامهنویسی و انجام وظایف عاملی (agentic tasks) منتشر کرد.
ویژگیهای فنی و بهبودهای این نسخه عبارتند از:
- افزایش ۳۰ درصدی سرعت در پردازشها.
- کاهش ۳۰ درصدی هزینهها به ازای هر تسک.
- کسب امتیاز ۷۰.۶ درصد در بنچمارک Terminal-Bench 4.0.
- عملکرد ۵۵.۵ درصدی در CursorBench 4.0 که به مدل قدرتمندتر Opus 3.5 نزدیک است.
- بهبود چشمگیر در مدیریت کدهای طولانی، پردازش تصاویر و تحلیل اسناد و جداول.
در بخش برنامهنویسی، این مدل با کاهش تعداد فراخوانی ابزارها و مراحل کمتر برای تکمیل وظایف، کارایی بالاتری نسبت به نسل قبلی ارائه میدهد.
هزینه استفاده از API این مدل برای ورودی ۲ دلار و برای خروجی ۱۰ دلار به ازای هر میلیون توکن تعیین شده است. مدل جدید هماکنون از طریق وبسایت Claude، API اختصاصی و پلتفرمهای ابری AWS، Google Cloud و Azure در دسترس کاربران قرار دارد.
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
#Claude_3_5_Sonnet #Terminal_Bench