هوش مصنوعی و علم داده به فارسی
6.06K subscribers
2.07K photos
510 videos
365 files
2.25K links
DataPlusScience | هوش مصنوعی و علم داده به فارسی
اخبار، تحلیل، آموزش و ابزارهای کاربردی

🌐 DataPlusScience.ir

📩 ارتباط با ما: @Contact2Mebot

📂 کانال فایل‌ها: @Datascientists_Files

💎 بله: ble.ir/dataplusscience

💡 ایتا: eitaa.com/DataPlusScience
Download Telegram
‏📊 تغییرات سبک نگارش در مدل Fable 5.1

‏تیم Arena.ai با تحلیل ده‌ها هزار خروجی متنی، تغییرات سبک نگارش مدل جدید Fable 5.1 را نسبت به نسخه قبلی بررسی کرده است. این مدل اکنون پاسخ‌هایی طبیعی‌تر، منسجم‌تر و با لحنی پخته‌تر ارائه می‌دهد.

‏مهم‌ترین تغییرات نگارشی این مدل عبارتند از:

‏• کاهش عبارات تاییدی و تعارفی: استفاده از کلمات توافقی مانند "yes" حدود ۵۸٪ و عبارات صمیمانه مثل "honestly" نزدیک به ۴۵٪ کمتر شده است.
‏• پاسخ‌های طولانی‌تر: میانه طول پاسخ‌ها با ۳۰٪ افزایش، از ۳۱۹ به ۴۱۴ کلمه رسیده است.
‏• کاهش کلمات احتیاطی و تکراری: استفاده از واژه‌های تردیدآمیز مانند "perhaps" حدود ۳۶٪ و عبارات کلیشه‌ای و تکراری ۲۰٪ کاهش یافته است.
‏• تغییر در علائم نگارشی: استفاده از نقطه-ویرگول (semicolon) حدود ۶۳٪ افزایش و خط تیره (em dash) ۳۲٪ کاهش داشته است.

تحلیل دقیق تغییرات سبک نگارش در مدل هوش مصنوعی Fable 5.1

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Fable_5_1 #Text_Arena
‏🤖 ارزیابی مدل‌های زبانی بزرگ: قضاوت AI با ترجیح به خود

‏مطالعه‌ای جدید نشان می‌دهد مدل‌های زبانی بزرگ (LLM) در قضاوت درباره پاسخ‌ها، تمایل زیادی به ترجیح دادن پاسخ‌های خودشان دارند. در آزمایشی که ۱۲ مدل روی ۱۴۶۰ نبرد متنی (Text Arena battles) انجام شد، مشخص گردید که مدل‌ها به طور متوسط ۷۰٪ بیشتر از انسان‌ها، پاسخ خودشان را بهتر انتخاب می‌کنند.

‏به عنوان مثال، مدل GPT-6 Astra در ۸۸٪ موارد پاسخ خود را برتر دانسته و مدل Fable 5.1 در ۷۲٪ نبردها همین رویکرد را داشته است. این پدیده در مدل‌های شرکت‌های بزرگ مانند OpenAI و Anthropic مشهودتر است. در مقابل، مدل‌هایی چون GLM 5.3، Gemini 3.8 Flash و Grok 4.6 به نتایج نزدیک‌تری به ارزیابی انسانی دست یافتند.

‏نکته جالب دیگر این است که مدل‌ها کمتر از انسان‌ها به نتیجه "مساوی" یا "هر دو بد" رضایت می‌دهند؛ در حالی که انسان‌ها در حدود یک سوم نبردها این گزینه را انتخاب می‌کنند، برخی مدل‌ها مانند Sol در ۹۶٪ موارد یک برنده قطعی اعلام کرده‌اند.

🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما


#LLM_as_a_judge #Text_Arena