📊 تغییرات سبک نگارش در مدل Fable 5.1
تیم Arena.ai با تحلیل دهها هزار خروجی متنی، تغییرات سبک نگارش مدل جدید Fable 5.1 را نسبت به نسخه قبلی بررسی کرده است. این مدل اکنون پاسخهایی طبیعیتر، منسجمتر و با لحنی پختهتر ارائه میدهد.
مهمترین تغییرات نگارشی این مدل عبارتند از:
• کاهش عبارات تاییدی و تعارفی: استفاده از کلمات توافقی مانند "yes" حدود ۵۸٪ و عبارات صمیمانه مثل "honestly" نزدیک به ۴۵٪ کمتر شده است.
• پاسخهای طولانیتر: میانه طول پاسخها با ۳۰٪ افزایش، از ۳۱۹ به ۴۱۴ کلمه رسیده است.
• کاهش کلمات احتیاطی و تکراری: استفاده از واژههای تردیدآمیز مانند "perhaps" حدود ۳۶٪ و عبارات کلیشهای و تکراری ۲۰٪ کاهش یافته است.
• تغییر در علائم نگارشی: استفاده از نقطه-ویرگول (semicolon) حدود ۶۳٪ افزایش و خط تیره (em dash) ۳۲٪ کاهش داشته است.
تحلیل دقیق تغییرات سبک نگارش در مدل هوش مصنوعی Fable 5.1
#Fable_5_1 #Text_Arena
تیم Arena.ai با تحلیل دهها هزار خروجی متنی، تغییرات سبک نگارش مدل جدید Fable 5.1 را نسبت به نسخه قبلی بررسی کرده است. این مدل اکنون پاسخهایی طبیعیتر، منسجمتر و با لحنی پختهتر ارائه میدهد.
مهمترین تغییرات نگارشی این مدل عبارتند از:
• کاهش عبارات تاییدی و تعارفی: استفاده از کلمات توافقی مانند "yes" حدود ۵۸٪ و عبارات صمیمانه مثل "honestly" نزدیک به ۴۵٪ کمتر شده است.
• پاسخهای طولانیتر: میانه طول پاسخها با ۳۰٪ افزایش، از ۳۱۹ به ۴۱۴ کلمه رسیده است.
• کاهش کلمات احتیاطی و تکراری: استفاده از واژههای تردیدآمیز مانند "perhaps" حدود ۳۶٪ و عبارات کلیشهای و تکراری ۲۰٪ کاهش یافته است.
• تغییر در علائم نگارشی: استفاده از نقطه-ویرگول (semicolon) حدود ۶۳٪ افزایش و خط تیره (em dash) ۳۲٪ کاهش داشته است.
تحلیل دقیق تغییرات سبک نگارش در مدل هوش مصنوعی Fable 5.1
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Fable_5_1 #Text_Arena
🤖 ارزیابی مدلهای زبانی بزرگ: قضاوت AI با ترجیح به خود
مطالعهای جدید نشان میدهد مدلهای زبانی بزرگ (LLM) در قضاوت درباره پاسخها، تمایل زیادی به ترجیح دادن پاسخهای خودشان دارند. در آزمایشی که ۱۲ مدل روی ۱۴۶۰ نبرد متنی (Text Arena battles) انجام شد، مشخص گردید که مدلها به طور متوسط ۷۰٪ بیشتر از انسانها، پاسخ خودشان را بهتر انتخاب میکنند.
به عنوان مثال، مدل GPT-6 Astra در ۸۸٪ موارد پاسخ خود را برتر دانسته و مدل Fable 5.1 در ۷۲٪ نبردها همین رویکرد را داشته است. این پدیده در مدلهای شرکتهای بزرگ مانند OpenAI و Anthropic مشهودتر است. در مقابل، مدلهایی چون GLM 5.3، Gemini 3.8 Flash و Grok 4.6 به نتایج نزدیکتری به ارزیابی انسانی دست یافتند.
نکته جالب دیگر این است که مدلها کمتر از انسانها به نتیجه "مساوی" یا "هر دو بد" رضایت میدهند؛ در حالی که انسانها در حدود یک سوم نبردها این گزینه را انتخاب میکنند، برخی مدلها مانند Sol در ۹۶٪ موارد یک برنده قطعی اعلام کردهاند.
#LLM_as_a_judge #Text_Arena
مطالعهای جدید نشان میدهد مدلهای زبانی بزرگ (LLM) در قضاوت درباره پاسخها، تمایل زیادی به ترجیح دادن پاسخهای خودشان دارند. در آزمایشی که ۱۲ مدل روی ۱۴۶۰ نبرد متنی (Text Arena battles) انجام شد، مشخص گردید که مدلها به طور متوسط ۷۰٪ بیشتر از انسانها، پاسخ خودشان را بهتر انتخاب میکنند.
به عنوان مثال، مدل GPT-6 Astra در ۸۸٪ موارد پاسخ خود را برتر دانسته و مدل Fable 5.1 در ۷۲٪ نبردها همین رویکرد را داشته است. این پدیده در مدلهای شرکتهای بزرگ مانند OpenAI و Anthropic مشهودتر است. در مقابل، مدلهایی چون GLM 5.3، Gemini 3.8 Flash و Grok 4.6 به نتایج نزدیکتری به ارزیابی انسانی دست یافتند.
نکته جالب دیگر این است که مدلها کمتر از انسانها به نتیجه "مساوی" یا "هر دو بد" رضایت میدهند؛ در حالی که انسانها در حدود یک سوم نبردها این گزینه را انتخاب میکنند، برخی مدلها مانند Sol در ۹۶٪ موارد یک برنده قطعی اعلام کردهاند.
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
#LLM_as_a_judge #Text_Arena