🤖 تحلیل نرخ توهم در مدلهای زبانی بزرگ
📊 بنچمارک جدیدی از پلتفرم Artificial Analysis منتشر شده که عملکرد ۴۶۱ مدل هوش مصنوعی را از نظر نرخ توهم (Hallucination Rate) بررسی میکند. این شاخص، میزان تکرار پاسخهای نادرست مدل در موقعیتهایی که باید به «نمیدانم» اعتراف میکرد را اندازهگیری میکند.
⚡ نتایج بسیار تأملبرانگیز است و تفاوت عملکرد فاحشی میان مدلها دیده میشود. در صدر لیست، مدل Command A+ با تنها ۱۴٪ نرخ توهم بهترین عملکرد را دارد و پس از آن MiniMax-M3 با ۱۶٪ در رتبه دوم جای گرفته است.
🧠 برخلاف تصورات رایج، بسیاری از مدلهای مشهور در نیمه پایین جدول قرار دارند. مدلهای Claude 5 با ۳۷٪ و نسخههای مختلف Claude Opus تا ۵۰٪ خطا در این ارزیابی دیده میشوند. در انتهای لیست، مدلهای GPT-5.6 و برخی نسخههای DeepSeek با نرخ خطای خیرهکننده ۸۰٪ تا ۹۰٪ بیشترین میزان توهم را نشان دادهاند.
#MiniMax_M3 #Hallucination_Rate
📊 بنچمارک جدیدی از پلتفرم Artificial Analysis منتشر شده که عملکرد ۴۶۱ مدل هوش مصنوعی را از نظر نرخ توهم (Hallucination Rate) بررسی میکند. این شاخص، میزان تکرار پاسخهای نادرست مدل در موقعیتهایی که باید به «نمیدانم» اعتراف میکرد را اندازهگیری میکند.
⚡ نتایج بسیار تأملبرانگیز است و تفاوت عملکرد فاحشی میان مدلها دیده میشود. در صدر لیست، مدل Command A+ با تنها ۱۴٪ نرخ توهم بهترین عملکرد را دارد و پس از آن MiniMax-M3 با ۱۶٪ در رتبه دوم جای گرفته است.
🧠 برخلاف تصورات رایج، بسیاری از مدلهای مشهور در نیمه پایین جدول قرار دارند. مدلهای Claude 5 با ۳۷٪ و نسخههای مختلف Claude Opus تا ۵۰٪ خطا در این ارزیابی دیده میشوند. در انتهای لیست، مدلهای GPT-5.6 و برخی نسخههای DeepSeek با نرخ خطای خیرهکننده ۸۰٪ تا ۹۰٪ بیشترین میزان توهم را نشان دادهاند.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#MiniMax_M3 #Hallucination_Rate