در دنیای مدلهای زبانی بزرگ (LLM)، همیشه فرض بر این بوده که ترکیب چندین مدل مختلف (Ensemble) باعث افزایش کارایی میشود. اما یک پژوهش جدید با بررسی ۳۱,۹۰۰ ترکیب از مدلهای مختلف، این باور را به چالش کشیده است!
نتایج این تحقیق نشان میدهد که بسیاری از معیارهای فعلی برای سنجش «تنوع مدلها»، در واقع فقط قابلیت (Capability) آنها را اندازهگیری میکنند و نه تنوع واقعی را. جالب است بدانید که حتی وقتی از چندین مدل به صورت همزمان استفاده میکنیم، «رأیگیری ساده» تنها در کمتر از ۱۰ درصد مواقع نسبت به بهترین مدلِ تکی، برتری واقعی نشان میدهد.
این مقاله یادآوری مهمی است که برای بهبود مدلهای هوش مصنوعی، باید با دقت بیشتری مفهوم «تنوع» و «همافزایی» را درک کنیم و فریب اعداد ظاهری را نخوریم. 🧠💡
منبع: arXiv AI
