پژوهش جدیدی که بهتازگی در arXiv منتشر شده، چالش جالبی را در ارزیابی مدلهای زبانی بزرگ (LLM) مطرح کرده است. محققان متوجه شدند که وقتی از هوش مصنوعی میخواهیم مستقیماً درباره احتمال به اشتراکگذاری یک خبر توسط انسان پیشبینی کند، نتایج همیشه دقیق نیست!
نکته کلیدی اینجاست: مدلهای زبانی در پیشبینی «میزان اعتبار» یک مطلب عملکرد خوبی دارند، اما در پیشبینی «تمایل انسان به اشتراکگذاری» آن مطلب دچار مشکل میشوند. این یعنی سوالی که از مدل میپرسیم (نحوه پرسش) میتواند به اندازه خودِ هوش مصنوعی در خروجی نهایی تأثیرگذار باشد.
این تحقیق به ما یادآوری میکند که برای ارزیابی دقیقتر مدلها، همیشه «مستقیم پرسیدن» بهترین راه نیست و گاهی باید از مسیرهای غیرمستقیم به نتایج دقیقتری رسید. 💡
منبع: arXiv AI
