همانطور که دنیای علم با حجم عظیم مقالات روبروست، استفاده از هوش مصنوعی برای «داوری همتا» (Peer Review) بیش از پیش ضرورت پیدا کرده است.
محققان در یک پژوهش جدید، تأثیر دستورالعملهای مختلف بر کیفیت داوریِ خودکار توسط LLMها را بررسی کردند:
✅ نتیجه جالب: استفاده از دستورالعملهای رسمی کنفرانسهای علمی (Official Guidelines) بیشترین هماهنگی را با قضاوت داوران انسانی دارد.
❌ برخلاف انتظار، سعی در «تقلیدِ» سبکِ داوران انسانی توسط مدل، عملکرد ضعیفتری نشان داد.
💡 نکته کلیدی: وادار کردن مدل به امتیازدهیهای سختگیرانه و فرمولی، دقت کار را پایین میآورد و اجازه دادن به مدل برای تحلیلِ کیفی و کلنگر، نتایج بسیار بهتری به همراه دارد.
این تحقیق نشان میدهد برای خودکارسازی فرآیندهای علمی، باید به جای تقلید کورکورانه از انسان، استانداردهای علمیِ تدوین شده را در اولویت قرار داد.
منبع: arXiv NLP


