🤖 داوری علمی با هوش مصنوعی؛ کدام دستورالعمل‌ها بهتر جواب می‌دهند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

همانطور که دنیای علم با حجم عظیم مقالات روبروست، استفاده از هوش مصنوعی برای «داوری همتا» (Peer Review) بیش از پیش ضرورت پیدا کرده است.

محققان در یک پژوهش جدید، تأثیر دستورالعمل‌های مختلف بر کیفیت داوریِ خودکار توسط LLMها را بررسی کردند:

✅ نتیجه جالب: استفاده از دستورالعمل‌های رسمی کنفرانس‌های علمی (Official Guidelines) بیشترین هماهنگی را با قضاوت داوران انسانی دارد.

❌ برخلاف انتظار، سعی در «تقلیدِ» سبکِ داوران انسانی توسط مدل، عملکرد ضعیف‌تری نشان داد.

💡 نکته کلیدی: وادار کردن مدل به امتیازدهی‌های سخت‌گیرانه و فرمولی، دقت کار را پایین می‌آورد و اجازه دادن به مدل برای تحلیلِ کیفی و کل‌نگر، نتایج بسیار بهتری به همراه دارد.

این تحقیق نشان می‌دهد برای خودکارسازی فرآیندهای علمی، باید به جای تقلید کورکورانه از انسان، استانداردهای علمیِ تدوین شده را در اولویت قرار داد.

منبع: arXiv NLP