محققان در مقالهای جدید، روشی نوآورانه برای ارزیابی رفتارهای مدلهای زبانی (LLM) ارائه کردهاند. به جای پرسشنامههای ساده، آنها از «آزمونهای قضاوت موقعیتی» (SJT) استفاده کردهاند تا ببینند آیا شخصیت یا همان «تمایلات رفتاری» مدلها در شرایط مختلف ثابت میماند یا خیر.
نتایج این تحقیق نشان میدهد که میتوان با استفاده از تئوریهای روانسنجی، ساختار رفتاری مدلهای هوش مصنوعی را دقیقتر از گذشته اندازهگیری کرد. این پیشرفت به ما کمک میکند تا بفهمیم مدلها در دنیای واقعی چطور رفتار میکنند و چقدر میتوان به ثبات پاسخهای آنها اعتماد کرد.
منبع: arXiv
منبع: arXiv AI
