محققان در پژوهش جدیدی به بررسی یک چالش کلیدی در دنیای مدلهای زبانی پرداختهاند: «صداقت مدلها». این تیم تحقیقاتی با طراحی یک بازی متنی هوشمند، متوجه شدند که نتایج ارزیابیهای هوش مصنوعی به شدت تحت تاثیر «نحوه پرسش» و «ساختار ابزار ارزیابی» است.
نکته جالب اینجاست که حتی تغییرات کوچک در تعداد گزینهها یا نحوه بیان سوال، میتواند پاسخهای مدل را بهطور قابل توجهی تغییر دهد. این یعنی برای سنجش واقعیِ هوش مصنوعی، ما نه تنها به مدلهای بهتر، بلکه به استانداردهای ارزیابی دقیقتر و علمیتری نیاز داریم که تحت تاثیر سوگیریهای ابزاری قرار نگیرند. 🤖💡
منبع: arXiv NLP
