محققان ابزار جدیدی به نام PReSS طراحی کردهاند که به طور خودکار بررسی میکند مدلهای بزرگ زبانی (LLM) تا چه حد در ابراز عقاید سیاسیشان «ثبات» دارند. این پژوهش نشان میدهد که یک مدل ممکن است در حالت کلی متمایل به یک جریان سیاسی باشد، اما در موضوعات خاص رفتارهای کاملاً متفاوتی از خود نشان دهد!
این فریمورک با دستهبندی پاسخها به چهار گروه (چپ یا راستِ پایدار و ناپایدار)، به توسعهدهندگان کمک میکند تا درک دقیقتری از سوگیریهای مدلها داشته باشند و برای اصلاح یا همسوسازی بهتر آنها تصمیم بگیرند. در واقع، این مطالعه ثابت میکند که مواضع «ناپایدار» مدلها با آموزش یا پرامپتهای مهندسیشده راحتتر تغییر میکنند، در حالی که مواضع «پایدار» سرسختانه باقی میمانند.
این تحقیق گام مهمی برای شفافیت بیشتر و کاهش سوگیریهای ناخواسته در هوش مصنوعی است. 🤖⚖️
منبع: arXiv NLP
