🔍 چقدر به «ثبات مواضع» مدل‌های زبانی اعتماد داریم؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان ابزار جدیدی به نام PReSS طراحی کرده‌اند که به طور خودکار بررسی می‌کند مدل‌های بزرگ زبانی (LLM) تا چه حد در ابراز عقاید سیاسی‌شان «ثبات» دارند. این پژوهش نشان می‌دهد که یک مدل ممکن است در حالت کلی متمایل به یک جریان سیاسی باشد، اما در موضوعات خاص رفتارهای کاملاً متفاوتی از خود نشان دهد!

این فریم‌ورک با دسته‌بندی پاسخ‌ها به چهار گروه (چپ یا راستِ پایدار و ناپایدار)، به توسعه‌دهندگان کمک می‌کند تا درک دقیق‌تری از سوگیری‌های مدل‌ها داشته باشند و برای اصلاح یا همسوسازی بهتر آن‌ها تصمیم بگیرند. در واقع، این مطالعه ثابت می‌کند که مواضع «ناپایدار» مدل‌ها با آموزش یا پرامپت‌های مهندسی‌شده راحت‌تر تغییر می‌کنند، در حالی که مواضع «پایدار» سرسختانه باقی می‌مانند.

این تحقیق گام مهمی برای شفافیت بیشتر و کاهش سوگیری‌های ناخواسته در هوش مصنوعی است. 🤖⚖️

منبع: arXiv NLP