محققان در پژوهشی جدید، راهکار هوشمندانهای برای بهبود تشخیص «ارزشهای انسانی» در مدلهای زبانی ارائه دادهاند. معمولاً مدلها ارزشها را بهصورت برچسبهای مستقل میبینند، اما این مقاله پیشنهاد میدهد با استفاده از «هندسه شوارتز» (Schwartz-Geometry)، مدلها را وادار کنیم روابط میان ارزشها (مثل تضاد یا همراستایی آنها) را بهتر درک کنند.
این روش که از یک «دیکودر انرژیمحور» استفاده میکند، بدون افت دقت در تشخیص، باعث میشود خروجی مدلها در درک مفاهیم اخلاقی و ارزشی بسیار منسجمتر و دقیقتر عمل کند. گامی مهم برای ساخت هوش مصنوعی که مفاهیم انسانی را عمیقتر درک میکند! ✨
منبع: arXiv AI
