محققان در مقاله جدیدی به بررسی یک مشکل جالب در سیستمهای چندعاملی (Multi-Agent) پرداختهاند: «عدالت زمانی در بازیهای تکرارشونده».
مشکل اینجاست که معیارهای فعلی، تفاوت بین «نوبتدهی عادلانه» و «انحصار منابع» را به خوبی تشخیص نمیدهند. آنها متوجه شدند که حتی مدلهای پیشرفته Q-learning هم در شرایط رقابتی، در برقراری یک نوبتدهی منظم (مانند سیستم راند-رابین) به شدت شکست میخورند و عملکردی بدتر از استراتژیهای تصادفی دارند!
این تحقیق با معرفی معیارهای جدید (ALT)، راهکاری برای سنجش بهتر عدالت در رفتارهای هوش مصنوعی ارائه میدهد که میتواند در سیستمهای توزیع منابع در آینده بسیار حیاتی باشد.
منبع: arXiv Machine Learning
