محققان در پژوهشی جدید به سراغ بررسی عملکرد مدلهای هوش مصنوعی در بازیهای دونفره (Zero-sum games) رفتهاند. آنها متوجه یک تفاوت کوچک اما مهم در رفتار مدل R-NaD در بازی «پوکر کوهن» شده بودند که به آن «سایه انحنا» میگفتند.
این تیم علمی موفق شد با یک فرمول ریاضی دقیق نشان دهد که این فاصله، یک خطای واقعی نیست، بلکه یک «Artifact» یا اثر جانبی قابل پیشبینی است. در واقع، آنها ثابت کردند که با تنظیم دقیق پارامترهای یادگیری، این فاصله میتواند به صفر میل کند. این دستاورد گام مهمی در درک بهترِ رفتارِ مدلهای یادگیری تقویتشده در محیطهای استراتژیک است. 📊🤖
ها
منبع: arXiv AI
