محققان روش نوآورانهای به نام UCOB را برای بهبود عملکرد «ایجنتی» (Agentic) مدلهای هوش مصنوعی معرفی کردند. یکی از چالشهای اصلی مدلهای عاملمحور، استفاده نادرست از مهارتهای ذخیرهشده است که گاهی باعث گمراهی مدل میشود.
این فریمورک با استفاده از یادگیری «خود-تقطیر دوطرفه» (Bidirectional Self-Distillation)، به مدل یاد میدهد تا چگونه مهارتها را ارزیابی کرده، موارد مفید را درونیسازی کند و از تصمیمات گمراهکننده پرهیز کند. نتایج آزمایشها روی پلتفرمهایی مثل ALFWorld نشان میدهد که UCOB میتواند تا ۱۸ الی ۲۳ واحد عملکرد مدلها را نسبت به روشهای فعلی بهبود ببخشد.
این دستاورد گامی مهم برای داشتن ایجنتهای هوشمندتر و قابلاعتمادتر در دنیای واقعی است. برای بررسی کدها میتوانید به گیتهاب پروژه سر بزنید. 💻
منبع: arXiv AI
