مدلهای چندوجهی (UMMs) که متن و تصویر را همزمان درک میکنند، حالا با یک چالش بزرگ در یادگیری تقویتشده (RL) روبرو هستند. محققان برای حل این مشکل، فریمورک جدیدی به نام BRAID معرفی کردهاند.
💡 چرا BRAID مهم است؟
در مدلهای فعلی، یادگیری تقویتشده عمدتاً روی بخش متنی متمرکز است، اما BRAID با تبدیل استدلالهای «متن-تصویر-متن» به یک فرایند تصمیمگیری واحد (MDP)، اجازه میدهد که بهینهسازی بهصورت همزمان روی متن و تصویر انجام شود.
این یعنی مدل میتواند درک دقیقتری از روابط پیچیده فضایی و بینایی داشته باشد و در استدلالهای چندمرحلهای، بسیار هوشمندتر عمل کند. این دستاورد جدید، راه را برای مدلهای بصری-زبانی دقیقتر هموار میکند.
منبع: arXiv AI
