محققان در مقاله جدیدی از مدل «Omni-RRM» رونمایی کردند که هدفش حل مشکل عدم هماهنگی در مدلهای زبانی چندوجهی (MLLM) است. این مدل با استفاده از سیستم «روبیک-محور» و تولید ترجیحات به صورت خودکار، میتواند سیگنالهای پاداش دقیقی در حوزههای متن، تصویر، ویدیو و صوت ارائه دهد.
✨ چرا این خبر مهم است؟
مدلهای فعلی اغلب در ارزیابیهای انسانی پرهزینه و نامنسجم هستند، اما Omni-RRM با رویکرد جدیدش در یادگیری تقویتی، توانسته است دقت خیرهکنندهای (بالای ۸۰٪ در ویدیو!) ثبت کند و نتایج بهتری نسبت به مدلهای پایه ارائه دهد.
این پیشرفت یعنی در آینده نه چندان دور، مدلهای هوش مصنوعی ما در درک محتواهای چندرسانهای بسیار دقیقتر و هوشمندتر عمل خواهند کرد.
منبع: arXiv NLP
