محققان در تازهترین مقاله خود، چارچوب نوآورانه «Claim-Level Rubric Rewards» یا به اختصار CuRe را معرفی کردهاند که انقلابی در یادگیری تقویتی برای تولید کپشنهای ویدئویی است.
مشکل اصلی مدلهای فعلی، وابستگی بیش از حد به متون مرجع یا کلیگویی است که باعث توهم یا عدم دقت واقعی در توصیف ویدیو میشود. اما CuRe با تجزیه کپشنها به «ادعاهای اتمی» (Atomic Claims) و ارزیابی دقیق هر بخش بر اساس یک ساختار مشخص، خروجیهای بسیار دقیقتر و قابلاعتمادتری ایجاد میکند.
این یعنی در آینده نزدیک، مدلهای هوش مصنوعی میتوانند ویدیوها را با درک عمیقتر و اشتباهات بسیار کمتر توصیف کنند! 🎥✨
منبع: arXiv Computer Vision
