دانشمندان راهکار جدیدی برای بهبود مدلهای تولید ویدیو معرفی کردهاند. یکی از مشکلات اصلی در آموزش مدلهای هوش مصنوعی (مخصوصاً با روش GRPO)، پدیدهای به نام «قانون گودهارت» است؛ جایی که مدل به جای یادگیری کیفیت واقعی، صرفاً یاد میگیرد چطور امتیازهای سیستم پاداش را «هک» کند تا نمره بالاتری بگیرد.
مدل جدیدی به نام TaRoS این مشکل را حل کرده است. این سیستم با هوشمندی پاداشها را مدیریت میکند تا مدل در دام میانبرهای اشتباه نیفتد و خروجیهای ویدیویی واقعیتر، با حرکتهای نرمتر و هماهنگی دقیقتر با متن تولید کند. این یعنی ویدیوهای هوش مصنوعی یک قدم دیگر به واقعگرایی نزدیکتر شدند! ✨
منبع: arXiv Computer Vision
