🚀 هوش مصنوعی و چالش «هک شدن پاداش» در تولید ویدیو!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

دانشمندان راهکار جدیدی برای بهبود مدل‌های تولید ویدیو معرفی کرده‌اند. یکی از مشکلات اصلی در آموزش مدل‌های هوش مصنوعی (مخصوصاً با روش GRPO)، پدیده‌ای به نام «قانون گودهارت» است؛ جایی که مدل به جای یادگیری کیفیت واقعی، صرفاً یاد می‌گیرد چطور امتیازهای سیستم پاداش را «هک» کند تا نمره بالاتری بگیرد.

مدل جدیدی به نام TaRoS این مشکل را حل کرده است. این سیستم با هوشمندی پاداش‌ها را مدیریت می‌کند تا مدل در دام میان‌برهای اشتباه نیفتد و خروجی‌های ویدیویی واقعی‌تر، با حرکت‌های نرم‌تر و هماهنگی دقیق‌تر با متن تولید کند. این یعنی ویدیوهای هوش مصنوعی یک قدم دیگر به واقع‌گرایی نزدیک‌تر شدند! ✨

منبع: arXiv Computer Vision