تا به حال برایتان پیش آمده که یک مدل هوش مصنوعی در درکِ توالی رویدادها یا موقعیت اشیاء در یک ویدیو اشتباه کند؟ مشکل اینجاست که مدلهای فعلی، بدون تحلیلِ دقیق، مستقیماً سراغ کپشننویسی میروند.
محققان در مقاله جدیدی، مدل «PercepCap» را معرفی کردهاند که این روند را تغییر میدهد! این مدل قبل از نوشتنِ متنِ نهایی، ابتدا یک «ردپای ادراکی» (Perception Trace) ایجاد میکند؛ یعنی دقیقاً تحلیل میکند که چه شیئی کجا حرکت میکند و چه زمانی رویدادها رخ میدهند.
این رویکرد دو مرحلهای (درک و سپس توصیف) باعث میشود کپشنهای تولید شده نه تنها دقیقتر باشند، بلکه هوش مصنوعی هم بتواند استدلال خود را پشت هر جمله نشان دهد. پیشرفت بزرگی برای ویدیوهای آموزشی و سیستمهای نظارتی هوشمند! 🚀
منبع: arXiv Computer Vision
