تا به حال برایتان پیش آمده که بخواهید از یک ویدیوی بسیار طولانی، دقیقاً لحظه مورد نظرتان را پیدا کنید؟ محققان در یک پژوهش جدید، روش هوشمندانهای به نام ToolMerge را معرفی کردهاند که کار را برای مدلهای هوش مصنوعی بسیار آسانتر کرده است.
در این روش، مدل زبانی (LLM) پرسش کاربر را به زیرمجموعههای کوچکتر تقسیم کرده و با استفاده از «فراخوانی ابزارها» (Tool Calls)، فریمهای کلیدی ویدیو را استخراج میکند. این رویکرد نه تنها دقت پاسخگویی به سوالات ویدیویی را بالا برده، بلکه عملکرد بازیابی کپشنها را نیز تا ۵ درصد نسبت به روشهای قبلی بهبود داده است.
این ابزار میتواند تحول بزرگی در تحلیل و جستجوی ویدیویی ایجاد کند. 🎬🤖
منبع: arXiv:2605.23826
منبع: arXiv Computer Vision
