محققان در یک پژوهش جدید، راهکار پیشرفتهای به نام GMoT را برای بهبود درک مدلهای زبانی چندوجهی (MLLM) از حرکات ظریف و ریز بدن (Micro-gestures) در ویدیوها ارائه کردهاند.
مدلهای فعلی معمولاً در تشخیص حرکات سریع و بسیار کوچک به دلیل نویز پسزمینه دچار خطا میشوند، اما GMoT با استفاده از یک ماژول «توکنسازی آگاه از حرکت»، انرژی حرکتی را از ویدیو استخراج کرده و به دقت تحلیل میکند. این فناوری که بر پایه مدلهای Qwen3-VL توسعه یافته، توانسته رکوردهای جدیدی در دقت تشخیص حرکات ثبت کند و گام بزرگی در تحلیل ویدیوهای پیچیده محسوب میشود. 🤖📈
منبع: arXiv AI
