محققان در پژوهشی جدید، رویکرد ردیابی چند-شیء (SMOT) را از محدودیتهای هندسی فراتر برده و به دنیای مدلهای زبانی چندوجهی (MLLM) وارد کردهاند.
🔹 نکات کلیدی این دستاورد:
• معرفی بنچمارک Grand-SMOT برای درک عمیقتر از صحنههای ویدیویی پیچیده.
• ابداع چارچوب LLMTrack که مسیرهای هندسی را به توکنهای معنایی تبدیل میکند.
• حل مشکل توهمات زمانی در ردیابیهای طولانیمدت با مکانیزم «Macro-Understanding-First».
این پیشرفت یعنی هوش مصنوعی حالا نه تنها میداند شیء کجاست، بلکه درک بهتری از رفتار و محیط آن دارد! 🤖💡
منبع: arXiv AI
