تا به حال فکر کردهاید که هوش مصنوعی چگونه میتواند اشیاء را در ویدیوها نه فقط دنبال کند، بلکه «معنای» حرکت آنها را بفهمد؟
محققان به تازگی گام بزرگی در این زمینه برداشتهاند. فریمورک جدیدی به نام LLMTrack معرفی شده که مفهوم «ردیابی چند شیء» (SMOT) را از یک کار هندسی خشک، به یک فرآیند استدلال چندوجهی (Generative Reasoning) تبدیل میکند.
ویژگیهای کلیدی این دستاورد:
✅ معرفی Grand-SMOT: یک بنچمارک بزرگ برای آموزش هوش مصنوعی جهت درک بهتر محیطهای پیچیده و پرتردد.
✅ حل مشکل توهم زمانی: با استفاده از یک ماژول همجوشی فضا-زمانی، این مدل میتواند توالیهای طولانی ویدیو را بدون خطا پردازش کند.
✅ درک محیطی: مدل دیگر فقط اشیاء را دنبال نمیکند، بلکه رابطه آنها با محیط اطراف را نیز درک میکند!
این پیشرفت یعنی در آینده نزدیک، هوش مصنوعی در خودروهای خودران یا سیستمهای نظارتی، بسیار باهوشتر و دقیقتر عمل خواهد کرد.
منبع: arXiv AI
