در دنیای مدلهای مولد ویدیو، با مفهوم جدیدی به نام «Thinking in Video» یا همان «تفکر در ویدیو» روبرو هستیم. اما یک سوال مهم وجود دارد: آیا مدلها واقعاً منطق جهان فیزیکی را درک میکنند یا صرفاً ظاهر تصاویر را حفظ کردهاند؟
محققان برای پاسخ به این چالش، ابزار جدیدی به نام «CGDJ» طراحی کردهاند که هوش مصنوعی را از نظر «ادراک علی» (Causal Perception) میسنجد. نتیجه تحقیقات نشان میدهد که مدلهای فعلی، حتی پیشرفتهترینهایشان، همچنان در برقراری پیوند میان «استدلال منطقی» و «تولید ویدیو» ضعفهای جدی دارند و اغلب با یک «شکاف ادراکی» روبرو هستند. این پژوهش گام بزرگی برای رسیدن به مدلهای ویدیویی است که واقعاً محیط اطراف ما را تحلیل میکنند. 🧠🎥
منبع: arXiv AI
