محققان در مطالعه جدیدی به بررسی این پرداختهاند که مدلهای هوش مصنوعی (مانند Qwen2.5-VL و InternVL3) هنگام استفاده از تکنیک Chain-of-Thought (CoT)، چگونه از تصاویر استفاده میکنند.
نکته کلیدی اینجاست: بر خلاف تصور، استفاده از CoT لزوماً به این معنی نیست که مدل تا انتهای تولید پاسخ، نیاز به «دیدن» مداوم تصویر دارد. در واقع، این مدلها بخش عمدهای از استدلال خود را بر اساس دادههای بصری که در همان مراحل اولیه استخراج کردهاند، پیش میبرند و CoT بیشتر به جای دسترسی طولانیتر به تصویر، به تقویت پردازش زبانی روی اطلاعات استخراج شده کمک میکند.
این کشف جدید به توسعهدهندگان کمک میکند تا درک بهتری از محدودیتهای استدلالی مدلهای بینایی-زبانی داشته باشند و سیستمهای بهینهتری طراحی کنند.
منبع: arXiv AI
