تا به حال فکر کردهاید که مدلهای چندوجهی (Multimodal) هنگام استدلال، چقدر از ابزارهایی مثل طرحهای اولیه یا تصاویر میانی استفاده میکنند؟ محققان در مقاله جدیدی با معرفی چارچوب «See2Think»، این موضوع را به چالش کشیدهاند.
نتایج جالب است: مدلها در انتخاب عملیات بصری خوب عمل میکنند، اما «رندرینگ» یا نمایش دقیق این مراحل، هنوز پاشنه آشیل آنهاست! این یعنی هوش مصنوعی در مسیر استدلال بصری هنوز جای کار زیاد دارد تا بتواند از بازخوردهای بصری به درستی برای افزایش دقت استفاده کند.
مطالعه این تحقیق برای کسانی که به معماری مدلهای بینایی-زبانی علاقه دارند، بسیار جذاب است.
منبع: arXiv AI
