🔍 مدل‌های هوش مصنوعی چقدر واقعاً به تصاویر واسط تکیه می‌کنند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تا به حال فکر کرده‌اید که مدل‌های چندوجهی (Multimodal) هنگام استدلال، چقدر از ابزارهایی مثل طرح‌های اولیه یا تصاویر میانی استفاده می‌کنند؟ محققان در مقاله جدیدی با معرفی چارچوب «See2Think»، این موضوع را به چالش کشیده‌اند.

نتایج جالب است: مدل‌ها در انتخاب عملیات بصری خوب عمل می‌کنند، اما «رندرینگ» یا نمایش دقیق این مراحل، هنوز پاشنه آشیل آن‌هاست! این یعنی هوش مصنوعی در مسیر استدلال بصری هنوز جای کار زیاد دارد تا بتواند از بازخوردهای بصری به درستی برای افزایش دقت استفاده کند.

مطالعه این تحقیق برای کسانی که به معماری مدل‌های بینایی-زبانی علاقه دارند، بسیار جذاب است.

منبع: arXiv AI