🔍 مدل‌های چندوجهی چگونه «فکر» می‌کنند؟ رمزگشایی از فضای معنایی مشترک

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا مدل‌های هوش مصنوعی که همزمان متن و تصویر را پردازش می‌کنند (UMMs)، واقعاً از یک فضای درک واحد استفاده می‌کنند؟ محققان در مطالعه جدید خود با روشی به نام «هدایت بین‌شاخه ای» (Cross-branch Steering) به این سوال پاسخ داده‌اند.

نتایج نشان می‌دهد که اگرچه معماری این مدل‌ها یکی است، اما درک معنایی آن‌ها لزوماً یکپارچه نیست. جالب اینجاست که دستورات معنایی که برای درک مدل طراحی شده‌اند، می‌توانند باعث بهبود چشمگیر در تولید تصاویر شوند، اما مسیر برعکس چندان موثر نیست! این یعنی مدل‌های ما هنوز در هماهنگ‌سازیِ بین «فهمیدن» و «ساختن» فاصله دارند. 🎨🤖

این تحقیق گام بزرگی برای کنترل‌پذیری بهتر مدل‌های تولید تصویر و درک عمیق‌تر از نحوه عملکرد آن‌هاست.

‌های_چندوجهی

منبع: arXiv Computer Vision