🔍 چرا مدل‌های بینایی-زبانی (VLM) در ویرایش تصویر دچار خطا می‌شوند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله جدیدی به بررسی یک چالش کلیدی در مدل‌های VLM پرداخته‌اند. اگرچه این مدل‌ها درک بصری فوق‌العاده‌ای دارند، اما وقتی به عنوان «کدگذار شرطی» (Condition Encoder) در سیستم‌های ویرایش تصویر به کار می‌روند، دقت خود را در صحنه‌های پیچیده از دست می‌دهند. 🖼️

تیم پژوهشی با معرفی متد جدیدی به نام «Analysis-by-Proxy»، متوجه شدند که دانش فضایی مدل در لایه‌های میانی نهفته است، اما به درستی به لایه‌هایی که برای ویرایش استفاده می‌شوند، منتقل نمی‌شود. این کشف مهم می‌تواند راه را برای نسل جدیدی از ابزارهای ویرایش تصویر با دقت بسیار بالاتر هموار کند. 🚀

منبع: arXiv AI