🔍 چطور مدل‌های بینایی-زبانی جزئیات ریز را بهتر می‌بینند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان تکنیک جدیدی به نام «LOCUS» را معرفی کرده‌اند که مشکل اصلی مدل‌های چندوجهی (MLLM) در درک جزئیات دقیق تصاویر (Fine-grained perception) را هدف گرفته است.

گاهی مدل‌ها تصویر را می‌بینند اما چون جزئیات در میان اطلاعات اضافی گم می‌شود، دچار «پوسیدگی بافت بصری» (Visual context rot) می‌شوند. سیستم LOCUS با استفاده از یک تمرین آموزشی هوشمند، به مدل یاد می‌دهد که چگونه نشانه‌های بصری کوچک را جست‌وجو و روی شواهد کلیدی تصویر تمرکز کند. خبر خوب این است که این تغییر فقط در زمان آموزش است و برای کاربر نهایی، رابط کاربری بدون تغییر و بسیار دقیق‌تر عمل می‌کند! ✅

منبع: arXiv Computer Vision