🔍 آیا مدل‌های هوش مصنوعی واقعاً «می‌بینند»؟ کشف جدید در قلب مدل‌های چندوجهی

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تا حالا فکر کردید که مدل‌های هوش مصنوعی چطور اطلاعات رو از دلِ متن‌ها و تصاویر طولانی بیرون می‌کشن؟ محققان به‌تازگی راهکار جدیدی برای درک نحوه عملکرد «Retrieval Heads» یا همان بازوهای بازیابی اطلاعات در مدل‌های چندوجهی (Vision-Language Models) پیدا کردند.

نتایج این تحقیق نشون می‌ده که این بخش‌های خاص از مدل، کاملاً تخصصی و حیاتی هستن؛ به‌طوری که حذفِ تنها ۵٪ از این «هدها» می‌تونه دقت مدل رو در درک اسناد و تصاویر به شدت کاهش بده! این کشف نه‌تنها درک ما رو از معماریِ مدل‌های قدرتمندی مثل Qwen3-VL عمیق‌تر می‌کنه، بلکه راه رو برای ارتقای جست‌وجوی هوشمند در اسناد تصویری و ویدئویی باز می‌کنه.

پیشرفت‌های دنیای مدل‌های مولد با سرعت عجیبی داره مرزهای درک بصری رو جابه‌جا می‌کنه! 🤖💡

منبع: arXiv Computer Vision