تا حالا فکر کردید که مدلهای هوش مصنوعی چطور اطلاعات رو از دلِ متنها و تصاویر طولانی بیرون میکشن؟ محققان بهتازگی راهکار جدیدی برای درک نحوه عملکرد «Retrieval Heads» یا همان بازوهای بازیابی اطلاعات در مدلهای چندوجهی (Vision-Language Models) پیدا کردند.
نتایج این تحقیق نشون میده که این بخشهای خاص از مدل، کاملاً تخصصی و حیاتی هستن؛ بهطوری که حذفِ تنها ۵٪ از این «هدها» میتونه دقت مدل رو در درک اسناد و تصاویر به شدت کاهش بده! این کشف نهتنها درک ما رو از معماریِ مدلهای قدرتمندی مثل Qwen3-VL عمیقتر میکنه، بلکه راه رو برای ارتقای جستوجوی هوشمند در اسناد تصویری و ویدئویی باز میکنه.
پیشرفتهای دنیای مدلهای مولد با سرعت عجیبی داره مرزهای درک بصری رو جابهجا میکنه! 🤖💡
منبع: arXiv Computer Vision
