تا حالا فکر کردید مدلهای هوش مصنوعی (MLLMs) چطور همزمان متن و تصویر را پردازش میکنند؟ محققان در یک پژوهش جدید، دقیقاً زیر ذرهبین بردهاند که این مدلها در هر لحظه (Token) به چه چیزی «توجه» میکنند. 🧠
این مطالعه نشان میدهد که مدلها برای پاسخدهی دقیق، مدام بین تصویر و متن سوئیچ میکنند و اگر این تمرکز مختل شود، پاسخهای اشتباه میدهند. خبر خوب اینکه آنها روشی ابداع کردهاند که با مداخله در لحظه، باعث افزایش دقت مدل در درک درست مدالیته (تصویر یا متن) میشود. این یعنی هوش مصنوعی در آینده، هوشمندتر و دقیقتر از قبل عمل خواهد کرد! 🚀
منبع: arXiv AI
