محققان در مطالعه جدید خود به چالش «نابینایی دانهای» (Grain Blindness) در مدلهای زبانی چندوجهی (MLLM) پرداختهاند؛ مشکلی که باعث میشود مدلها در درک جزئیات ظریفِ پرسشهای پیچیده ناتوان باشند.
فریمورک جدید ELVA با استفاده از یادگیری تقویتی (RL) و پاداشهای قاعدهمند، به مدل یاد میدهد که تفاوتهای دقیق بین دادههای مثبت و منفی را بهتر درک کند. این روش بدون نیاز به برچسبگذاری دستی پیچیده، کیفیت بازیابی اطلاعات (Retrieval) را به طرز چشمگیری بهبود میبخشد. 🚀
منبع: arXiv AI
