محققان در مقاله جدیدی روشی هوشمندانه به نام «RP-OPSD» را برای بهبود مدلهای زبانی چندوجهی (Multimodal LLMs) معرفی کردهاند. این روش به مدل اجازه میدهد با استفاده از تفاوت کیفیت بین تصاویر کموضوح و باوضوح بالا، یادگیری بسیار دقیقتری داشته باشد.
نکته جذاب اینجاست که این روش نیازی به دادههای آموزشیِ انسانیِ اضافی یا مدلهای جانبی ندارد و میتواند عملکرد مدلهایی مثل Qwen3.5 را به شکل چشمگیری بهبود ببخشد؛ آن هم با سرعت آموزشی بسیار بالاتر! این یعنی گامی بلند به سوی مدلهای بینایی-زبانی کارآمدتر و دقیقتر. 🧠✨
منبع: arXiv Computer Vision
