محققان در مقاله جدیدی، فریمورک نوآورانه «Perception-RFT» را معرفی کردهاند که انقلابی در پاسخگویی به سوالات متنی-تصویری (Multimodal QA) ایجاد میکند. 📄
نکته جالب اینجاست: مدلهای فعلی برای تحلیل اسناد، وقت زیادی را صرف «استدلالهای متنی» میکنند که هزینهبر و کند است. این روش جدید با حذف واسطههای غیرضروری و تمرکز مستقیم بر درک بصری، باعث شده:
✅ طول توکنهای پردازشی تا ۶۰٪ کاهش یابد.
✅ سرعت و دقت مدل در درک ساختار اسناد بهشدت بهبود پیدا کند.
✅ مدلهای سبک (مثل Qwen3-VL-4B) کارآمدتر از مدلهای سنگینِ دارای استدلال عمل کنند.
این یعنی هوش مصنوعی در آینده بسیار سریعتر و هوشمندتر با فایلها و اسناد ما کار خواهد کرد! 🤖💡
منبع: arXiv Machine Learning
