مدلهای چندوجهی بزرگ (ULMM) معمولاً برای استدلال، تصاویر کامل تولید میکنند که باعث اتلاف منابع و پردازشهای سنگین میشود. حالا محققان مدل جدیدی به نام «DeltaV» معرفی کردهاند که این بازی را تغییر داده است!
ویژگیهای کلیدی DeltaV:
🔹 جایگزینی تصاویر کامل با «بهروزرسانیهای بصری» (Visual Updates) برای حذف دادههای تکراری.
🔹 استفاده از مسیریاب هوشمند TSIM برای مدیریت دقیق توکنها.
🔹 بهبود ۳.۳ درصدی در استدلال چندوجهی و کاهش چشمگیر توکنهای تولیدی.
🔹 انتشار دیتاست عظیم «StructCoT» با بیش از ۱ میلیون نمونه برای آموزش مدلهای دقیقتر.
این مدل نشان میدهد که هوش مصنوعی چطور با هوشمندی بیشتر و صرف انرژی کمتر، به نتایج خیرهکنندهتری در پردازش تصاویر و متن میرسد. آینده مدلهای چندوجهی در بهینهسازی است! 🤖💡
منبع: arXiv Computer Vision
