مدلهای چندوجهی (MLLM) همیشه در جمعبندی بین دقتِ مکانیابی و قدرتِ تحلیلِ پیچیده دچار چالش بودهاند. حالا محققان متد جدیدی به نام «Motto» (Mixture-of-Thought-Tokens) را معرفی کردهاند که این شکاف را پر میکند.
ویژگیهای کلیدی این نوآوری:
🔹 استفاده از «توکنهای فکریِ مکانمحور» برای درک دقیقتر اشیاء در تصویر.
🔹 بهرهگیری از زنجیره توکنهای تطبیقی برای تحلیلهای هوشمند و متغیر.
🔹 معرفی بنچمارک جدید PR-Bench برای سنجش دقیق توانمندی مدلها در استدلال بصری.
این پیشرفت میتواند قدرت درک مدلهای هوش مصنوعی از محیط پیرامون را به سطح جدیدی برساند! 🚀
منبع: arXiv Computer Vision
