🧠 پل زدن میان «ادراک» و «استدلال» در مدل‌های چندوجهی با Motto

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های چندوجهی (MLLM) همیشه در جمع‌بندی بین دقتِ مکان‌یابی و قدرتِ تحلیلِ پیچیده دچار چالش بوده‌اند. حالا محققان متد جدیدی به نام «Motto» (Mixture-of-Thought-Tokens) را معرفی کرده‌اند که این شکاف را پر می‌کند.

ویژگی‌های کلیدی این نوآوری:
🔹 استفاده از «توکن‌های فکریِ مکان‌محور» برای درک دقیق‌تر اشیاء در تصویر.
🔹 بهره‌گیری از زنجیره توکن‌های تطبیقی برای تحلیل‌های هوشمند و متغیر.
🔹 معرفی بنچمارک جدید PR-Bench برای سنجش دقیق توانمندی مدل‌ها در استدلال بصری.

این پیشرفت می‌تواند قدرت درک مدل‌های هوش مصنوعی از محیط پیرامون را به سطح جدیدی برساند! 🚀

منبع: arXiv Computer Vision