مدلهای زبانی چندوجهی (MLLM) تا امروز برای استدلال، از زنجیره افکار متنی استفاده میکردند که هم کند است و هم محدودیتهای زبانی دارد. اما حالا چارچوب جدیدی به نام CoLT معرفی شده که به مدل اجازه میدهد به جای کلمات طولانی، از «زنجیره افکار نهفته» (Latent Thoughts) برای استدلال استفاده کند.
ویژگیهای کلیدی این دستاورد:
🔹 افزایش چشمگیر سرعت استدلال (تنها در ۳ مرحله)
🔹 جایگزینی کلمات و متون verbose با نمایشهای نهفته و فشرده
🔹 استفاده از یک دیکدر جانبی برای نظارت دقیق بر روند استدلال در حین آموزش که در زمان اجرا حذف میشود تا کارایی حفظ شود.
این یعنی مدلهای هوش مصنوعی در آینده میتوانند بسیار سریعتر و هوشمندتر، مسائل پیچیده بصری و منطقی را حل کنند! 🧠✨
منبع: arXiv Computer Vision
