محققان در یک پژوهش جدید، رویکرد متفاوتی را برای پیوند دنیای متن و تصویر در مدلهای هوش مصنوعی پیشنهاد دادهاند. معمولاً مدلهای چندوجهی (Multimodal) تلاش میکنند ویژگیهای بصری را به فضای متن تبدیل کنند، اما «Inverse-LLaVA» برعکس این مسیر را طی میکند!
در این معماری نوآورانه، تعبیه (Embedding) متن به فضای پیوسته بصری نگاشت میشود. این کار باعث میشود مدل بدون نیاز به مراحل پیشآموزشِ (Pre-training) پیچیده و پرهزینه، به توانایی استدلال چندوجهی بالایی دست یابد. این تحقیق نشان میدهد که میتوان با کاهش وابستگی به دادههای عظیم، به بازدهی بیشتری در یادگیری رسید و راه را برای طراحیهای سبکتر و هوشمندتر در آینده هموار کرد.
این یعنی هوش مصنوعی در حال رسیدن به درک عمیقتری از پیوند میان تصویر و کلمه است. 🤖✨
منبع: arXiv AI
