محققان در مطالعه جدیدی نشان دادهاند که مدلهای زبانی (LLMs) اگر در محیطی چندوجهی (ترکیب متن و تصویر) آموزش ببینند، عملکرد بسیار بهتری دارند. درست مثل انسانها که در کودکی با دیدن محیط اطراف زبان را یاد میگیرند، این مدلها نیز با بهرهگیری از «زمینه بصری»، درک عمیقتری پیدا میکنند.
نتایج این تحقیق ثابت کرده که حتی اگر در زمان تست، تصویر یا متن بصری حذف شود، مدل همچنان دقت بالاتری نسبت به مدلهای صرفاً متنی دارد. این رویکرد که با تئوری «شناختِ موقعیتی» همخوانی دارد، مسیر جدیدی برای آموزش هوش مصنوعی باز کرده است! 🚀
منبع: arXiv NLP
