محققان در یک پژوهش تازه نشان دادند که مدلهای زبانی زمانی که علاوه بر متن، با تصاویر (Visual Grounding) آموزش میبینند، درک بسیار دقیقتری از مفاهیم پیدا میکنند. این رویکرد که مشابه یادگیری نوزادان است، به مدلهای زبانی کمک میکند تا شباهتهای معنایی بین زبانهای مختلف (مثل انگلیسی و اسپانیایی) را بهتر درک کنند. هرچند این متد برای مفاهیم انتزاعی هنوز جای کار دارد، اما راه را برای ایجاد مدلهای هوش مصنوعی چندزبانه و چندحسی بازتر کرده است. 🌍✨
منبع: arXiv NLP
