تا امروز، مدلهای بینایی-زبانی (VLM) در تحلیل مفاهیم پیچیده از روی مجموعهای از تصاویر ضعیف بودند و به جای استدلال، اغلب دچار سوگیری میشدند. اما محققان با معرفی چارچوب جدیدی به نام VICIS، این مشکل را هدف قرار دادهاند.
این مدل جدید به هوش مصنوعی کمک میکند تا با دیدن چند تصویر به عنوان «زمینه» (Context)، مفهوم مشترک میان آنها را درک کرده و آن را در تصاویر جدید پیاده کند. این یعنی گامی بزرگ برای رسیدن به مدلهایی که هوشمندانهتر و خلاقانهتر از همیشه محیط پیرامون را درک میکنند. ✨
منبع: arXiv Computer Vision
