محققان روشی نوآورانه به نام «تنظیم پرامپت درونمتنی» (ICPT) معرفی کردهاند که به مدلهای بزرگ بینایی-زبانی (LVLM) اجازه میدهد بدون نیاز به آموزشهای سنگین در زمان استنتاج، مفاهیم جدید و خاص کاربر را به سرعت یاد بگیرند.
این مدل با استفاده از یک ماژول سبک و تکنیکهای هندسی هوشمند، نه تنها درک دقیقتری از تصاویر چندگانه پیدا میکند، بلکه تداخلهای محیطی را حذف کرده و دقت مدل را در تشخیص مفاهیم پیچیده به طرز چشمگیری افزایش میدهد. این گامی بزرگ برای کاربردیتر شدن هوش مصنوعی در محیطهای واقعی است! 🧠✨
منبع: arXiv Computer Vision
