🧠 هوش مصنوعی و چالش «توصیفات بصری»؛ چرا توصیفات مدل‌های زبانی همیشه دقیق نیستند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله‌ی اخیر خود به یک چالش مهم در مدل‌های بینایی-زبانی (مثل CLIP) پی برده‌اند: مدل‌های زبانی (LLM) برای توصیف کلاس‌ها، تمایل دارند مفاهیم کلی (مثلاً رنگ قرمز برای توت‌فرنگی) را بدون توجه به ویژگی‌های واقعی تصویر (مثلاً وقتی توت‌فرنگی در یک نقاشی خطی بی‌رنگ است) بیان کنند. این باعث می‌شود مدل در مواجهه با تغییرات داده‌ها دچار خطا شود.

راهکار جدید؟ انتخاب ویژگی‌ها مستقیماً از دلِ تصاویرِ مجموعه داده، نه فقط از نام کلاس‌ها! این متد جدید نه تنها دقت مدل را به شکل قابل توجهی افزایش داده، بلکه بسیار سریع‌تر از روش‌های کلاسیک (مثل CoOp) عمل می‌کند و در عین حال یک خلاصه‌ی قابل درک از ویژگی‌های کلیدی داده‌ها ارائه می‌دهد. این گامی بزرگ برای هوشمندتر شدن درک بصری ماشین‌هاست. 🚀✨

منبع: arXiv AI