🚀 پایان توهم در هوش مصنوعی؛ معرفی روش خلاقانه FADE

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های بینایی-زبانی (LVLM) با وجود توانمندی‌های فوق‌العاده، هنوز یک نقطه ضعف بزرگ دارند: «توهم» یا همان تولید محتوای نامرتبط با تصویر! 🖼️

محققان در پژوهشی جدید، ریشه این مشکل را شناسایی کردند. آن‌ها متوجه شدند که لایه‌های FFN در مدل‌ها، گاهی دانش قبلی زبانی را به جای اطلاعاتِ بصریِ داخل تصویر، اولویت می‌دهند.

راهکار جدید آن‌ها یعنی FADE، بدون نیاز به آموزش مجدد مدل، خروجی این لایه‌ها را کنترل می‌کند تا هوش مصنوعی دقت بیشتری روی تصاویر داشته باشد و کمتر دچار اشتباه شود. این یعنی مدل‌های بینایی-زبانی دقیق‌تر و هوشمندتر از همیشه! 🧠✨

منبع: arXiv AI