محققان در مقالهای تازه، روشی خلاقانه برای بهبود درک بصری مدلهای هوش مصنوعی (MLLMs) ارائه دادهاند. مدلهای فعلی معمولاً برای تمرکز روی جزئیات تصویر از «باکسهای کادربندی» (Bounding Boxes) استفاده میکنند که گاهی نویز و اطلاعات غیرضروری محیط را هم با خود میآورند.
تکنیک جدید «SegAnswer» با جایگزین کردن این باکسها با «ماسکهای قطعهبندی پیکسلی» (Pixel-level Segmentation Masks)، دقت مدل را به شدت افزایش داده است. این کار باعث میشود هوش مصنوعی فقط روی سوژه اصلی متمرکز شود و جزئیات دقیقتری را درک کند. نتایج نشان میدهد این روش علاوه بر کاهش توهمات بصری (Hallucination)، در استدلالهای چندوجهی عملکرد بسیار بهتری دارد.
یک قدم دیگر برای دقیقتر شدن هوش مصنوعی در تحلیل تصاویر پیچیده! 🖼️✨
منبع: arXiv AI
