🚀 هوشمندتر شدن مدل‌های چندوجهی با تکنیک جدید SegAnswer! 🧠

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله‌ای تازه، روشی خلاقانه برای بهبود درک بصری مدل‌های هوش مصنوعی (MLLMs) ارائه داده‌اند. مدل‌های فعلی معمولاً برای تمرکز روی جزئیات تصویر از «باکس‌های کادر‌بندی» (Bounding Boxes) استفاده می‌کنند که گاهی نویز و اطلاعات غیرضروری محیط را هم با خود می‌آورند.

تکنیک جدید «SegAnswer» با جایگزین کردن این باکس‌ها با «ماسک‌های قطعه‌بندی پیکسلی» (Pixel-level Segmentation Masks)، دقت مدل را به شدت افزایش داده است. این کار باعث می‌شود هوش مصنوعی فقط روی سوژه اصلی متمرکز شود و جزئیات دقیق‌تری را درک کند. نتایج نشان می‌دهد این روش علاوه بر کاهش توهمات بصری (Hallucination)، در استدلال‌های چندوجهی عملکرد بسیار بهتری دارد.

یک قدم دیگر برای دقیق‌تر شدن هوش مصنوعی در تحلیل تصاویر پیچیده! 🖼️✨

منبع: arXiv AI