🚀 دقت در هدف‌گیری بصری؛ معرفی IoUPD برای مدل‌های زبانی چندوجهی 🤖👁️

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های زبانی بزرگ چندوجهی معمولاً برای تشخیص اشیاء در تصاویر، مختصات را به صورت متن تولید می‌کنند. اما یک مشکل بزرگ وجود دارد: تفاوت بین نحوه آموزش این مدل‌ها و معیارهای سنجش کیفیت (IoU).

محققان در پژوهش جدیدی، تکنیک IoUPD را معرفی کرده‌اند که با استفاده از «تقطیر دانش» (Distillation) به هوش مصنوعی یاد می‌دهد چطور با دقت بسیار بالاتری مختصات را تشخیص دهد. این روش باعث می‌شود مدل بدون نیاز به ابزارهای جانبی در زمان اجرا، خروجی‌های بسیار دقیق‌تری در تحلیل بصری ارائه دهد. گامی مهم برای هوشمندتر شدن سیستم‌های بینایی ماشین! 🧠✨

منبع: arXiv Computer Vision