مدلهای زبانی بزرگ چندوجهی معمولاً برای تشخیص اشیاء در تصاویر، مختصات را به صورت متن تولید میکنند. اما یک مشکل بزرگ وجود دارد: تفاوت بین نحوه آموزش این مدلها و معیارهای سنجش کیفیت (IoU).
محققان در پژوهش جدیدی، تکنیک IoUPD را معرفی کردهاند که با استفاده از «تقطیر دانش» (Distillation) به هوش مصنوعی یاد میدهد چطور با دقت بسیار بالاتری مختصات را تشخیص دهد. این روش باعث میشود مدل بدون نیاز به ابزارهای جانبی در زمان اجرا، خروجیهای بسیار دقیقتری در تحلیل بصری ارائه دهد. گامی مهم برای هوشمندتر شدن سیستمهای بینایی ماشین! 🧠✨
منبع: arXiv Computer Vision
