یکی از مشکلات رایج در مدلهای Visual Grounding (هوش مصنوعی که اشیاء را در تصاویر بر اساس متن پیدا میکند)، این است که مدل گاهی مفهومِ زبان را به بخش اشتباهی از تصویر نسبت میدهد. محققان به تازگی مدل جدیدی به نام HKVLM ارائه دادهاند که بدون نیاز به آموزش مجددِ مدلهای سنگین، دقت تطبیق متن و منطقه (Query-Region Alignment) را به شدت افزایش میدهد.
این ابزار با استفاده از یک مکانیزم بازرسی هوشمند، به مدل اجازه میدهد در صورتی که نتواند منطقه دقیق را پیدا کند، «اعلام عدم قطعیت» کند؛ این کار باعث میشود توهمات (Hallucinations) مدل در شناسایی اشیاء به حداقل برسد. گام مهمی در دقتِ بینایی کامپیوتر بدون اتلاف منابع سنگین پردازشی! 🧠✨
منبع: arXiv Computer Vision
