مدلهای تولید تصویر فعلی در پردازش جزئیات عمومی عالی هستند، اما وقتی صحبت از موضوعات بهروز، شخصیتهای خاص یا وقایع فراتر از دادههای آموزشیشان میشود، دچار «توهم» میشوند.
محققان در مقاله جدیدی به بررسی این مشکل پرداخته و مفهوم «Agentic Visual Generation» (تولید تصویر عاملمحور) را مطرح کردهاند. آنها با معرفی فریمورک SearchGen و بنچمارک اختصاصی آن، نشان دادند که مدلها چطور میتوانند به جای تکیه صرف بر حافظه، با استفاده از ابزارهای جستجو، دانش خود را بهروز کنند.
این تحقیق نشان میدهد که مرز بین «آنچه مدل میداند» و «آنچه باید جستجو کند» قابل کشف است و میتواند راه را برای نسل بعدی هوش مصنوعیهای بصری هموار کند که به جای حدس زدن، واقعیت را میجویند! 🔍✨
منبع: arXiv AI
