مدلهای انتشار که امروزه در تولید تصویر میدرخشند، برای طبقهبندی تصاویر (Diffusion Classifiers) هم به کار میروند؛ اما واقعاً این مدلها چطور تصمیم میگیرند؟ 🤔
محققان در پژوهش جدیدی با معرفی بنچمارک ASOB-Bench، سوگیریهای این مدلها را در سه بخش اصلی بررسی کردند:
1️⃣ پیوند ویژگیها (Attribute Binding): بررسی دقت در اتصال مفاهیم به تصاویر.
2️⃣ سوگیری اندازه-ترتیب: چالش مدل در اولویتبندی اشیاء.
3️⃣ وابستگی به پسزمینه: نشان داد که این مدلها گاهی بیش از حد روی پسزمینه تمرکز کرده و سوژه اصلی را نادیده میگیرند.
این تحقیق نشان میدهد که اگرچه مدلهای انتشار در برخی زمینهها از مدلهای بینایی-زبانی مرسوم (مثل OpenCLIP) دقیقتر عمل میکنند، اما همچنان در تشخیص جزئیات دچار خطاهای جالبی میشوند. بررسی این ضعفها به ما کمک میکند مدلهای هوش مصنوعی دقیقتر و قابلاعتمادتری بسازیم! 🚀
منبع: arXiv AI
