دنیای تشخیص تصاویر جعلی (Deepfake) در حال حاضر بین سرویسهای تجاری، مدلهای زبانی-تصویری (VLM) و مدلهای متنباز تقسیم شده است. اما مشکل کجاست؟ تا امروز استاندارد واحدی برای مقایسه عملکرد این سیستمها وجود نداشت!
محققان با ارائه بنچمارک «VendorBench-100» این خلاء را پر کردهاند. این پژوهش با بررسی ۳۶ مدل مختلف روی ۱۰۰ تصویر چالشبرانگیز (از فیسسواپ گرفته تا تصاویر تولیدی هوش مصنوعی)، نتایج جالبی داشته است:
✅ سرویسهای تجاری فعلاً در صدر عملکرد هستند.
✅ مدلهای متنباز همچنان رقبای سرسختی برای مدلهای بزرگ محسوب میشوند.
✅ بین «توانایی رتبهبندی» و «کیفیت عملکرد واقعی» تفاوت معناداری وجود دارد که نباید نادیده گرفته شود.
این بنچمارک قدم بزرگی برای ارزیابی واقعی ابزارهای امنیتی در برابر فریبهای هوش مصنوعی است. نظر شما چیست؟ آیا میتوانیم به ابزارهای تشخیص دیپفیک اعتماد کامل داشته باشیم؟
منبع: arXiv AI
