🕵️‍♂️ شناسایی دیپ‌فیک‌ها چقدر قابل اعتماد است؟ معرفی بنچمارک جدید VendorBench-100

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

دنیای تشخیص تصاویر جعلی (Deepfake) در حال حاضر بین سرویس‌های تجاری، مدل‌های زبانی-تصویری (VLM) و مدل‌های متن‌باز تقسیم شده است. اما مشکل کجاست؟ تا امروز استاندارد واحدی برای مقایسه عملکرد این سیستم‌ها وجود نداشت!

محققان با ارائه بنچمارک «VendorBench-100» این خلاء را پر کرده‌اند. این پژوهش با بررسی ۳۶ مدل مختلف روی ۱۰۰ تصویر چالش‌برانگیز (از فیس‌سواپ گرفته تا تصاویر تولیدی هوش مصنوعی)، نتایج جالبی داشته است:

✅ سرویس‌های تجاری فعلاً در صدر عملکرد هستند.
✅ مدل‌های متن‌باز همچنان رقبای سرسختی برای مدل‌های بزرگ محسوب می‌شوند.
✅ بین «توانایی رتبه‌بندی» و «کیفیت عملکرد واقعی» تفاوت معناداری وجود دارد که نباید نادیده گرفته شود.

این بنچمارک قدم بزرگی برای ارزیابی واقعی ابزارهای امنیتی در برابر فریب‌های هوش مصنوعی است. نظر شما چیست؟ آیا می‌توانیم به ابزارهای تشخیص دیپ‌فیک اعتماد کامل داشته باشیم؟

منبع: arXiv AI