محققان بهتازگی بنچمارک جدیدی به نام SLAPBench معرفی کردهاند که عملکرد مدلهای زبانی چندوجهی (MLLM) را در شناسایی اثر انگشت چهار انگشتی (SLAP) به چالش میکشد. این کار برای حوزههای حساس مثل کنترل مرزها و امنیت بسیار حیاتی است.
نتایج بررسی مدلهای قدرتمندی مثل Claude Opus 4.8 و مدلهای سری Qwen نشان میدهد که اگرچه این مدلها در کارهای عمومی هوشمندند، اما در مواجهه با دادههای بیومتریک، گاهی دچار خطاهای جدی میشوند. این پژوهش نشان میدهد که نحوه «پرامپتنویسی» و «امتیازدهی شباهت» چقدر در دقت نهایی این مدلها تأثیرگذار است. 🧬🛡️
منبع: arXiv AI
