محققان به تازگی معماری جدیدی به نام AViS-Mamba معرفی کردهاند که انقلابی در تشخیص خودکار صحنههای خشونتآمیز ایجاد میکند.
مشکل مدلهای فعلی این است که گاهی در محیطهای پر سروصدا یا ویدیوهای مبهم، دقت خود را از دست میدهند. در این روش نوین، «بینایی» و «شنوایی» مدل بهصورت داینامیک با هم ترکیب میشوند؛ یعنی تصویر مستقیماً نحوه پردازش صدا را کنترل میکند تا هوش مصنوعی در هر شرایطی بتواند بهترین تصمیم را بگیرد.
نتایج این تحقیق نشان میدهد که این مدل توانسته در بنچمارکهای مهم، رکوردهای جدیدی را ثبت کند و گامی بزرگ برای افزایش ایمنی در نظارتهای تصویری بردارد. 🛡️✨
منبع: arXiv AI
