مدلهای زبانی-تصویری (VLM) در حال حاضر پیشرفتهای زیادی داشتهاند، اما در تشخیص خطرات ایمنی محیطهای داخلی هنوز ضعفهای جدی دارند. بنچمارک جدیدی به نام TSHA با بیش از ۶۶ هزار جفت پرسش و پاسخ تخصصی طراحی شده تا هوش مصنوعی را در برابر سناریوهای پیچیده ایمنی در خانه به چالش بکشد.
این بنچمارک با استفاده از تصاویر واقعی، تصاویر تولید شده توسط AIGC و حتی ویدیوهای Sora، دقت و پایداری مدلها را در شناسایی موقعیتهای خطرناک بررسی میکند. نتایج نشان میدهد که مدلهای فعلی هنوز برای محیطهای حساسِ واقعی راه زیادی در پیش دارند.
منبع: arXiv Computer Vision
