دسته: arXiv Computer Vision (cs.CV)
-
🚀 پیشرفت در تشخیص ناهنجاریها؛ معرفی مدل هوشمند CL-Anomaly
محققان در یک دستاورد جدید، چارچوب نوآورانهای به نام CL-Anomaly را برای ارتقای مدلهای زبانی-بینایی (MLLM) در تشخیص ناهنجاری (Anomaly Detection) معرفی کردهاند. این…
-
🌐 تحولی در درک اسناد چندزبانه؛ معرفی بنچمارک عظیم MORE
مدلهای زبانی-بینایی (VLMs) ادعا میکنند که صدها زبان را میفهمند، اما برای اثبات این ادعا در اسناد پیچیده، همیشه با کمبود دادههای مرجع روبرو…
-
✨ خداحافظی با بازتابهای مزاحم در عکسها با هوش مصنوعی ReLo-IRR! 📸
حتماً برای شما هم پیش آمده که پشت شیشه پنجره یا سطوح براق عکسی گرفتهاید و بازتاب نور یا محیط، کیفیت تصویر را خراب…
-
🚀 هوش مصنوعی در جستجوی پاسخ؛ معرفی VSeek برای درک بهتر ویدیوهای طولانی
تحلیل ویدیوهای طولانی همیشه یکی از چالشهای بزرگ مدلهای بینایی-زبانی بوده است. حالا چارچوب جدیدی به نام VSeek معرفی شده که به جای تماشای…
-
🔓 آسیبپذیری جدید در مدلهای بینایی-زبانی: روشی خطرناک برای دور زدن فیلترها!
محققان به تازگی تکنیک جدیدی برای «جیلبریک» (Jailbreak) کردن مدلهای بزرگ بینایی-زبانی (LVLMs) کشف کردهاند. این روش با نام «Overloading»، با ترکیب دادههای متنی…
-
🚀 ارتقای هوشمند مدلهای دیفیوژن با روش جدید EMA 🎨
محققان در مقاله جدیدی به بررسی ساختار درونی مدلهای دیفیوژن (DiTs) پرداختند و متوجه شدند که «فعالسازیهای عظیم» (Massive Activations) نقش کلیدی در جزئیات…
-
🤖 تخمین سهبعدی حرکات بدن با استفاده از امواج وایفای!
محققان در یک دستاورد جدید، روش نوآورانهای به نام RePos را معرفی کردهاند که میتواند بدون نیاز به دوربین و فقط با تحلیل سیگنالهای…
-
🚀 بهینهسازی هوش مصنوعی روی دستگاههای ضعیف؛ معرفی متد جدید برای یادگیری در لحظه
آیا میشود مدلهای هوش مصنوعی پیچیده را روی گوشی یا دستگاههای کوچک بدون نیاز به سختافزارهای سنگین آموزش داد؟ محققان در یک دستاورد تازه،…
-
🤖 راهنمای هوشمند در لحظه؛ معرفی بنچمارک جدید GuideMe برای مربیان مجازی
تا حالا به این فکر کردید که چقدر تا داشتن یک «مربی هوشمند» که در لحظه کارهای شما را ببیند و اشتباهاتتان را تصحیح…
-
🔍 تشخیص اشیاء در دنیای باز؛ بدون نیاز به دادههای قدیمی!
محققان در مطالعهای جدید، فریمورک نوآورانه REAL-OW را معرفی کردهاند که تحولی در حوزه «تشخیص اشیاء در دنیای باز» (Open-World Object Detection) ایجاد میکند.…