دسته: arXiv Computer Vision (cs.CV)
-
🚀 انقلابی در نقشهبرداری و درک بصری رباتها با DINO-SLAM!
محققان در مقاله جدیدی از مدل هوشمند DINO-SLAM رونمایی کردند که هدفش ارتقای درک رباتها از محیط سهبعدی است. این سیستم با ترکیب ویژگیهای…
-
📍 هوشمندتر از همیشه: تعیین موقعیت دقیق در فضای سهبعدی با GSVisLoc
تکنولوژی Gaussian Splatting (3DGS) که این روزها دنیای گرافیک و بینایی ماشین رو متحول کرده، حالا با معرفی متد جدید «GSVisLoc» دقیقتر شده است!…
-
📍 تحول در نقشهبرداری شهری با هوش مصنوعی: معرفی MapAnything
محققان ابزار جدیدی به نام MapAnything معرفی کردهاند که میتواند با استفاده از تنها یک تصویر دوبعدی (مونوکولار)، مختصات سهبعدی دقیق اشیاء شهری را…
-
🚀 جهشی جدید در مدلهای چندوجهی: معرفی Lavida-O! 🤖
محققان مدل هوشمند جدیدی به نام Lavida-O را معرفی کردهاند که مرزهای فهم و تولید محتوا را جابهجا کرده است. این مدل برخلاف نمونههای…
-
🚨 حفره امنیتی جدید در مدلهای بینایی-زبانی (LVLM) با روش TokenSwap
محققان متد جدیدی به نام «TokenSwap» را شناسایی کردهاند که میتواند مدلهای پیشرفته بینایی-زبانی را با حملات «در پشتی» (Backdoor) هدف قرار دهد. برخلاف…
-
🚀 هوش مصنوعی و چالش «هک شدن پاداش» در تولید ویدیو!
دانشمندان راهکار جدیدی برای بهبود مدلهای تولید ویدیو معرفی کردهاند. یکی از مشکلات اصلی در آموزش مدلهای هوش مصنوعی (مخصوصاً با روش GRPO)، پدیدهای…
-
🔍 راز معماری ویژن ترنسفورمرها (ViT) کشف شد! 🧠
محققان در مقاله جدیدی به بررسی جالبی در مورد عملکرد Vision Transformers پرداختند. برخلاف شبکههای عصبی کانولوشنی (CNN)، مدلهای ViT به صورت پیشفرض فاقد…
-
🔍 تشخیص هوشمند خرابیهای ریلی با مدل سبک و سریع LPCAN!
محققان در مقالهای جدید، مدل هوش مصنوعی قدرتمندی به نام LPCANet را معرفی کردهاند که به طور اختصاصی برای شناسایی عیوب سطحی ریلها طراحی…
-
📸 زیبایی همیشه به معنای کارایی نیست! 🤖
آیا هوش مصنوعیهای تصویرساز برای تولید دادههای آموزشی گزینههای خوبی هستند؟ یک پژوهش جدید روی مدلهای متن به تصویر (T2I) منتشر شده که نتایج…
-
🎨 ترکیب هنر و هوش مصنوعی؛ شناسایی ترکهای تابلوهای نقاشی با مدلهای مولد
محققان در یک پژوهش جدید، از مدلهای هوش مصنوعی برای کمک به حفاظت از آثار هنری استفاده کردهاند! این مدل جدید با ترکیب روشهای…