دسته: arXiv Computer Vision (cs.CV)
-
🛡️ آسیبپذیری هوش مصنوعی در خودروهای خودران: خطر مسمومسازی دادهها!
آیا هوش مصنوعی خودروهای خودران واقعاً امن است؟ محققان در پژوهش جدیدی نشان دادند که حتی با وجود تکنیکهای پیشرفته «افزایش داده» (Data Augmentation)،…
-
🤖 تحول در رباتیک با Lift3D-VLA: درک سهبعدی برای انجام کارهای پیچیده
مدلهای VLA (بینایی-زبان-عمل) در حال حاضر در درک محیط قوی هستند، اما برای تعامل واقعی با دنیای فیزیکی، نیاز به «درک هندسی» دارند. مدل…
-
🧠 ارتقای دقت در طبقهبندی سلسلهمراتبی با مدل جدید LHT
آیا هوش مصنوعی میتواند اشیاء را مثل انسان در دستهبندیهای دقیق و چندلایه (مثل گونه و خانواده در طبیعت) شناسایی کند؟ محققان بهتازگی فریمورک…
-
🎥 انقلاب در تولید ویدیو و آواتارهای هوشمند؛ نگاهی به تکنولوژیهای Talking Head
تولید ویدیوهایی که در آن چهرهها به شکلی کاملاً طبیعی صحبت میکنند، این روزها به سرعت در حال پیشرفت است. محققان در یک پژوهش…
-
🔍 کشف تقارن در دنیای سهبعدی؛ معرفی فریمورک SymCL
تشخیص تقارن در اشیاء سهبعدی یکی از چالشهای بزرگ در بینایی ماشین است که در کارهایی مثل بازسازی مدلها و گرافیک کاربرد زیادی دارد.…
-
🛰️ تکامل سنجش از دور با ایجنتهای هوشمند؛ معرفی RS-Agent
مدلهای زبانی چندوجهی (MLLM) تا پیش از این در تحلیل دادههای پیچیده ماهوارهای دچار محدودیتهایی بودند، اما حالا با ظهور RS-Agent، بازی تغییر کرده…
-
🏗️ بازسازی دقیقتر سطوح سهبعدی با متد جدید NumGrad-Pull
تکنولوژی بازسازی سطوح از روی ابر نقاط (Point Clouds) گام بزرگی رو به جلو برداشت! محققان به تازگی از مدل جدیدی به نام NumGrad-Pull…
-
🔍 تشخیص دقیقتر ناهنجاریهای صنعتی با هوش مصنوعی چندوجهی!
محققان در پژوهشی جدید، متد نوآورانهای به نام TRD (Tuned Reverse Distillation) معرفی کردهاند که تحولی در تشخیص نقصهای صنعتی ایجاد میکند. مشکل روشهای…
-
🧠 آیا مدلهای هوش مصنوعی واقعاً میبینند؟ معرفی ZeroBench برای سنجش قدرت استدلال بصری
مدلهای چندوجهی (LMM) هرچند در بنچمارکهای فعلی امتیازهای بالایی میگیرند، اما در مواجهه با مفاهیم ساده بصری گاهی ضعیفتر از کودکان یا حتی حیوانات…
-
🎨 خداحافظی با نویزهای مزاحم در تصاویر با مدل جدید Freqformer!
تا حالا شده بخواهید یک عکس قدیمی یا اسکن شده را بازسازی کنید اما با الگوهای مزاحمِ «موار» (Moiré) مواجه شوید؟ این الگوها که…