دسته: arXiv Computer Vision (cs.CV)
-
👗 انقلابی در طراحی لباس با هوش مصنوعی: معرفی Fashion-3DLR
دنیای مد و فشن در حال تجربهی تحولی بزرگ است! محققان بهتازگی مدل هوشمند «Fashion-3DLR» را معرفی کردهاند که میتواند مدلهای سهبعدی لباس را…
-
🚀 بهینهسازی انقلابی برای مدلهای چندوجهی (OmniLLM) با OmniScope
تا حالا دقت کردید که در مدلهای چندوجهی (مثل ویدیو و صدا)، چقدر حجم دادهها سنگینه؟ محققان بهتازگی راهکار جذابی به نام «OmniScope» رو…
-
📜 غلبه بر محدودیت متون طولانی در هوش مصنوعی: معرفی یک راهکار جدید و کارآمد
تا حالا دقت کردید که مدلهای تشخیص متن در تصاویر (Scene Text Recognition) با نوشتههای خیلی طولانی مشکل دارند؟ اکثر این مدلها فقط برای…
-
🚀 ردیابی دقیقتر پهپادها با هوش مصنوعی: معرفی CMRTrack! 🚁
محققان در پژوهشی جدید، مدل هوشمند «CMRTrack» را برای بهبود ردیابی پهپادها در تصاویر مادون قرمز معرفی کردهاند. یکی از بزرگترین چالشهای این حوزه،…
-
🦴 تشخیص هوشمند رشد استخوان با سیستم BoneAgeTW2
محققان در یک دستاورد جدید، ابزار متنباز و قدرتمندی به نام BoneAgeTW2 را معرفی کردهاند که میتواند فرایند دشوار و زمانبر ارزیابی بلوغ اسکلتی…
-
🔍 ارزیابی دقیقترِ کپشنهای هوش مصنوعی بدون نیاز به دادههای مرجع!
تا به حال فکر کردهاید که چطور میتوان کیفیت کپشنهای تولید شده توسط هوش مصنوعی برای تصاویر را بدون تکیه بر دادههای انسانی ارزیابی…
-
🛰 تحول در تحلیل دادههای ماهوارهای با مدل SARATR-X-v2
محققان در پژوهشی جدید، مدل قدرتمندی برای پیشآموزش مدلهای بنیادی در دادههای SAR (رادار دهانه ترکیبی) معرفی کردهاند که تحولی در این حوزه ایجاد…
-
🎥 خداحافظی با کندی در پردازش ویدیوهای طولانی!
مدلهای بزرگ بینایی-زبانی (LVLMs) معمولاً به خاطر پردازش حجم سنگینی از توکنهای ویدیویی، بسیار کند هستند. اما محققان به تازگی از راهکار جدیدی به…
-
🔍 چرا CLIP «نفی» (Negation) را نمیفهمد؟ معرفی PeakPatch!
آیا تا به حال دقت کردید که مدلهای بینایی-زبانی مثل CLIP در درک جملات منفی (مثل «سگی وجود ندارد») ضعف دارند؟ محققان در یک…
-
💡 معمای «درهای بسته» در مدلهای زبانی-تصویری (VLM)
تا حالا فکر کردید چرا مدلهای هوش مصنوعی گاهی با وجود داشتن مسیرهای کمکی، از آنها استفاده نمیکنند؟ محققان در پژوهش جدیدی با بررسی…