دسته: arXiv Computer Vision (cs.CV)
-
📊 انقلابی در آموزش مدلهای بینایی-زبانی (VLM) با متد DecoupleMix!
محققان در مقالهای جدید، رویکردی هوشمندانه به نام «DecoupleMix» را برای بهینهسازی دادههای آموزشی معرفی کردهاند. این روش به جای تکیه بر حدس و…
-
🎬 تحول در ویرایش هوشمند ویدیوهای اولشخص با EgoPlay
آیا تا به حال به این فکر کردهاید که هوش مصنوعی بتواند فقط در لحظات خاصی از یک ویدیو (مثلاً وقتی چیزی میخورید یا…
-
🎥 عبور از گلوگاه پردازش ویدیوها با مدلهای هوش مصنوعی!
حتماً میدانید که تحلیل ویدیوهای طولانی توسط مدلهای زبانی چندوجهی (MLLM) به دلیل محدودیت پردازش فریمها، همیشه یک چالش بزرگ بوده است. محققان به…
-
🧠 هوشمندتر کردن درک ویدیوهای طولانی با CADER!
دانشمندان یک چارچوب جدید به نام CADER (مخفف Confidence-Aware Dynamic Evidence Reasoning) معرفی کردند که به مدلهای بینایی-زبانی کمک میکند تا ویدیوهای طولانی را…
-
🎥 کنترل کامل روی دوربین؛ معرفی مدل هوشمند CameraAnything! 🎬
محققان در یک دستاورد جدید، چارچوبی به نام «CameraAnything» را معرفی کردهاند که دنیای ادیت ویدیو را متحول میکند. این مدل اجازه میدهد بدون…
-
🚀 تحولی در تشخیص و ردیابی اشیاء در ویدیوها: معرفی مدل QueenVIS
محققان در یک دستاورد جدید، مدل «QueenVIS» را برای بهبود «بخشبندی نمونههای ویدیویی» (VIS) معرفی کردهاند. این مدل با رفع چالش «کیفیت کوئریهای شیء»،…
-
🚀 هوش مصنوعی در برابر چالشهای دنیای واقعی: معرفی فریمورک TADD
مدلهای یادگیری عمیق در محیطهای آزمایشگاهی عالی عمل میکنند، اما وقتی با شرایط واقعی و تغییر توزیع دادهها (Distribution Shift) روبرو میشوند، کاراییشان افت…
-
🔍 پایانِ «توهماتِ ارجاعی» در مدلهای بینایی-زبانی! 📄
محققان در یک پژوهش جدید، راهکار هوشمندانهای برای درک دقیقتر اسناد بصری (Visual Document Understanding) ارائه کردهاند. مشکل اصلی مدلهای فعلی این بود که…
-
🚀 ارتقای هوش مصنوعی مولد با معماری خلاقانه MMOE!
محققان به تازگی مدل جدیدی به نام «MMOE» (ModernMOE) را معرفی کردهاند که تحولی در بهرهوری مدلهای دیفیوژن (Diffusion Transformers) ایجاد میکند. این مدل…
-
🧠 هوش مصنوعی با قابلیت مدیریت دادههای ناقص! 🧩
آیا هوش مصنوعی میتواند وقتی بخشی از اطلاعاتش را از دست میدهد، باز هم درست عمل کند؟ محققان در یک مقاله جدید، راهکار هوشمندانهای…