دسته: arXiv Computer Vision (cs.CV)
-
🚀 سرعت و دقت؛ ترکیب طلایی با مدل LaME برای جستجوی هوشمند!
محققان در مقالهای جدید، مدل «LaME» را معرفی کردند که دنیای Embeddingها (جاسازیهای چندوجهی) را متحول کرده است. تا پیش از این، استفاده از…
-
🔍 پایان توهمات هوش مصنوعی با استراتژی «BCEA»!
مدلهای بزرگ بینایی-زبانی (LVLMs) اغلب دچار توهم (Hallucination) میشوند و جزئیاتی را میسازند که در تصویر اصلی وجود ندارد. حالا محققان متد جدیدی به…
-
🎬 تحلیل هوشمند ویدیوهای طولانی با CoVStream؛ بهینهسازی در سطح لبه و ابر!
تا به حال به چالش تحلیل ویدیوهای طولانی در دستگاههای ضعیف فکر کردهاید؟ مدلهای فعلی یا با کمبود قدرت سختافزاری روبرو هستند یا پهنای…
-
🤖 تکامل خودکار در مدلهای ویدئویی؛ وقتی هوش مصنوعی یاد میگیرد دنیای اطرافش را بفهمد!
محققان به تازگی روی مفهومی به نام «تولید ویدئوی خودکار» (Autonomous Video Generation) کار کردهاند که هدفش فراتر از ساخت یک ویدئوی ساده است.…
-
💡 آیا مدلهای ادیت تصویر، فیزیک نور را میفهمند؟
محققان با معرفی بنچمارک جدیدی به نام «3DLP»، به بررسی درک واقعی مدلهای هوش مصنوعی از نورپردازی و سایهها پرداختهاند. تا پیش از این،…
-
📸 نگاهی ۳۶۰ درجه؛ چالشها و پیشرفتهای درک تصاویر پانوراما در هوش مصنوعی!
تصاویر پانوراما دنیای کاملتری از محیط را نسبت به لنزهای معمولی به ما نشان میدهند، اما به دلیل کروی بودن، با چالشهای هندسی پیچیدهای…
-
🔍 پایان دوران «جعبه سیاه» در تحلیل ترافیک شبکه؛ معرفی Traffic-CBM!
یکی از چالشهای بزرگ در امنیت شبکه و طبقهبندی ترافیک رمزنگاریشده، این است که مدلهای هوش مصنوعی معمولاً مثل یک «جعبه سیاه» عمل میکنند…
-
🎬 تحولی در ویدیوهای هوش مصنوعی؛ «Shell-LCC» و خداحافظی با پروسههای هزینهبر!
محققان در مقالهای جدید، راهکار هوشمندانهای برای بهبود کیفیت ویدیوهای تولید شده توسط مدلهای هوش مصنوعی (T2V) معرفی کردهاند. تا امروز، برای اینکه ویدیوها…
-
🎬 هوش مصنوعی و قدرت درک ویدیوهای طولانی؛ معرفی EFlow!
آیا تا به حال دقت کردید که مدلهای هوش مصنوعی هنگام تحلیل ویدیوهای طولانی چطور گیج میشوند؟ محققان با معرفی چارچوب جدید EFlow، این…
-
🔐 خداحافظی با رمز عبور؛ امضای هوایی در دنیای واقعیت مجازی!
آیا تا به حال به این فکر کردید که چطور در محیطهای VR یا AR بدون نیاز به کیبورد یا کنترلرهای پیچیده، هویت خود…