دسته: مقالات علمی
جدیدترین مقالات دانشگاهی، تئوریهای یادگیری ماشین، پردازش تصویر و زبان طبیعی از مرجع معتبر arXiv.
-
🚀 جهش در کیفیت تولید تصویر با مدل جدید SuperFlow! 🎨
دنیای مدلهای تولید تصویر (Text-to-Image) روز به روز در حال پیشرفت است. محققان به تازگی فریمورک جدیدی به نام «SuperFlow» معرفی کردهاند که یادگیری…
-
🎨 خلق احساسات در دنیای واقعیت مجازی با EmoSpace! 🤖✨
محققان در تازهترین دستاورد خود، چارچوب جدیدی به نام EmoSpace معرفی کردهاند که دنیای تولید تصویر را متحول میکند. تا پیش از این، اکثر…
-
🚀 بهینهسازی مدلهای بینایی ماشین؛ معرفی روش QATMA برای تشخیص اشیاء با دقت بالا!
دانشمندان راهکار جدیدی به نام QATMA ارائه دادهاند که به طور خاص برای مدلهای «تشخیص اشیاء با دایره واژگان باز» (Open-Vocabulary Object Detection) طراحی…
-
🌿 هوش مصنوعی در خدمت محیطزیست: چالشهای شناسایی گونهها در دوربینهای تلهای! 📸
محققان در مطالعهای جدید به سراغ یکی از چالشهای بزرگ در حفاظت از تنوعزیستی رفتهاند. اگرچه هوش مصنوعی ابزاری قدرتمند برای نظارت بر حیوانات…
-
🚀 تحولی در کارایی مدلهای بصری: معرفی معماری ELT!
محققان در تازهترین دستاورد خود، مدل جدیدی به نام «ترنسفورمرهای حلقوی الاستیک» (ELT) را معرفی کردهاند که انقلابی در بهینهسازی مدلهای مولد تصویر و…
-
🚀 بازسازی سهبعدی بدن انسان در لحظه با تکنیک Gaussian Splatting! 🕺
محققان در مقاله جدید خود از فریمورک «HumanGS» رونمایی کردهاند که تحولی در بازسازی و انیمیشنسازی سهبعدی انسان ایجاد میکند. این مدل برخلاف روشهای…
-
🚀 ترکیب مدلهای هوش مصنوعی؛ فراتر از طبقهبندی تصاویر!
ترکیب (Merging) چندین مدل که برای وظایف مختلف آموزش دیدهاند، همیشه یکی از چالشهای جذاب دنیای AI بوده است. اما تا امروز، بیشترِ تحقیقات…
-
👤 حرکات بدن آواتارها طبیعیتر میشود: معرفی PersonaGesture! 🤖
محققان در تازهترین دستاورد خود، مدل «PersonaGesture» را معرفی کردند که میتواند با دیدن تنها یک نمونه ویدئویی کوتاه از هر فرد، حرکات بدن…
-
🚀 نگاه هوش مصنوعی به جهان سه بعدی: معرفی مدل Cambrian-P!
دانشمندان با معرفی مدل جدید Cambrian-P، قدم بزرگی در درک بهتر ویدئوها توسط هوش مصنوعی برداشتهاند. تا به حال، اکثر مدلهای بینایی-زبانی (MLLMs) ویدئوها…
-
🚀 افزایش سرعت و بهرهوری مدلهای بینایی-زبانی با تکنیک ETC! 🖼️💬
یکی از چالشهای بزرگ مدلهای چندوجهی (VLMs)، حجم بسیار زیاد توکنهای تصویری است که باعث سنگین شدن محاسبات و مصرف زیاد حافظه (KV-cache) میشود.…