محققان به تازگی اولین بنچمارک جامع برای روشهای «تولیدگر» (Generative) در تشخیص اصوات محیطی را معرفی کردهاند. این پژوهش با بررسی مدلهایی مثل Diffusion و GAN، سعی دارد شکاف بین دادههای آموزشی و صداهای ناشناخته را با استفاده از یادگیری صفر-شات (Zero-Shot) پر کند.
در این مطالعه، مدل جدیدی به نام CGDN معرفی شده که در مقایسه با روشهای مشابه، دقت بالاتری در طبقهبندی صداهای شهری و محیطی نشان داده است. این یعنی هوش مصنوعی در درک دنیای اطراف ما (از طریق شنیدن!) هر روز دقیقتر و هوشمندتر میشود. 🔊🤖
منبع: arXiv Machine Learning
