محققان در دستاورد جدیدی تحت عنوان «Fusion Embedding»، گام بزرگی برای متحد کردن دنیای دادهها برداشتهاند. تا پیش از این، اکثر مدلها یا روی تصویر و متن متمرکز بودند یا متخصصِ صوت؛ اما این متد جدید با افزودن قابلیت درک صوت به مدلهای بینایی-زبانیِ از پیش آموزشدیده، امکان جستجوی یکپارچه بین متن، تصویر، ویدیو و صوت را فراهم میکند.
ویژگی جذاب این فناوری این است که برای آموزش آن تنها به یک GPU و چند ساعت زمان نیاز است و نیازی به دادههای آموزشی جفتشده صوت-تصویر ندارد. این یعنی با این روش، هوش مصنوعی میتواند ارتباط بین صدا و تصویر را به صورت خودکار درک کند! 🧠✨
این نوآوری مسیر جدیدی برای ساخت مدلهای مولتیمودال هوشمندتر و کارآمدتر باز کرده است.
منبع: arXiv NLP
