تکنولوژیهای چندوجهی (Omni-modal) که همزمان متن، تصویر و صوت را درک میکنند، حالا با یک متد جدید به نام OPOD (On-Policy Omni Distillation) هوشمندتر شدهاند.
این مدل چالش «رقابت معلمان» را حل کرده است؛ به این معنا که در هنگام آموزش، به جای سردرگمی مدل از آموزشهای متناقض، خروجیهای هوش مصنوعی به متخصصِ مرتبط (متنی، تصویری یا صوتی) ارجاع داده میشود. نتیجه؟ مدلهایی با دقت بسیار بالاتر که در دوازده بنچمارک مختلف، تمام رقبای فعلی خود را پشت سر گذاشتهاند. گامی بزرگ به سوی مدلهای Omni-modal قدرتمندتر و دقیقتر! 🤖✨
منبع: arXiv AI
