🚀 جهشی جدید در آموزش مدل‌های چندوجهی با تکنیک OPOD

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تکنولوژی‌های چندوجهی (Omni-modal) که همزمان متن، تصویر و صوت را درک می‌کنند، حالا با یک متد جدید به نام OPOD (On-Policy Omni Distillation) هوشمندتر شده‌اند.

این مدل چالش «رقابت معلمان» را حل کرده است؛ به این معنا که در هنگام آموزش، به جای سردرگمی مدل از آموزش‌های متناقض، خروجی‌های هوش مصنوعی به متخصصِ مرتبط (متنی، تصویری یا صوتی) ارجاع داده می‌شود. نتیجه؟ مدل‌هایی با دقت بسیار بالاتر که در دوازده بنچمارک مختلف، تمام رقبای فعلی خود را پشت سر گذاشته‌اند. گامی بزرگ به سوی مدل‌های Omni-modal قدرتمندتر و دقیق‌تر! 🤖✨

منبع: arXiv AI