محققان در مطالعهای جدید، فرض مرسوم در دنیای هوش مصنوعی را به چالش کشیدهاند: اینکه مدلهای زبانی فقط باید متن بخوانند! 📖✨
در این تحقیق جذاب، ثابت شده که مدلهای زبانی اگر به جای تبدیل اسناد به متن ساده، مستقیماً «تصویرِ» اسناد، جداول و فرمولها را پردازش کنند (Visual Pretraining)، هوش و درک بسیار عمیقتری پیدا میکنند. این روش نه تنها دقیقتر است، بلکه یک مسیر کارآمدتر برای ساخت هوش مصنوعی قدرتمندتر به شمار میرود. به نظر میرسد مدلهای آینده بیش از آنکه فقط «بخوانند»، باید «ببینند» تا بفهمند! 👁️🗨️💡
منبع: arXiv AI
