محققان در مقالهای جدید به بررسی چگونگی آموزش مدلهای هوش مصنوعی «چندوجهی» (Multimodal) از ابتدا پرداختهاند. برخلاف مدلهای قدیمی که ابتدا زبان را یاد میگرفتند و بعد تصویر، این روش جدید با ادغام عمیق دادههای بصری و متنی، درک بسیار دقیقتری از جهان فیزیکی ایجاد میکند.
نکته کلیدی این تحقیق، کشف «قانون محاسباتی» برای مدلهای چندوجهی است؛ یعنی دانشمندان اکنون میدانند برای داشتن بهترین عملکرد، چه مقدار مدل را بزرگ کنند و چه تعداد توکن برای آموزش به آن بدهند. این یعنی در آینده شاهد مدلهای هوشمندتر با بهینهترین مصرف انرژی خواهیم بود! ⚡️
منبع: arXiv Computer Vision
