محققان روش نوآورانهای به نام «Bootleg» معرفی کردهاند که شکاف بین مدلهای مولد (مانند MAE) و مدلهای پیشبینیکننده (مانند I-JEPA) را پر میکند. برخلاف روشهای قدیمی که فقط روی لایه نهایی تمرکز دارند، Bootleg با پیشبینی بازنماییهای نهفته از چندین لایه میانیِ مدلِ معلم، به درک عمیقتری از مفاهیم دست مییابد.
نتایج فوقالعاده است: ۱۰٪ عملکرد بهتر در بنچمارکهای سخت مثل ImageNet و وظایف پیچیدهای مثل قطعهبندی معنایی (Semantic Segmentation). این یعنی هوش مصنوعی در آینده، تصاویر را بسیار دقیقتر و مفهومیتر درک خواهد کرد! 🧠✨
منبع: arXiv Computer Vision
