محققان در مطالعهای جدید و دقیق، به سراغ کالبدشکافی «مدلهای ترنسفورمر کوچک» رفتهاند تا بفهمند مسیرهای ورودی اطلاعات (Input Pathways) چه تأثیری بر توانایی استدلال مدلها دارند.
نکته جالب اینجاست که این مدلها در یادگیری صفر-شات (Zero-Shot) برای ترکیب مفاهیم با شکست مواجه میشوند، اما در محیطهای Few-Shot، کارایی آنها کاملاً به نحوه ارائه دادهها و «خوانایی» کدها بستگی دارد. این پژوهش گام مهمی برای درک محدودیتهای ذاتی ترنسفورمرها و بهینهسازی معماری آنها در آینده است.
اگر به مباحث فنی و عمیق هوش مصنوعی علاقه دارید، این مطالعه جزئیات جذابی از نحوه «فکر کردن» مدلها به شما ارائه میدهد! 💡
منبع: arXiv AI
