🔍 چرا ترنسفورمرها در یادگیری با داده‌های کم (Few-Shot) دچار چالش می‌شوند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مطالعه‌ای جدید و دقیق، به سراغ کالبدشکافی «مدل‌های ترنسفورمر کوچک» رفته‌اند تا بفهمند مسیرهای ورودی اطلاعات (Input Pathways) چه تأثیری بر توانایی استدلال مدل‌ها دارند.

نکته جالب اینجاست که این مدل‌ها در یادگیری صفر-شات (Zero-Shot) برای ترکیب مفاهیم با شکست مواجه می‌شوند، اما در محیط‌های Few-Shot، کارایی آن‌ها کاملاً به نحوه ارائه داده‌ها و «خوانایی» کدها بستگی دارد. این پژوهش گام مهمی برای درک محدودیت‌های ذاتی ترنسفورمرها و بهینه‌سازی معماری آن‌ها در آینده است.

اگر به مباحث فنی و عمیق هوش مصنوعی علاقه دارید، این مطالعه جزئیات جذابی از نحوه «فکر کردن» مدل‌ها به شما ارائه می‌دهد! 💡

منبع: arXiv AI