تحقیقات جدید arXiv نشان میدهد که تکیه صرف به الگوهای Attention در ترنسفورمرها ممکن است گمراهکننده باشد! محققان دریافتند که مدلها گاهی به حقایق قدیمی یا نامربوط «توجه» میکنند، در حالی که پاسخ صحیح را بر اساس اطلاعات دیگری میدهند.
نکته کلیدی این مقاله این است که آموزش مدلها با استفاده از «شواهد علی» (Causal Evidence) به جای کپیبرداری از توجهِ معلمان (Dense Teacher)، میتواند دقت مدلها را در تحلیلهای چندمرحلهای بهطور چشمگیری (از ۴۱٪ به ۹۹٪!) افزایش دهد. این یعنی راهکاری جدید برای هوشمندتر و دقیقتر کردن مدلهای آینده بدون نیاز به برچسبگذاری انسانی.
منبع: arXiv Machine Learning
