🔍 آیا «توجه» (Attention) در مدل‌های زبانی همیشه حقیقت را می‌گوید؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تحقیقات جدید arXiv نشان می‌دهد که تکیه صرف به الگوهای Attention در ترنسفورمرها ممکن است گمراه‌کننده باشد! محققان دریافتند که مدل‌ها گاهی به حقایق قدیمی یا نامربوط «توجه» می‌کنند، در حالی که پاسخ صحیح را بر اساس اطلاعات دیگری می‌دهند.

نکته کلیدی این مقاله این است که آموزش مدل‌ها با استفاده از «شواهد علی» (Causal Evidence) به جای کپی‌برداری از توجهِ معلمان (Dense Teacher)، می‌تواند دقت مدل‌ها را در تحلیل‌های چندمرحله‌ای به‌طور چشمگیری (از ۴۱٪ به ۹۹٪!) افزایش دهد. این یعنی راهکاری جدید برای هوشمندتر و دقیق‌تر کردن مدل‌های آینده بدون نیاز به برچسب‌گذاری انسانی.

منبع: arXiv Machine Learning