🧠 آیا «تخریب توجه» در مدل‌های زبانی واقعاً یک ضعف است؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مطالعه‌ای جدید به سراغ بررسی عمیق ساختار Transformerها رفته‌اند تا بفهمند آیا پدیده‌ای به نام «تخریب توجه» (Attention Degradation) واقعاً باعث کاهش عملکرد مدل در بازیابی اطلاعات می‌شود یا خیر.

نتایج این تحقیق نشان می‌دهد که این الگوی تخریب، بیش از آنکه یک محدودیت جدی باشد، ماهیتی توصیفی دارد و تلاش‌ها برای اصلاح آن از طریق «لنگر انداختن روی توکن‌های تابعی» (Function Token Anchoring) در اکثر مدل‌های محبوب مثل GPT-2 و LLaMA، تأثیر چشمگیری بر بهبود عملکرد نداشته است.

این مقاله نشان می‌دهد که معماری مدل‌ها چقدر در پردازش فواصل دور متفاوت عمل می‌کنند و چالش‌های تفسیرپذیری LLMها همچنان پیچیده‌تر از تصور ماست! 🧐

منبع: arXiv AI