🔍 رازِ درونیِ مدل‌های زبانی: چرا تغییرات در ترنسفورمرها همیشه طبق پیش‌بینی نیست؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

دانشمندان به تازگی در یک پژوهش فنی و عمیق، رفتارهای «داخلی» مدل‌های ترنسفورمر (مثل مدل‌های زبانی بزرگ) را زیر ذره‌بین برده‌اند. این مطالعه نشان می‌دهد که اگرچه می‌توان اثرِ تغییراتِ کوچک در وزن‌های مدل را تا حدی پیش‌بینی کرد، اما وقتی پای «ترکیب تغییرات» یا اصلاحاتِ همزمان به میان می‌آید، مدل‌ها رفتاری بسیار شکننده و غیرقابل‌ پیش‌بینی از خود نشان می‌دهند!

این یافته‌ها نشان می‌دهد که برخلاف تصور قبلی، نمی‌توان به‌سادگی و بدون دردسر، چندین «آپدیت» یا قابلیت مختلف را با هم در دلِ یک مدل ادغام کرد؛ چرا که ساختارِ زیربنایی مدل به سرعت دچار تداخل و بهم‌ریختگی می‌شود. این پژوهش گام مهمی برای درک محدودیت‌های فعلی در روش‌های «تطبیق‌دهی وظایف» (Task Adaptation) است. 🧠💻

منبع: arXiv AI