دانشمندان در مقاله جدیدی به سراغ کالبدشکافی لایههای توجه در مدلهای هوش مصنوعی رفتهاند. این تحقیق نشان میدهد که چگونه میتوان با استفاده از تحلیل طیفی (Spectral Diagnostics)، ظرفیت انتقال اطلاعات و جهتگیری جریان دادهها را در مدلهای LLM شناسایی کرد.
نکته کلیدی این پژوهش، کشف محدودیتهای روشهای فعلی در درک «جهتگیری» اطلاعات است. محققان با معرفی دو محور اصلی برای ارزیابی، مدلی ارائه دادهاند که نه تنها «ظرفیت» بلکه «نحوه حرکت» اطلاعات در مدل را نیز بهتر تحلیل میکند. این یافتهها به ما کمک میکند تا بفهمیم مدلها چگونه تصمیم میگیرند و چرا گاهی دچار خطا یا توهم (Hallucination) میشوند. 🧠🤖
منبع: arXiv Machine Learning
