محققان در مقاله جدیدی به سراغ مفهوم «Cramming» یا فشردهسازی توکنها در مدلهای زبانی رفتهاند. آنها با روشی به نام «Progressive Cramming» بررسی کردهاند که وقتی توکنها را به شکل فشرده به مدل میدهیم، چه اتفاقی میافتد.
نتایج جالب است: حتی اگر بازسازی توکنها با دقت بسیار بالا انجام شود، مدل در وظایف تولیدی (Generative) دچار افت شدید کیفیت میشود. این یعنی «بازسازی دقیق» توکنها همیشه به معنای انتقال معنای واقعی برای مدل نیست و بیشتر شبیه به یک ترفند سطحی است تا درک عمیق دادهها.
این تحقیق گامی مهم برای درک محدودیتهای حافظه در مدلهای هوش مصنوعی و بهبود روشهای فشردهسازی برای مدلهای آینده است. 🚀
منبع: arXiv NLP
