محققان در مقالهای جدید، نگاهی دقیق و متفاوت به نحوه عملکرد مدلهای ترنسفورمر (Causally Masked Transformers) انداختهاند. برخلاف باورهای رایج که بر محاسبات ایدهآل تکیه دارند، این پژوهش نشان میدهد که «دقت محدود» و نحوه گرد کردن اعداد در سختافزار، مستقیماً بر حافظه و توانایی استدلال مدل تاثیر میگذارد.
این مطالعه با ارائه یک چارچوب جبری جدید، توضیح میدهد که چطور هر لایه و هر مکانیزم توجه (Attention)، اطلاعات را پردازش و ذخیره میکند. در واقع، این تحقیق مرزهای جدیدی را برای درک قابلیتهای محاسباتی مدلهای زبانی در دنیای واقعی و تحت محدودیتهای سختافزاری ترسیم میکند.
منبع: arXiv:2607.26988
منبع: arXiv Machine Learning
