تحقیقات جدید نشان میدهد که «سلسلهمراتب دستورالعملها» (Instruction Hierarchy) در مدلهای زبانی بزرگ، بسته به زبانی که با آن صحبت میکنیم، رفتارهای متفاوتی نشان میدهد!
محققان با معرفی بنچمارک جدیدی به نام «XIH-Bench» متوجه شدند که:
۱. مدلها در برخی زبانها در اجرای دستورات اولویتدار دقیقتر هستند و در برخی دیگر دچار سردرگمی میشوند.
۲. پدیدهای به نام «اثر مرز زبانی» باعث میشود مدلها در مواجهه با تداخلهای بینزبانی، واکنشهای امنیتی متفاوت و گاهی ضعیفتری نسبت به تکزبانی داشته باشند.
این یافتهها نشان میدهد که برای توسعه مدلهای جهانی و امن، نباید فقط روی زبان انگلیسی تمرکز کرد!
منبع: arXiv NLP


