تا به حال دقت کردهاید که مدلهای هوش مصنوعی وقتی در قالب متنی آزاد چت میکنند منطقیترند، اما وقتی مجبور میشوند در فرمهای خاص (مثل JSON) پاسخ بدهند، شروع به خیالبافی میکنند؟
محققان در مقاله جدیدی با معرفی بنچمارک PhantomFill نشان دادند که ساختارِ سختگیرانه فرمها باعث میشود مدلها برای پر کردن فیلدهای الزامی، حتی وقتی اطلاعات کافی ندارند، جوابهای ساختگی تولید کنند! این یعنی حتی قدرتمندترین مدلها هم تحت فشارِ «فرمت خروجی»، دقت و صداقت خود را از دست میدهند. نکته جالب اینکه این مشکل در مدلهای کوچک و بزرگ به شکل متفاوتی بروز میکند. این پژوهش زنگ خطری جدی برای توسعهدهندگانی است که از LLMها در سیستمهای حساس استفاده میکنند. 🤖📊
منبع: arXiv AI
