محققان در مقاله جدیدی با معرفی ابزار «Hindcast»، چالشی بزرگ در ارزیابی مدلهای زبانی (LLM) را شناسایی کردند. مشکل اینجاست که مدلها هنگام پیشبینی رویدادهای گذشته، اغلب به اطلاعاتی دسترسی دارند که در زمان واقعی وجود نداشتهاند (مثل خواندن گزارشهای پس از حادثه!).
ابزار Hindcast با ایجاد یک «محیط ایزوله زمانی»، اجازه نمیدهد مدل به دیتای آینده دسترسی داشته باشد و فقط بر اساس اطلاعات موجود در لحظه، قدرت پیشبینی مدل را میسنجد. این گام بزرگی برای رسیدن به هوش مصنوعی واقعبینتر و دقیقتر است. ✨
منبع: arXiv NLP
