محققان در مطالعهای جدید، بنچمارک ویژهای به نام «FinBench» را طراحی کردهاند که تمرکز آن بر ارزیابی دقت مدلهای هوش مصنوعی (LLMs) در پیشبینیهای مالی است.
چرا این خبر مهم است؟
مدلهای زبانی اغلب دچار «شکاف اعتماد به نفس و شایستگی» هستند؛ یعنی ممکن است بیش از حد به پیشبینیهای خود اطمینان داشته باشند، در حالی که در واقعیت عملکرد ضعیفی دارند. FinBench با استفاده از قوانین احتمالی سختگیرانه، مدلها را در شرایط واقعی بازار و با محدودیتهای زمانی ارزیابی میکند تا از خطرات احتمالی در معاملات جلوگیری کند.
این ابزار به متخصصان کمک میکند تا بفهمند مدلهای هوش مصنوعی تا چه حد در تصمیمگیریهای حساس مالی قابل اعتماد هستند.
منبع: arXiv Machine Learning
