یکی از بزرگترین نگرانیها درباره هوش مصنوعی، رفتارهای غیرقابلپیشبینی در شرایط حساس است. محققان به تازگی بنچمارک جدیدی به نام «RiskAverseOOD» معرفی کردهاند که بررسی میکند آیا میتوان مدلهای زبانی را طوری آموزش داد که حتی در شرایط فوقالعاده حساس و پرریسک، همچنان محتاط و منطقی باقی بمانند؟
نتایج آزمایشها روی مدلهای قدرتمندی مثل Qwen و Llama نشان میدهد که این استراتژیهای محافظهکارانه، حتی در مواجهه با موقعیتهایی که ۹۸ برابر از محیط آموزش آنها متفاوتتر هستند، تا حد زیادی کارساز است. این یعنی یک قدم بزرگ به سمت هوش مصنوعی «ایمنتر» که به جای رفتارهای پرخطر، همکاری و امنیت را انتخاب میکند. 🤖💡
منبع: arXiv AI
